OpenAI GeneBench-Pro: AI’ın Bilimsel ‘Research Taste’ Yeteneğini Ölçen Yeni Benchmark

openai, 30 Haziran 2026’da GeneBench-Pro’yu duyurdu — computational biology alanında AI agent’larının önceden tanımlanmış workflow’ları yürütmekten öte, yargı ağırlıklı (judgment-heavy) bilimsel kararlar alıp alamadığını ölçen araştırma düzeyinde bir benchmark. gpt-56 Sol modeli %28.7 başarı oranına ulaştı (Pro mode ile %31.5); orijinal GeneBench’te GPT-5’in %5’in altında kaldığı baseline’a kıyasla belirgin bir sıçrama.

Ana Gelişme

GeneBench-Pro, 10 domain ve 21 alt-domain’de 129 problem içeriyor. Her problem, gerçekçi ve dağınık bir veri seti, kısa deneysel bağlam ve downstream karara bağlı bir hedef estimand sunuyor. Modelin doğru yanıt verebilmesi için veriyi keşfetmesi, uygun analitik yaklaşımı seçmesi, iteratif deneme sürecine girmesi ve nihai cevabı sunması gerekiyor.

openai “research taste” kavramını şöyle tanımlıyor: bir analizi şekillendiren yargı zincirleri — verinin hangi soruları destekleyebileceği, erken diagnostiklerin modeli nasıl değiştirmesi gerektiği ve ilk planın ne zaman revize edilmesi gerektiği.

129 sorunun 82’si dış domain uzmanlarına — lisansüstü öğrenciler, postdoktoral araştırmacılar, endüstri bilimcileri ve profesörler — gönderildi. UCLA İnsan Genetiği Yardımcı Doçenti Alexander Strudwick Young: “İncelediğim problemler, deneyimli bir süpervizörden iteratif geri bildirim olmadan bir lisansüstü öğrenci için bile zorlayıcı olurdu.”

Neden Önemli?

AI değerlendirmesinin sınırı bilgi erişimi ve tek adımlı pipeline’ların ötesine taşınıyor. automated-research ve long-horizon-agents tartışmalarında “research taste”, deneyimli araştırmacıların sezgisel analiz seçimi, veri varsayımlarını çürüttüğünde iterasyon ve downstream kararlara dayanak oluşturma yeteneklerini kapsıyor.

Maliyet asimetrisi dikkat çekici: insan uzmanları tipik bir problem için 20–40 saat harcıyor; saatlik 200 dolar varsayımıyla bu binlerce dolarlık işgücü maliyeti anlamına geliyor. Inference maliyeti ise problem başına yalnızca birkaç dolar.

pharma-ai ve translational medicine alanlarında bu yeteneklerin ölçülmesi, AI’ın bilimsel karar destek sistemlerindeki rolünü yeniden çerçeveliyor.

Teknik Detaylar

Her GeneBench-Pro problemi izole bir workspace’te çözülüyor: kısa prompt, veri dosyaları ve Python, bilimsel computing kütüphaneleri ile PLINK 2.0 gibi genomik paketlerden oluşan standart bir bioinformatics stack.

Problemler sentetik olarak inşa edildi — openai tam nedensel yapıyı biliyor ve veri üretim sürecini doğrudan simüle ediyor. Bu, karmaşıklığı ayarlamayı ve deterministik grading’i mümkün kılıyor.

Warning

Aşağıdaki skorlar openai tarafından self-reported olarak paylaşılmıştır. Bağımsız doğrulama, Artificial Analysis’e sağlanan 50 soruluk subset üzerinden bekleniyor.

ModelBaşarı Oranı
GPT-5.6 Sol (Pro)%31.5
GPT-5.6 Sol%28.7
Opus 4.8%16.0
Gemini 3.5 Flash%8.1
Gemini 3.1 Pro%3.1
Grok 4.3%1.5

openai, Hugging Face’de 10 temsilci soruyu tamamen açık kaynak olarak yayınladı. Mevcut hızla benchmark yıl sonuna kadar saturate olabilir — bu iddia şirketin kendi değerlendirmesine dayanıyor.

Bağlam

Nisan 2026’daki GeneBench v1 (103 problem) üzerine inşa edilen GeneBench-Pro, ai-benchmarks ekosisteminde yeni bir değerlendirme boyutu açıyor. Rakip modeller en iyi hallerinde, kendi çıkış zamanlarındaki karşılık gelen GPT modelinin performansına denk kaldı — gpt-56’nın sıçraması bu tabloda belirgin şekilde öne çıkıyor.

Sonraki Adımlar

Artificial Analysis’in 50 soruluk bağımsız subset değerlendirmesi, self-reported skorların doğrulanması açısından kritik olacak. openai’ın benchmark saturation iddiası, gelecek nesil modellerin bu tür judgment-heavy görevlerde ne kadar hızlı ilerleyeceğini test edecek.


Kaynaklar