Summary
OpenAI released GeneBench-Pro on June 30, 2026 — a research-level benchmark with 129 problems across 10 computational biology domains testing whether AI agents can make judgment-heavy scientific decisions (research taste) rather than just execute predefined workflows. GPT-5.6 Sol achieves 28.7% pass rate (31.5% with Pro mode), up from below 5% on the original GeneBench when GPT-5 was tested. Human experts estimate 20–40 hours per problem. OpenAI is open-sourcing 10 representative questions on Hugging Face and providing a 50-question subset to Artificial Analysis for independent benchmarking.
Source Analysis
Primary: openai.com (June 30). Corroborated by Investing.com. Builds on April 2026 GeneBench v1 paper (103 problems).
Research Notes
Additional Sources Found
- 2026-06-30-openai-genebench-pro-biology-benchmark — OpenAI primary announcement
- 2026-06-30-genebench-pro-investing-corroboration — Investing.com with full score table
- GeneBench v1 paper (April 2026) — Sciety/bioRxiv preprint context
Key Facts Verified
| Claim | Status | Source |
|---|---|---|
| 129 problems, 10 domains | ✓ Confirmed | OpenAI, Investing.com |
| GPT-5.6 Sol 28.7% / 31.5% Pro | ✓ Self-reported | OpenAI |
| GPT-5 below 5% baseline | ✓ Confirmed | OpenAI |
| 82/129 expert-reviewed for realism | ✓ Confirmed | Investing.com |
| 20–40 hours human expert estimate | ✓ Confirmed | OpenAI |
| 10 questions open-sourced | ✓ Confirmed | OpenAI |
| 50-question subset to Artificial Analysis | ✓ Confirmed | OpenAI |
Competitor Scores (OpenAI-reported, June 30)
| Model | Pass Rate |
|---|---|
| GPT-5.6 Sol (Pro) | 31.5% |
| GPT-5.6 Sol | 28.7% |
| Opus 4.8 | 16.0% |
| Gemini 3.5 Flash | 8.1% |
| Gemini 3.1 Pro | 3.1% |
| Grok 4.3 | 1.5% |
Benchmark scores are OpenAI self-reported. Independent validation pending via Artificial Analysis 50-question subset.
Broader Context
“Research taste” — chains of judgment calls (data exploration, model selection, iterative correction) — as next evaluation frontier beyond knowledge retrieval and single-step pipelines. Relevant to automated-research and long-horizon-agents themes. Cost asymmetry: ~8K human labor vs. several dollars inference per problem.
Related Wiki Pages
Editorial Notes
Approved angle: “Research taste” — AI değerlendirmesinin yeni sınırı: bilgi erişimi ve tek adımlı pipeline’ların ötesinde, judgment-heavy bilimsel karar zincirleri.
Format: standard (600–800 kelime).
Reporting instructions:
- 129 problem, 10 domain, GPT-5.6 Sol %28.7 (%31.5 Pro) vs. GPT-5 <%5 baseline
- Self-reported skorlar uyarısı — Artificial Analysis 50-soru subset bekleniyor
- 20–40 saat insan uzmanı vs. birkaç dolar inference maliyet asimetrisi
- Hugging Face’de 10 açık soru
- Rakip skorları tablo halinde, OpenAI self-reported notuyla
Headline suggestions (TR):
- “OpenAI GeneBench-Pro: AI’ın bilimsel ‘research taste’ yeteneğini ölçen yeni benchmark”
- “GPT-5.6, biyoloji araştırmasında %28.7 başarı — yargı ağırlıklı AI benchmark’u yayınlandı”
Must-include points:
- Research taste tanımı ve neden önemli
- 82/129 soru dış uzman incelemesinden geçti
- Computational biology’de judgment-heavy analiz gereksinimi
- Benchmark saturation riski (yıl sonuna kadar) — OpenAI iddiası, caveat ile
Draft Article
Draft Article
OpenAI GeneBench-Pro: AI’ın Bilimsel ‘Research Taste’ Yeteneğini Ölçen Yeni Benchmark
openai, 30 Haziran 2026’da GeneBench-Pro’yu duyurdu — computational biology alanında AI agent’larının önceden tanımlanmış workflow’ları yürütmekten öte, yargı ağırlıklı (judgment-heavy) bilimsel kararlar alıp alamadığını ölçen araştırma düzeyinde bir benchmark. gpt-56 Sol modeli %28.7 başarı oranına ulaştı (Pro mode ile %31.5); orijinal GeneBench’te GPT-5’in %5’in altında kaldığı baseline’a kıyasla belirgin bir sıçrama.
Ana Gelişme
GeneBench-Pro, 10 domain ve 21 alt-domain’de 129 problem içeriyor. Her problem, gerçekçi ve dağınık bir veri seti, kısa deneysel bağlam ve downstream karara bağlı bir hedef estimand sunuyor. Modelin doğru yanıt verebilmesi için veriyi keşfetmesi, uygun analitik yaklaşımı seçmesi, iteratif deneme sürecine girmesi ve nihai cevabı sunması gerekiyor.
openai “research taste” kavramını şöyle tanımlıyor: bir analizi şekillendiren yargı zincirleri — verinin hangi soruları destekleyebileceği, erken diagnostiklerin modeli nasıl değiştirmesi gerektiği ve ilk planın ne zaman revize edilmesi gerektiği.
129 sorunun 82’si dış domain uzmanlarına — lisansüstü öğrenciler, postdoktoral araştırmacılar, endüstri bilimcileri ve profesörler — gönderildi. UCLA İnsan Genetiği Yardımcı Doçenti Alexander Strudwick Young: “İncelediğim problemler, deneyimli bir süpervizörden iteratif geri bildirim olmadan bir lisansüstü öğrenci için bile zorlayıcı olurdu.”
Neden Önemli?
AI değerlendirmesinin sınırı bilgi erişimi ve tek adımlı pipeline’ların ötesine taşınıyor. automated-research ve long-horizon-agents tartışmalarında “research taste”, deneyimli araştırmacıların sezgisel analiz seçimi, veri varsayımlarını çürüttüğünde iterasyon ve downstream kararlara dayanak oluşturma yeteneklerini kapsıyor.
Maliyet asimetrisi dikkat çekici: insan uzmanları tipik bir problem için 20–40 saat harcıyor; saatlik 200 dolar varsayımıyla bu binlerce dolarlık işgücü maliyeti anlamına geliyor. Inference maliyeti ise problem başına yalnızca birkaç dolar.
pharma-ai ve translational medicine alanlarında bu yeteneklerin ölçülmesi, AI’ın bilimsel karar destek sistemlerindeki rolünü yeniden çerçeveliyor.
Teknik Detaylar
Her GeneBench-Pro problemi izole bir workspace’te çözülüyor: kısa prompt, veri dosyaları ve Python, bilimsel computing kütüphaneleri ile PLINK 2.0 gibi genomik paketlerden oluşan standart bir bioinformatics stack.
Problemler sentetik olarak inşa edildi — openai tam nedensel yapıyı biliyor ve veri üretim sürecini doğrudan simüle ediyor. Bu, karmaşıklığı ayarlamayı ve deterministik grading’i mümkün kılıyor.
Warning
Aşağıdaki skorlar openai tarafından self-reported olarak paylaşılmıştır. Bağımsız doğrulama, Artificial Analysis’e sağlanan 50 soruluk subset üzerinden bekleniyor.
| Model | Başarı Oranı |
|---|---|
| GPT-5.6 Sol (Pro) | %31.5 |
| GPT-5.6 Sol | %28.7 |
| Opus 4.8 | %16.0 |
| Gemini 3.5 Flash | %8.1 |
| Gemini 3.1 Pro | %3.1 |
| Grok 4.3 | %1.5 |
openai, Hugging Face’de 10 temsilci soruyu tamamen açık kaynak olarak yayınladı. Mevcut hızla benchmark yıl sonuna kadar saturate olabilir — bu iddia şirketin kendi değerlendirmesine dayanıyor.
Bağlam
Nisan 2026’daki GeneBench v1 (103 problem) üzerine inşa edilen GeneBench-Pro, ai-benchmarks ekosisteminde yeni bir değerlendirme boyutu açıyor. Rakip modeller en iyi hallerinde, kendi çıkış zamanlarındaki karşılık gelen GPT modelinin performansına denk kaldı — gpt-56’nın sıçraması bu tabloda belirgin şekilde öne çıkıyor.
Sonraki Adımlar
Artificial Analysis’in 50 soruluk bağımsız subset değerlendirmesi, self-reported skorların doğrulanması açısından kritik olacak. openai’ın benchmark saturation iddiası, gelecek nesil modellerin bu tür judgment-heavy görevlerde ne kadar hızlı ilerleyeceğini test edecek.