生技公司、醫院研究中心或公衛團隊評估生科 AI 時,最容易出錯的是「模型看起來很懂」:它能整理論文、跑一段分析、提出候選假說,卻在資料品質、控制組、統計假設或臨床風險上錯過關鍵一步。這種錯不一定會在漂亮摘要裡出現,最後可能變成多跑一輪濕實驗、誤排候選標的,或讓不能自動化的判斷被送進正式研究流程。
OpenAI 6 月底公布 GeneBench-Pro,讓生科 AI 評測多了一個更硬的問題:不能只驗收「會不會回答」,還要驗收「會不會判斷資料能支持什麼決定」。如果正在試用生科模型,先不要急著把它接到實驗或病患資料;比較安全的下一步,是選 20–50 個低風險真實任務,要求模型留下分析路徑、程式碼、資料版本、失敗假設與專家覆核紀錄,再決定哪些任務可以擴大使用。
GeneBench-Pro 把焦點拉到研究判斷
GeneBench-Pro 是 OpenAI 新公布的 research-level benchmark,目標是測模型在 computational biology 中處理「判斷很重」的任務。OpenAI 說它擴展自 GeneBench,涵蓋 genomics、quantitative biology、translational medicine 等情境,共 129 題、10 個 domains、21 個 sub-domains。
這類題目離一般知識題很遠。每題會給模型一組接近真實研究的雜亂資料、簡短實驗脈絡,以及一個和下游決策有關的 target estimand。模型要找答案,也要先判斷資料能回答哪些問題、早期診斷結果是否推翻原本假設、應該用哪條分析路徑,以及什麼時候可以把結果交給下一個決策者。
OpenAI 把這種能力稱為 research taste。這個詞不適合被拿來當行銷口號;對研究團隊比較有用的翻譯是:模型是否知道何時該停下來、重跑、改模型、換估計量,或承認資料不足。這也是許多團隊試用 AI 研究助理時最難從單次 demo 看出的能力。
為什麼 GeneBench-Pro 和 LifeSciBench 要一起看?
LifeSciBench 先把生科 AI 評估從單題問答拉到研究任務、附件、專家評分規準與實用判斷。OpenAI 先前公布的 LifeSciBench 包含 750 個專家撰寫任務、1,062 個任務附件、173 位科學貢獻者、19,020 條評分規準與 453 位獨立審查者;GPT-Rosalind 在完整通過率、科學溝通、轉譯判斷與限制處理上比 GPT-5.5 進步,但附件密集、數值、序列與結構輸出仍是弱項。
GeneBench-Pro 則往另一個方向補強:它把題目做成合成資料,讓出題者知道完整 causal structure 和資料生成過程,因此可以用較明確的目標答案做 deterministic grading。OpenAI 也說,題目會透過 ablation studies 檢查錯誤分析是否真的失敗,並以 trace analysis 查資訊外洩或意外捷徑;129 題中的 82 題送給外部領域專家評估 realism、target answer 是否可辨識,以及方法和 estimator 是否合適。
兩者合起來,比單看任何一個跑分更接近實務:LifeSciBench 看模型能否處理專家任務與附件,GeneBench-Pro 看模型在資料和假設不乾淨時是否會選對分析方法。若採購或研究合作只問「某模型在某榜單幾分」,仍然會漏掉最容易出事的地方。
OpenAI 公布的分數該怎麼讀?
OpenAI 說 GPT-5.6 Sol 在 GeneBench-Pro 最高 reasoning level 的 pass rate 是 28.7%,開啟 Pro mode 後是 31.5%;而原始 GeneBench 建構初期,當時最強的 GPT-5 低於 5%。這代表前沿模型在高階科學推理上進步很快,也代表現階段仍有將近三分之二的問題沒有完整解出。
採用時還要分清楚可用性。截至 2026-07-03,OpenAI models 頁只把 GPT-5.6 列為 select trusted partners preview,latest-model guide 仍以 GPT-5.5 為主;一般研究團隊不應把這些分數解讀成 GPT-5.6 Sol 已經可以直接接進日常研究流程。
另一個值得放進成本評估的數字是人類專家時間。OpenAI 表示,評審估計典型 GeneBench-Pro 問題需要人類專家約 20–40 小時完成;若用每小時 200 美元估算,一題的人力成本可能達數千美元。模型推論成本只有數美元等級,所以即使只是部分自動化,也可能有研究和商業價值。
這仍然離「AI 獨立負責研究決策」很遠。比較穩的讀法是:生科 AI 正在變成可用的研究助理候選人,尤其適合協助整理證據、探索分析路徑、產生候選假說與準備專家審查材料;它還不適合在沒有 trace、沒有專家覆核、沒有資料治理的情況下,直接決定藥物標的、病患分層、合成條件或高風險生物用途。
AI 化學家案例提醒:實驗驗證仍是分界線
同一批 OpenAI 生科消息裡,AI 化學家實驗也很值得一起看。OpenAI 與 Molecule.one 合作,把 GPT-5.4 接到 Maria 這類高通量化學實驗系統,讓模型提出並測試改善 Chan–Lam coupling 的方案。OpenAI 公布 Maria Lab 在 OAI-M1-03 中跑了 10,080 個反應;在最佳化條件下,88% 的 boronic acids 與 83% 的 sulfonamides 測試組合收率改善,平均收率從 16.6% 提高到 25.2%。
這些數字說明模型已能在受控範圍內協助提出有價值的實驗假說。不過 OpenAI 也把它稱為 near-autonomous,因為人類仍負責 high-level steering、選出要測的 proposal、修正實驗計畫、協助實驗室操作,並獨立驗證結果。對讀者來說,這條分界線比「AI 化學家」這個名稱更重要:模型可以加快候選路徑,但能不能進入正式研究流程,仍取決於實驗重跑、專家判讀、資料紀錄與安全審查。
研究團隊本週可以改的驗收方式
如果團隊正在評估 GPT-Rosalind、其他生科模型,或準備把通用模型接到內部資料,建議把試用拆成四個連續關卡,別一次問「可不可以開始用」。
一、先選低風險任務。適合起步的是文獻證據整理、omics 品質控管、候選假說排序、實驗測定除錯初稿,或把既有 notebook 轉成可審查說明;不適合起步的是直接決定臨床分層、合成高風險序列、病患資料自動結論或不可重跑的濕實驗排程。
二、每題都要留下可重跑紀錄。模型輸出旁邊應該有資料版本、程式碼或 notebook、工具 log、被排除的假設、引用來源和錯誤案例,不要只保留聊天摘要。
三、讓專家覆核的是「判斷鏈」,不是文案。覆核者要看模型是否改過錯誤假設、是否選對 estimator、是否承認資料不足,以及下一步實驗是否真的能降低不確定性。
四、把安全條件放進試用表。若任務涉及病患資料、基因資料、病原體、合成生物、商業機密或跨境合作,先確認資料保存、權限、用途限制、事故回報與外部驗證方式。
這樣做的好處是,即使模型供應商、access policy 或榜單排名改變,團隊仍保有自己的任務集、資料治理、錯誤紀錄與審查流程。模型可以更換,研究責任不能外包。
可信存取與生物安全:不要只問誰能拿到模型
GPT-Rosalind 先前採可信存取(trusted access)路線,GeneBench-Pro 又把高階生物研究判斷推到更明顯的位置。這會讓兩個問題同時變尖銳:高能力生科 AI 不該無限制公開,但如果只有少數大型機構能使用與檢驗,也會影響小型研究團隊、公衛單位和低資源市場的機會。
比較務實的檢查題是每個 access decision 是否能被檢查,別把討論停在「開放或封閉」二選一。申請資格是否看研究目的、治理、安全紀錄與公共利益?使用資料會不會被保存、訓練、稽核或分享?模型輸出如何限制高風險生物或化學用途?外部研究者能否審查題目、失敗案例或系統行為?若模型接進實驗室、序列分析或合成流程,人類審查點在哪裡?
如果重點是生物安全,可以延伸看 Rosalind Biodefense 與 Trusted Access;如果關心下游合成供應鏈風險,則可對照 AI DNA 合成篩查 的治理入口。若要建立自己的 AI 評測流程,也可搭配 Agent 評測不能只看分數 看工具 trace、成本與驗收紀錄。
讀完後的下一步
GeneBench-Pro 的用途是提醒研究團隊:生科 AI 的關鍵能力正在從「知道多少」移到「能不能在資料混亂時做出可審查的研究判斷」。
本週最值得做的是整理一份內部小型驗收集。挑出 20–50 個過去已完成、低風險、可重跑的研究任務,為每題寫清楚資料來源、正確答案或可接受範圍、常見錯誤、需要專家覆核的判斷點,以及不能讓模型自動碰的邊界。等模型在這些任務上能穩定留下可檢查紀錄,再討論更接近實驗或決策的用途。
FAQ
GeneBench-Pro 證明 GPT-5.6 Sol 可以取代生科研究員嗎?
沒有。OpenAI 公布 GPT-5.6 Sol 在 GeneBench-Pro 最高 reasoning level 的通過率為 28.7%,Pro mode 為 31.5%。這是明顯進步,但仍代表多數題目沒有完整解出。它比較適合被當成需要專家覆核的研究助理候選人;獨立研究負責人的責任仍要留給人類與制度。
GeneBench-Pro 和 LifeSciBench 差在哪裡?
LifeSciBench 偏向專家撰寫的生命科學任務、研究附件與評分規準;GeneBench-Pro 偏向雜亂但可控的 computational biology 分析題,透過合成資料和已知 causal structure 讓評分更能檢查分析路徑是否正確。兩者一起看,才能同時檢查研究附件處理與資料判斷能力。
研究團隊現在最該買新模型,還是先做內部評測?
先做內部評測。模型會快速變動,但真實任務集、資料版本、notebook、工具 log、專家覆核規準、錯誤案例與安全條件會長期有用。若流程穩定,再決定要申請 GPT-Rosalind、採用其他模型、串接實驗平台,或建立內部工具。
可信存取會不會讓小型研究團隊被排除?
有這個風險。討論若只停在「是否開放」,會漏掉真正該檢查的條件。比較好的審查方式是要求供應商說清楚申請資格、資料保存、用途限制、外部審查、公共利益路徑與事故回報。高風險能力需要邊界,但邊界本身也要能被檢查。
參考來源
- OpenAI:Introducing GeneBench-Pro
- OpenAI API Docs:Models
- OpenAI API Docs:Using GPT-5.5
- OpenAI:Inside Genebench-Pro
- OpenAI:Introducing LifeSciBench
- OpenAI:Introducing new capabilities to GPT-Rosalind
- OpenAI:A near-autonomous AI chemist improves a challenging reaction in medicinal chemistry
- OpenAI:Strengthening societal resilience with Rosalind Biodefense