回到頂部
同一批分子樣本經隨機切分與時間切分進入兩條實驗軌道,產生明顯不同的模型評測結果

藥物 AI 榜單為何差 0.21 AUROC?資料切分與雜訊指南

FINAL-Bench 用相同 hERG 資料與模型,只改時間切分和隨機切分,AUROC 相差 0.211。整理藥物 AI 評測的五個必要欄位。

內容查核: 來源查核:

藥物 AI 模型的 AUROC 若沒寫資料怎麼切,幾乎不能拿來和另一個分數比較。 FINAL-Bench 8 月 22 日公開一個直接案例:同一批 hERG 資料、相同 Morgan fingerprint、LightGBM 預設值與測試比例,只把時間切分換成隨機切分,AUROC 就由 0.606 變成五次平均 0.818,相差 0.211。

這不是證明所有既有藥物 benchmark 都錯,也不是臨床驗證。它指出一個常見陷阱:藥物化學家會圍繞同一 scaffold 製作一系列相似分子,隨機切分可能把近似樣本同時放進訓練與測試,模型只要認出近鄰就能拿高分。

同一模型為何差 0.211

FINAL-Bench 原文從 ChEMBL 37 的 hERG 目標 CHEMBL240資料整理出 9,788 個唯一化合物。時間切分以首次報告年份為界,訓練較早資料、測試後來出現的分子;隨機切分則依五個種子分配相同比例。

設定AUROC更接近的問題主要風險
時間切分0.606用當時已知資料預測後來出現的分子年代變化也可能影響資料
隨機切分平均0.818從同一資料分布抽新樣本相似 scaffold 洩漏到兩側
Scaffold 切分本案例未給單一值測不同核心結構的泛化仍不等於真正前瞻研究

文章的主張範圍很窄:切分方式足以讓分數差過許多論文方法間的差距,所以沒有 split 的數字不具可比性。這和語音辨識榜單最佳化問題相似,公開測試集一旦反覆被用來選模型,就會逐漸失去未見資料的功能。

雜訊底線比名次更重要

同一化合物在不同實驗室、細胞、緩衝液與日期量測,結果也不會完全相同。作者用跨論文的重複量測估算 hERG 單次量測標準差為 0.421 log,並指出測試集有一半以上樣本落在分類門檻的一個雜訊底線內。

這代表第一名和第二名只差 0.02 時,名次可能小於實驗本身的精度。LEADBOARD 因此讓 regression 成為主要指標,並用雜訊底線限制新分數何時公開。該做法借鑑 Ladder 機制:重複提交若沒有超過門檻,就不回傳新的細微分數,降低透過 leaderboard 逐次榨取測試資訊的空間。

看藥物 AI 榜單要找什麼

先看資料切分和簡單 baseline。隨機、scaffold、時間與真正前瞻資料回答的是不同問題;常數、最近鄰和簡單指紋模型則能揭露複雜方法是否真的增加價值。若論文只報最強模型、沒有這兩欄,就無法判斷進步來自演算法或容易的測試設定。

接著找 noise floor、標籤狀態與重複提交規則。實驗重複性或 bootstrap 波動決定名次差距是否有意義;標籤是公開、重新整理、保密或尚未產生,決定參賽者能否間接查到答案;提交次數、回饋精度與版本 SHA,則影響測試集會不會被慢慢調成訓練集。

LEADBOARD 接受任意預測工具,沒有比較模型參數量、開放權重授權、自架 GPU 可行性或 API 成本。這四項屬於部署選型,應另做候選模型表,不能用此榜單名次補答案。

對台灣生醫團隊,我不建議用單一 AUROC 宣稱候選藥物已有效。榜單只測指定資料與端點,後續仍需要濕實驗、毒理、藥物動力與臨床流程。像 JUMP Cell Painting 這類影像表型資料,也要另外說明特徵、切分與指標,不能和 hERG 分數混成總排名。可把這五欄納入AI benchmark 基礎判讀與模型卡,讓研究、法規與採購看到同一把尺。

常見問題

AUROC 越高,藥物 AI 就越接近臨床可用嗎?

不一定。AUROC 只描述指定資料集與分類問題,還受切分、標籤品質和類別分布影響。臨床可用需要額外實驗與法規證據。

時間切分一定比 scaffold split 好嗎?

兩者回答不同問題。時間切分接近用過去預測未來,scaffold split 強調跨核心結構泛化;最好依產品使用情境預先指定,不能看完分數再挑。

藥物 AI leaderboard 為什麼要限制重複提交?

每次回傳精細分數都會洩露一點測試集資訊。反覆嘗試並只保留最高分,可能在沒有真正泛化的情況下逐步爬榜。

參考來源

№ · further reading

延伸閱讀