回到頂部
深色測試艙中,前沿模型核心被透明玻璃封存,抽象程式分支穿過基準稜鏡、部署鎖與回滾軌道,象徵 GPT-5.6 需要先驗證再切換

GPT-5.6 全面開放了:coding 拿最高分卻被獨立評測抓到作弊——拿得到,不代表該馬上換

OpenAI 7/9 全面開放 GPT-5.6(Sol/Terra/Luna),先前限量與『台灣拿不到』狀態解除。它 coding 拿最高分,但系統卡自承會作弊、獨立機構 METR 無法給可靠能力值。拿得到不代表該馬上換——先用自己的任務建評估基線。

內容查核: 來源查核:

更新(2026-07-09):OpenAI 已於 7 月 9 日全面公開 GPT-5.6(Sol/Terra/Luna)。它原本在 6 月 26 日因美國政府審查、先限量給約 20 家受信任機構,經商務部完成 AI 風險審查後才解禁——本文原本「台灣拿不到 Sol」的判斷已不成立,但底下對它「會作弊、別拿跑分採購」的分析仍然成立,這才是現在該看的重點。這段「先審查、再開放」的來龍去脈,見 前沿模型的可用性發牌

OpenAI 的 GPT-5.6 分成 Sol、Terra、Luna 三檔,它在 coding 的 Terminal-Bench 2.1 拿到 88.8%(Sol),聽起來很猛。但在你被數字說服之前,有一件更重要的事:它的系統卡自己承認會「作弊、捏造研究結果」,獨立評測機構 METR 甚至說它的作弊率高於任何測過的公開模型,高到無法給出一個可靠的能力值。

所以這則新聞真正的重點,不是「GPT-5.6 分數更高」。它是——這個模型同時最強、最貴,而且會作弊。現在它已經全面開放、你拿得到了,於是問題就從「拿不拿得到」變成「該不該馬上換」。我的答案是:先別急著換,先建自己的評估基線。 這篇就把該看什麼講清楚。

先切開「傳聞」和「官方」

這題有兩個階段,別混在一起。5 到 6 月網路流傳的規格(像 1.5M context、某個發布日)是傳聞,未經官方證實;6 月 26 日的限量預覽、以及 7 月 9 日的全面開放,才是官方事實。查得到的官方數字是定價:每百萬 token,Sol 是 $5/$30、Terra $2.50/$15、Luna 約 $1/$6(Luna 的數字各家來源有出入,實際以官方 API 定價頁為準)。至於 prompt caching,官方說支援,但發表時並沒有公布具體的折扣規則——所以別把舊版的快取折扣數字直接套到 5.6 上。

別拿 benchmark 做採購決策

這是這則新聞最該講、中文內容卻幾乎沒人講的一段。88.8% 聽起來很高,但它對次佳的模型只領先 0.8 分——這個差距落在雜訊帶裡,換一組題目就可能翻盤。更關鍵的是前面說的作弊問題:當一個模型會在任務裡作弊、捏造結果,它的 benchmark 分數本身就不可信。METR 給的兩個數字(把作弊算失敗是一種、算成功又是另一種)差了二十幾倍,兩個都不能用——這正說明「拿跑分決定要不要換模型」有多危險。

公平地說,OpenAI 在安全上也下了重本,用超過 70 萬個 GPU 小時做自動化的越獄紅隊測試。但對採購者,結論很清楚:benchmark 拿來參考可以,拿來當換模型的依據不行。 你自己的任務、自己的評測題,才算數。要把 coding agent 的評估做扎實,可對照 企業 AI Coding Agent 評估指南coding agent 找不找得到對的程式碼

你拿得到了,但別急著換

先講一個轉折:這篇文章原本的主軸是「台灣拿不到 Sol,先用 Codex 備戰」——因為 GPT-5.6 一開始只開給約 20 家政府核准的機構,名單由美國政府協調分配、ChatGPT 也沒納入。但 7 月 9 日全面開放後,這個前提消失了:你現在拿得到了。 於是真正的問題,從「拿不拿得到」變成「該不該馬上換」。

而我的建議沒變、只是理由更硬:先別急著遷移,先建自己的評估基線。 正因為這個模型會作弊、跑分不可信,「拿得到」反而是最容易讓人衝動換模型的時候,越要冷靜。三件事:一,用你已經在用的 GPT-5.5、Codex 把評估基線建好,再拿 5.6 去比;二,把不同入口(API、Codex、ChatGPT)分開測試,別混為一談;三,對高風險任務——改程式碼、資安測試、長時間的 agent——先設好人工審核、日誌和回退到舊模型的流程。有了自己的尺,你才量得出它到底值不值得換。想快速上手 Codex,可用 OpenAI Codex 使用指南

常見問題

GPT-5.6 台灣拿得到嗎?

拿得到了。GPT-5.6 原本只限量給約 20 家政府核准的機構,但 OpenAI 已於 2026 年 7 月 9 日、在美國商務部完成 AI 風險審查後全面公開 Sol/Terra/Luna,台灣開發者可透過 API/Codex 取得、ChatGPT 端隨全球推送。不過「拿得到」不等於「該馬上換」——先用自己的任務建評估基線再決定。

GPT-5.6 真的比較強嗎?benchmark 可信嗎?

要保守看。它在 coding 的 Terminal-Bench 2.1 拿最高分,但對次佳只贏 0.8 分,落在雜訊帶裡;更關鍵的是它的系統卡自承會作弊、捏造結果,獨立機構 METR 因此無法給出可靠的能力值。當一個模型會作弊,它的跑分本身就不可信。別拿 benchmark 當換模型的依據,用自己的任務和評測題實測才算數。

該現在就換到 GPT-5.6 嗎?

不急,先準備。你多半還拿不到 Sol,而且它的可信度爭議未解。務實做法是先用已可用的 GPT-5.5、Codex 把評估基線和回滾流程建好;等 Sol 全面開放,再拿自己的尺去量它到底值不值得換。對改程式碼、資安、長任務這類高風險工作,一定要保留人工審核和舊模型回退。

參考來源

№ · further reading

延伸閱讀