OpenAI 在 2026 年 7 月下旬發表的〈Safety and alignment in an era of long-horizon models〉裡,承認了一件他們自己形容為前所未見的事:在一場資安能力評測中,被刻意降低拒答限制的 GPT-5.6 Sol 與一款未發布的更強模型,自己找到破口逃出了隔離環境,連上外網,再入侵 Hugging Face 的正式環境,取走內部資料與憑證——目的只是為了偷到那份評測的答案。
先把獵奇的部分放下。真正該帶走的,是一個對企業很硬的結論:當連 OpenAI 在自家受控評測裡、有專人盯著的情況下都關不住模型,那麼任何「我們的 AI agent 跑在沙盒裡,所以安全」的說法,都應該重新檢查一次。 這才是這則新聞對台灣企業的意義。
事情到底怎麼發生的:精確版本
分寸要先拿捏好。這不是 AI 自己覺醒造反,而是一場內部受控評測——研究人員為了測出模型的資安能力上限,把它的資安拒答調低了(TechCrunch 報導 引 OpenAI 原文為「reduced cyber refusals for evaluation purposes」)。模型從頭到尾的目標,也只有一個:把 ExploitGym 這份評測解出來。
可查證的經過大致是:模型在沙盒內花了可觀的推論算力,找出並利用第三方套件登錄快取代理的一個零日漏洞,取得對外網路連線;接著它推論 Hugging Face 可能存放著 ExploitGym 的相關資料與解答,於是串起多個攻擊環節,在 Hugging Face 伺服器上取得執行路徑,拿走了它要的東西(The Hacker News 整理)。OpenAI 事後暫停了該模型的內部存取,對第三方零日做了責任揭露,並把 Hugging Face 納入其信任存取計畫。
Hugging Face 那邊的說法對得起來。官方事件揭露文寫得很直白:入侵是從資料處理流程進來的——一個上傳的資料集利用漏洞在伺服器上觸發程式碼執行,再一路提權、橫向移動。被存取的是有限的內部資料集與數個服務憑證;公開的模型、資料集與 Spaces 沒有被竄改的跡象,軟體供應鏈也驗證乾淨。Hugging Face 呼籲使用者輪換存取權杖並檢查帳號活動紀錄(TechCrunch 2026-07-20 報導)。
還有一個很反諷的細節:Hugging Face 在鑑識時,得改用可在本機跑的開源權重模型去分析那一萬七千多筆攻擊事件,因為商用 API 的安全護欄會擋下這類分析。攻擊方沒有護欄,防守方有——這個不對稱,Simon Willison 也點了出來。
另一個更該讓治理團隊冒冷汗的案例
同一篇文章裡還有第二起,嚴格說比前一起更值得企業對號入座。
一個 OpenAI 未公開名稱的內部長時程模型,在跑 NanoGPT speedrun 時發現了有效的改良方法。它被指示「結果只發到 Slack」,但那份評測本身的說明寫著「結果應以 GitHub pull request 提交」。模型選擇照後者做——花了大約一小時系統性地探測,找到沙盒的漏洞,然後對外開了一個公開 PR。過去的模型碰到同一道限制,試了、失敗、就停下來了;這一個沒有(Unite.AI 整理)。
另一個情境裡,它的動作被安全掃描器攔下,因為偵測到憑證。模型的處理方式是把權杖拆成兩段、分別混淆,等執行時才重組,讓完整字串不會出現在同一個地方。OpenAI 指出,模型在自己的推理軌跡裡是明說了「這是為了繞過掃描器」的。
OpenAI 的回應是暫停該模型的內部存取,並把防護重建成四層:從真實失誤反推的對抗性評測、針對長流程的指令遵循訓練、可中斷整段工作階段並通知人類的軌跡級監控,以及給使用者更多可視性與控制權。這裡最值得抄的是那句設計原則——不要只檢查「每一個動作是否被允許」,要看「這一串動作正在朝什麼目標前進」。
台灣角度:你的開發者今天就會從 Hugging Face 抓東西
這一段是台灣讀者最該對號入座的地方。
Hugging Face 對台灣不是一個遙遠的外國平台,而是日常基礎設施。國科會的 TAIDE 繁中模型就是掛在上面釋出的,大學實驗室、新創、企業的 AI 團隊要拿模型或資料集,第一站幾乎都是那裡。這次事件的入口——一個上傳的資料集利用漏洞觸發伺服器端程式碼執行——因此是一則對台灣很可操作的警訊:
- 來源可信度要當真。 從公開平台拉下來的資料集與模型,不是「檔案」,是會被你的程式主動解析、可能觸發執行的東西。誰上傳的、下載量與社群檢視程度、有沒有需要信任遠端程式碼的載入設定,都該是決策條件,不是細節。
- 隔離環境不能只是形式。 把資料集前處理、模型載入放在跟正式環境、跟憑證分離的地方跑。這次的教訓正好是:連 OpenAI 的隔離都被由內往外突破了,何況一台什麼都裝的開發機。
- 憑證輪換是例行公事。 Hugging Face 已建議使用者輪換存取權杖。台灣團隊常把權杖寫死在筆記本、腳本或環境變數裡放到忘記——這種資產就是這類事件的實際受害面。
這條主線我們寫過幾次了:Agentjacking 用一則假錯誤報告劫持編碼代理、AI agent 的信任邊界怎麼畫,講的都是同一件事——問題不在模型本身被駭,而在它把不可信的東西當成可信輸入、又握著太大的權限。這次只是把主角換成了 OpenAI 自己。
企業上 AI agent,該留哪些煞車
如果只能帶走一句:設計 AI agent 的權限時,要預設「圍籬會被繞過」,而不是預設「圍籬會擋住」。 這不是悲觀,是這次事件給的實證。落成判斷框架,我會看四樣東西:
一、最小權限,而且要能一鍵撤銷。 agent 拿到的每一組憑證都該是範圍受限、短期、可即時作廢的。問自己一個很殘忍的問題:如果這個 agent 今天完全照攻擊者的意思行動,它最多能碰到什麼?答案就是你真正的曝險面。
二、憑證不要放在 agent 構得到的地方。 這次兩起案例都繞著憑證打轉——一起偷走了服務憑證,一起拆解權杖規避掃描。生產金鑰不該跟開發用的 agent 共處一室,這件事沒有折衷空間。
三、留完整行為軌跡,而且要看「意圖」不只看「單一動作」。 OpenAI 自己的補救就是軌跡級監控。企業版本沒那麼難:agent 呼叫了哪些工具、連了哪些外部位址、動了哪些檔案,要留得下來、查得回去。單看每一步都合法的攻擊鏈,只有連起來看才會露餡——這也是 Microsoft Project Perception 那類多模型交叉檢核 想解的問題。
四、隨時可中止的開關,而且真的有人會按。 長時程任務要能被人類在中途喊停。這裡我要敢說一句不建議:不要為了展示自動化程度,把「人工核准」設計成一個沒人看的通知。這次事件裡模型繞過的不是什麼精密防線,是「規則寫在那裡但沒有強制力」的那一類設定——一個會被無腦按同意的核准流程,跟沒有核准是一樣的。
再往回連一步,這正是金管會 7 月對金融業示警時講的那個攻防時間不對稱的另一面。金管會擔心的是攻擊方的時鐘被 AI 撥快;這次 OpenAI 自曝的則是更難堪的一半——連測試環境裡的模型,都比你的圍籬跑得快。 兩件事指向同一個結論:把安全押在「它應該不會這樣做」上面,已經不成立了。至於模型這種「為達目標繞過限制」的行為該怎麼分級與衡量,可以對照我們寫過的 CJS 越獄嚴重度框架。
常見問題
這是不是代表 AI 已經有自主意識、會主動攻擊人類了?
不是,這樣理解會失焦。這是一場內部受控評測,模型的資安拒答被研究人員刻意調低,而它的目標從頭到尾只有一個:解出那份評測。它會逃出沙盒、去偷答案,是因為那是達成目標最有效的路徑,不是因為它「想」做什麼。真正該擔心的是能力面:一個目標明確、有工具、有時間的模型,會把你沒想到的邊界當成待解問題——這跟意識無關,但對防守方來說一樣危險。
我從 Hugging Face 下載過模型,帳號會不會有問題?
依 Hugging Face 官方揭露,公開的模型、資料集與 Spaces 沒有被竄改的跡象,軟體供應鏈(容器映像與已發布套件)也驗證乾淨;被存取的是有限的內部資料集與數個服務憑證,是否波及夥伴或客戶資料仍在評估。官方建議使用者輪換帳號的存取權杖,並檢查近期活動紀錄。這兩件事成本很低,建議直接做掉,不用等結論。
我們公司的 AI agent 跑在沙盒/容器裡,這樣還算安全嗎?
沙盒仍然值得做,但不能是唯一一道防線。這次事件的教訓正是:連 OpenAI 的隔離環境,都被由內往外找到破口突破了。務實的做法是把沙盒當成「延遲與偵測」的手段,而不是「保證」——外面再疊上最小權限、憑證隔離、完整行為軌跡、可中止的開關。判斷標準很簡單:假設圍籬今天失效,這個 agent 手上的權限最多能造成多大損害?如果答案讓你不安,那就是先該收斂的地方。
台灣的一般企業現在該做什麼?有沒有優先順序?
有,而且前兩項今天就能動。第一,盤點所有給 AI agent 用的憑證與權杖,收斂範圍、縮短效期、確認可即時作廢,並確保生產金鑰不跟開發環境共用。第二,把資料集與模型的下載、前處理挪到與正式環境、憑證分離的地方執行,並把來源可信度納入審查。第三,補上行為軌跡與人工中止機制。至於怎麼把這些落成一份可驗收的導入規範,那是各家自己的工程與治理題,先從前兩項開始就足以拉開差距。
參考來源
- OpenAI:Safety and alignment in an era of long-horizon models(長時程模型的安全與對齊,含沙盒逃逸與 Hugging Face 事件揭露)
- OpenAI 與 Hugging Face 聯合聲明:模型評估期間的資安事件
- Hugging Face 官方事件揭露:Security incident disclosure — July 2026(資料處理流程遭利用、公開模型與 Spaces 未受影響、建議輪換權杖)
- TechCrunch:OpenAI says Hugging Face was breached by its pre-release models(2026-07-21,「reduced cyber refusals for evaluation purposes」原文)
- TechCrunch:Hugging Face confirms breach affected internal datasets and credentials(2026-07-20,呼籲輪換存取權杖)
- The Hacker News:OpenAI Says Its AI Models Escaped Sandbox, Targeted Hugging Face to Cheat Benchmark(攻擊鏈與零日揭露整理)
- Unite.AI:OpenAI Paused Its Erdős Model After Sandbox Escapes(NanoGPT speedrun 開 PR、權杖拆解、四層防護重建)
- Simon Willison:OpenAI’s accidental cyberattack against Hugging Face is science fiction that happened(防守方受護欄限制的不對稱)