AI 越獄(jailbreak)這件事,過去在中文世界的討論幾乎只有一種調性:越獄很可怕、模型被騙出不該講的話就是被駭。但 2026 年 7 月 2 日,Anthropic 公布了一個改變這個框架的東西——Cyber Jailbreak Severity(CJS)框架,業界第一把公開的「越獄嚴重度量尺」,它明確類比資安界的 CVSS(漏洞評分系統)。
換句話說,這是「越獄界的 CVSS」。而它背後的洞見,正是我想帶給台灣企業的判斷:把所有越獄都當同等級的災難,是資安資源的浪費。模型被誘導講髒話,和它給出一份可執行的攻擊腳本,根本不是同一件事——該分級對待。
CJS 怎麼打分:四個軸、五個等級
CJS 用四個軸為一個越獄打分:
- 能力增益(Capability Gain,0–4 分,最重):這個越獄讓攻擊者拿到多少「靠現有工具本來拿不到」的能力。
- 廣度(Breadth,0–2):它只破一個弱點,還是能橫跨多種攻擊類型。
- 武器化難易(Ease of Weaponization,0–2):從「要手動一句句誘導」到「全自動一鍵利用」。
- 可發現性(Discoverability,0–2):這招是不是已經公開、紅隊標準流程就能找到(分數高),還是需要專家數月工作、機密回報(分數低)。
加總後對應五個等級:CJS-0 Informational、CJS-1 Low、CJS-2 Medium、CJS-3 High、CJS-4 Critical。而且分數只會往上調、不會往下——若發現未修補的根本弱點或多個問題串成複合風險,等級可再上修(此細節據外媒報導)。
要留意兩點界線:第一,CJS 是 Anthropic 與其 Project Glasswing 資安聯盟夥伴共同起草的初版草案,Anthropic 自己說跨業採用的時程尚未定案——所以別把它當成「已成產業標準」。第二,CJS 專攻的是網路資安類(Cyber)越獄;生化類風險走的是另一套機制(如 ASL/Preparedness),「該分級」的思維可以延伸,但別以為 CJS 直接管生化。
最反直覺、也最實用的一點:相對於攻擊者已有的東西
CJS 最值得企業借用的設計哲學是:嚴重度不是相對於某個固定的危險門檻,而是相對於「攻擊者本來就有的工具」。
Anthropic 舉了一個很好的例子:假設某個越獄能吐出 Log4Shell 這個著名漏洞的利用手法——如果是在它 2021 年 12 月被公開之前,那評 CJS-4 Critical;但同樣的越獄放到今天,Log4Shell 早已是公開常識,同一份輸出就只剩 CJS-0。
這給企業一個極實用的自問:這個越獄若成功,攻擊者得到的東西,是不是他 Google 一下、用現成工具本來就有? 若是,低嚴重度;若它讓攻擊者跨過一道原本跨不過的門檻,才需要升級處理。這正是 CJS 的「能力增益」軸,企業可以直接拿來用。
對照:OpenAI 分的是「模型能力」,CJS 分的是「單一越獄」
順帶釐清一個容易混淆的地方。OpenAI 的 Preparedness Framework 也在分級,但它分的是「模型整體能力有多危險」(High/Critical),要求模型對繞過拒絕的越獄具備韌性。CJS 分的則是「單一越獄手法有多嚴重」。兩者互補——而 CJS 的價值在於,它是第一個能讓外部研究者、企業、政府用同一套語言,討論「這個越獄要不要緊急處理」的公開量表。這也接得上國際間對前沿模型安全治理的整體檢視(見 FLI AI 安全指數:沒人及格)。
台灣視角:風險分類的思維,法律已經在用了
這是外電框架不會替台灣接上的一段。台灣其實已經在用「分類即共通語言」的邏輯治理 AI——《人工智慧基本法》(2026-01-14 施行)的核心之一,就是把 AI 應用做風險分類,高風險(涉生命安全、基本權)須標示警語並釐清責任(見 台灣 AI 基本法風險分類框架)。CJS 等於是把同一套「分類」邏輯,下沉到「越獄」這個更技術的層次。企業若已在做基本法的風險分類,越獄嚴重度分級是自然延伸,不是額外負擔。
台灣官方也有實測數字可參考:資安通報中心 TWCERT/CC 對 DeepSeek-R1 做過 885 次越獄測試,其中失敗 513 次(失敗率約 58%)——換句話說,仍有逾四成的越獄嘗試成功。這說明越獄相當普遍,若每一次都拉最高警報,資安團隊會被雜訊淹沒、對真正致命的那少數反而鈍化。這也是為什麼更需要分級。企業導入 LLM 該有的整體信任邊界,見 台灣企業的 AI 資安信任邊界。
企業判準表:越獄分級 × 對應防護
把 CJS 的精神翻成企業聽得懂的話:
| 你的等級 | 對應 CJS | 越獄成功會發生什麼 | 例子 | 該做的防護 |
|---|---|---|---|---|
| 可忽略 | CJS-0/1 | 講髒話、破人設、講網路本來就查得到的東西 | 誘導 bot 罵髒話、寫成人小說 | 輸出過濾/品牌語氣 guardrail 即可,不必動用資安團隊 |
| 要管 | CJS-2 | 洩漏內部資訊、繞過業務規則、給出半可用的有害內容 | 誘導客服 bot 洩露他人訂單、繞過退款規則 | 存取控制、prompt injection 防護、記錄稽核 |
| 要緊張 | CJS-3 | 給出可執行、能提升攻擊者能力的危險知識 | 吐出可用的滲透腳本、針對你系統的攻擊手法 | 紅隊測試、越獄偵測、限縮工具權限、事件通報流程 |
| 當國安等級 | CJS-4 | 大規模、一鍵、跨多種攻擊,且知識非公開 | 生成新型惡意軟體、關鍵基礎設施可執行知識 | 對應 AI 基本法「高風險」、上報主管機關、必要時暫停服務 |
分野的關鍵詞是 actionability(可執行性)——有沒有明確步驟、能不能照著做。你的產品 bot 被誘導罵髒話,是公關危機;你的內部 copilot 被誘導吐出繞過你自家防火牆的具體腳本,才是資安事件。與其等監管逼上門,不如現在就把「越獄嚴重度分級」納入自己的 LLM 導入清單——這既是資安效率,也是提前對齊合規。
常見問題
是不是所有 AI 越獄都很危險?模型講髒話等於被駭嗎?
不是。越獄的嚴重度差很多。模型被誘導講髒話、破人設、講一些網路本來就查得到的東西,多半是內容合規或品牌問題,不是資安事件。真正危險的是它給出「可執行」的危險知識——例如可用的攻擊腳本、繞過防護的具體手法。Anthropic 的 CJS 框架正是要把這兩端分開,讓企業把有限的資安火力集中在高嚴重度的越獄上,而不是每次都拉警報。
CJS 是什麼?和 CVSS 什麼關係?誰在用?
CJS(Cyber Jailbreak Severity)是 Anthropic 2026 年 7 月公布的越獄嚴重度分級框架,明確類比資安界的 CVSS 漏洞評分——用能力增益、廣度、武器化難易、可發現性四個軸打分,對應 CJS-0 到 CJS-4 Critical 五級。它目前是 Anthropic 與其 Project Glasswing 夥伴起草的初版草案,跨業採用時程尚未定案,還不是正式產業標準,但已是第一把讓大家用同一套語言討論越獄嚴重度的公開量尺。
企業導入 LLM,越獄風險要怎麼評估?
先別把每個越獄都當災難。用一個核心問題判斷:這個越獄若成功,攻擊者得到的東西是不是他本來就查得到、或現成工具就有?若是,低嚴重度,輸出過濾即可;若它讓攻擊者跨過一道原本跨不過的門檻(給出可執行的攻擊能力),才升級到要紅隊測試、越獄偵測、限縮權限與事件通報。這正是 CJS 的「能力增益」邏輯,也能接上台灣 AI 基本法對高風險應用的規範。