你請 AI 推薦幾篇論文,它回了一串作者、篇名、期刊與 DOI,格式完整得像從資料庫複製。你真的去查,卻發現論文根本不存在。
這就是 AI 幻覺。它能用流暢、自信又完整的形式包裝錯誤,讓人很難只靠閱讀察覺。
AI 幻覺是什麼
NIST 的生成式 AI 風險管理文件使用「confabulation」描述模型產生錯誤或虛假內容的情況。實際使用時,幻覺通常包含三種問題:
- 內容錯誤:人物、日期、數字或因果關係不正確。
- 來源不存在:捏造論文、法條、網址、判例或受訪者原話。
- 沒有證據卻下結論:把猜測、關聯或少量樣本寫成確定事實。
它不代表 AI 有意欺騙。語言模型的工作,是根據既有脈絡產生可能的下一段文字;「讀起來合理」和「經過查證」是兩件不同的事。OpenAI 對幻覺成因的說明也指出,只用答對率評分時,模型可能因為猜答案而得分,誠實回答「不知道」反而沒有好處。
最常見的 5 種錯法
| 類型 | 你會看到什麼 | 怎麼查 |
|---|---|---|
| 捏造來源 | 完整的論文題名、DOI 或網址,實際搜尋不到 | 直接開連結,再到出版社或資料庫查題名 |
| 張冠李戴 | 把 A 公司的數字、B 的職稱放到 C 身上 | 回到公司公告、政府資料或原始文件 |
| 過時資訊 | 用舊價格、舊方案、舊法規回答現在的問題 | 確認頁面日期與生效日期 |
| 無證據推論 | 從相關性推成因果,或把可能寫成必然 | 找研究設計、樣本與限制,不只看摘要 |
| 錯誤引用 | 來源存在,但根本沒有支持 AI 寫的那句話 | 打開來源,搜尋關鍵字並讀前後文 |
最後一種最容易漏掉。「附了連結」只代表可以開始查,不代表答案已被證明。
為什麼不能用一個百分比代表幻覺率
你可能看過「某模型幻覺率只有幾%」的說法。除非同時交代測試資料、工具權限、提示詞、計分方式與模型版本,這個數字幾乎無法拿來判斷你的工作。
例如,測冷門人物的生日、摘要一份使用者提供的 PDF、回答最新產品價格,是三種完全不同的任務。允許搜尋的模型也不能和只能靠內部知識回答的模型直接相比。更麻煩的是,有些評測把「拒答」視為沒答對,有些則把它視為比亂猜更好的結果。
因此,請改問:它在我的資料、工具與驗收條件下,犯錯會造成多大損失? 需要正式比較時,可參考 LLM 評測指南建立自己的測試集。
哪些回答一定要查
我會用「錯了之後能不能輕易復原」來分級:
腦力激盪和改寫語氣的錯誤通常容易復原,人看過再用即可。程式碼、公式與資料整理需要實際測試,並核對輸入與邊界條件。到了對外文章或公司簡報,每個數字、日期與引言都應連回原始來源。
法律、醫療、財務決策,以及會寄信、付款或修改資料的 AI Agent,則屬於極高風險。前者需要專業人士確認,後者要使用最小權限、人工核准和稽核紀錄。
程式碼「跑得動」也不等於安全。不存在的套件通常很快會被發現,但已棄用的 API、錯誤權限與漏掉例外處理,可能直到上線才出事。
真正有效的 5 個降低方法
1. 先把答案拆成可驗證主張。
不要整段問「這對嗎?」。把人名、日期、數字、引用與結論分開,一項一項查。完整流程可直接照 AI 事實查核指南操作。
2. 要求原始來源,不接受搜尋摘要。
公司資訊看官方公告,法規看主管機關,論文看出版社或 DOI 紀錄。若 AI 只能給部落格轉述,就把該主張標成未確認。
3. 提供資料,限制回答範圍。
把核准過的文件交給 AI,要求它只根據文件回答,並標出頁碼或原句。這是 RAG 與企業知識庫常用的方法,但檢索錯文件、切段不完整時仍會出錯。
4. 把「摘錄、推論、建議」分開。
要求 AI 分三欄輸出:來源明確寫了什麼、可以合理推論什麼、它建議做什麼。讀者就不會把模型的判斷誤認為來源原文。
5. 高風險動作保留人工核准。
提示詞只能改善行為,不能取代權限控管。會寄信、刪檔、改客戶資料或發佈內容的 AI Agent,應先用唯讀權限,重要動作再由人確認。
三個看似有用、其實不夠的方法
再問一次「你確定嗎?」 AI 可能改口,也可能替原本的錯誤補上一個新理由。沒有外部證據,第二次回答仍是模型輸出。
同一題問三個 AI。 多個模型可能學過相同的錯誤網頁,也可能一起接受題目的錯誤前提。一致只能當線索,不能當證據。
只要有引用就相信。 搜尋型 AI 仍可能引用不相關段落,或把來源的保留語氣改寫成肯定結論。你要核對的是「來源是否支持這句話」,不是連結數量。
一個真實警告:假判例不是小錯字
在美國的 Mata v. Avianca 案中,律師提交了由 ChatGPT 產生、包含虛構判例的文件。法院在制裁命令中要求相關律師負責。使用者把「看起來像法律文件」誤當成「已完成法律查證」,才讓模型錯誤進入正式文件。
這個教訓適用於所有專業工作:AI 可以幫你整理待查清單,不能替你承擔查證責任。
常見問題
所有 AI 都會幻覺嗎?付費版也會嗎?
會。較新的模型、搜尋功能或較好的資料檢索可以降低某些任務的錯誤,但不能保證每句話正確。付費方案買到的是能力、速度、工具或額度,不是免查證保證。
搜尋型 AI 有附來源,還需要查嗎?
需要。先確認連結能開、來源日期正確,再看原文是否真的支持 AI 的主張。附來源最大的價值,是讓你查得更快。
要求 AI 說出完整推理過程,能避免幻覺嗎?
不能保證。較長的推理也可能把錯誤前提一路推到底。更實用的要求是列出假設、引用原句、標示不確定處,並讓結果可以用外部資料驗證。
AI 幻覺未來會完全消失嗎?
目前沒有足夠證據能保證。模型可以更常在不確定時棄答,也能透過搜尋、RAG 與工具降低錯誤;但資料過時、來源錯誤、問題含糊與工具失敗仍會存在。實務上應設計可發現、可攔截、可修正的流程。