回到頂部
把 AI 的 context window 比喻成一張放不下所有文件的小桌子,塞滿後最早的內容會被擠掉

Context(上下文)是什麼?為什麼 AI 會「忘記」前面說的話

為什麼 AI 聊久了會忘記前面說的話?用白話解釋 context window(上下文視窗)是什麼、和 Token 的關係,以及開新對話、給重點、貼關鍵資料三個實用應對法。

連結查核:

本文含聯盟連結

先講結論:AI 有「記憶上限」

AI 聊久了會忘記前面說的話,不是它壞掉,是設計上就有一個「記憶上限」。 這個上限有個名字,叫 context window(上下文視窗,也有人翻成脈絡視窗)。你和 AI 的整段對話——你打的每一句、它回的每一段、你貼進去的檔案——全部都要擠進這個視窗裡。視窗滿了,最早的內容就會被擠出去,AI 自然「想不起來」。

所以與其抱怨 AI 健忘,不如把它當成一個「桌子很小的同事」:桌面就那麼大,你得幫它整理、只放重要的東西。這篇用白話講清楚 context window 是什麼、和 Token 的關係,最後給你三個一般人立刻用得上的應對法。


Context 是什麼(用白話比喻)

Context(上下文)就是 AI 回答你這一題時,「眼前看得到」的所有文字。Anthropic 官方把它形容成模型的「工作記憶(working memory)」——注意,這和 AI 訓練時讀過的海量資料是兩回事。訓練資料像它讀過的所有書,早就內化成能力;context 則是它此刻攤在桌上、正在讀的那幾張紙。

一個好懂的比喻:把 AI 想成一個記性超好、但桌子很小的專家。他學問淵博(訓練資料),但當下能攤開來看的文件,就只有桌面那麼大(context window)。你給的資料超過桌面,他就得把舊的收進抽屜——收進去的東西,他當下就看不到了。

這個「桌面大小」是有明確數字的,單位是 token(下一段解釋)。以 Google 官方文件為例,Gemini 支援到 100 萬個 token,官方形容大約是 8 本英文小說的份量;Claude 則依模型不同,從 20 萬到 100 萬個 token 不等(較新的旗艦模型多半預設 100 萬)。聽起來很大,但你貼一份長合約、再來回聊個幾十輪,其實比想像中更快就滿。

想先搞懂 AI 為什麼能「讀文字、產文字」,可以看 生成式 AI 完全指南


和 Token 的關係

Context window 的大小不是用「字數」算的,是用 Token 算的。Token 是 AI 處理文字的最小單位——不是一個字、也不是一個詞,而是模型切出來的碎片。一個中文字大約是 1 個 token,常見英文字也差不多在 1 個上下(完整說明見 Token 是什麼)。

所以 context window 就是「一個 token 額度」,你對話裡的每樣東西都在花這個額度:

  • 你打的問題 → 花 token
  • AI 的每一段回答 → 花 token
  • 你貼上去的檔案、網頁、程式碼 → 花 token
  • 前面已經聊過的所有內容 → 一直佔著 token

關鍵在最後一點:每問一輪,AI 其實是把「整段對話從頭到現在」重讀一遍再回答。所以對話越長,每一次要吞的 token 就越多,額度也消耗得越快。Google 的文件也提到,早期模型一次只能吃 8,000 個 token,後來才一路推到 32,000、128,000,到現在的百萬等級——但再大的視窗,都還是有邊界。


為什麼長對話會「忘記」或變笨

有兩種不同狀況,常被混為一談:

第一種:真的爆掉了(超出上限)。 對話累積的 token 超過 context window,最早的內容會被系統擠出去。AI 不是「選擇性遺忘」,是那段文字根本已經不在它眼前。這時它可能開始前後矛盾、忘記你一開始設定的規則,或重複問你剛講過的事。

第二種:還沒爆,但變鈍了。 這個比較反直覺:就算沒超過上限,塞太滿一樣會讓 AI 表現變差。一份被廣泛引用的研究〈Lost in the Middle〉發現,當關鍵資訊被放在很長 context 的「中間」時,模型抓取的表現明顯下降;放在開頭或結尾反而最準。Anthropic 官方文件也直接點名這件事,稱為 context rot(脈絡腐化)——隨著 token 數變多,準確度和召回率會跟著下降。

換句話說,「塞好塞滿」不會讓 AI 更聰明,反而更容易漏看重點。這也和 AI 幻覺 有關:當 AI 在一堆雜訊裡找不到你要的資訊,它有時不會老實說「找不到」,而是自信地編一個給你。

我們的立場很直接:context window 的大小是行銷數字,不是使用品質的保證。看到「支援 100 萬 token」,不代表你就該把 100 萬 token 全塞進去。


一般人可以怎麼應對(實用 3 招)

好消息是,你不需要懂任何技術,就能大幅改善 AI 的「記性」。三招:

第 1 招:該開新對話就開新對話。 當一個對話已經聊很久、話題又換了,別戀舊。開一個乾淨的新對話,把真正重要的背景用兩三句話重講一次。這比在一個又長又亂的舊對話裡硬凹好太多——舊對話的雜訊只會拖累它。

第 2 招:主動給重點,別讓它自己翻。 與其說「我們前面聊的那個方案」,不如直接把那個方案的重點再貼一次。AI 沒有義務、也不一定翻得到前面。你把重點端到它眼前,它才不會漏。

第 3 招:把關鍵資料貼進來,而不是要它「記住」。 需要它根據某份文件、某段規格回答時,就在問問題的當下把那段內容貼上去。這等於手動幫它把重要文件放到桌面正中央——比依賴它「記得」可靠得多。

一句話總結我們的建議:別跟一個快滿出來的對話硬拗,學會分段、給重點、貼資料。 這三個習慣,比換一個更貴的模型更能立刻改善你的使用體驗。

如果你想更進一步了解專業人士怎麼「管理 context」(例如摘要壓縮、分段策略、外接資料庫),可以看進階的 Context Window 管理——那是另一個層次的門道了。


常見問題

Context window 越大越好嗎?

不一定。大視窗的好處是「一次能塞更多資料」,但塞得多不等於答得準。研究和官方文件都指出,資訊塞太滿、或埋在很長內容的中間時,AI 反而容易漏看重點。與其追求最大的視窗,不如學會只放真正相關的資料進去。

開新對話後,AI 就完全忘光之前聊的了嗎?

在「這一次的對話視窗」裡,是的——新對話對舊對話的內容一無所知,這也正是它乾淨、不被雜訊拖累的原因。例外是有些工具有「跨對話記憶」功能(例如記住你的偏好),但那是另外存起來的資料,和 context window 是兩回事。想延續內容,就把重點自己貼過去。

為什麼 AI 有時回答到一半就突然停住?

那多半不是 context window 滿了,而是撞到「單次輸出上限」——模型一次能吐出的 token 有個天花板。這兩個限制不一樣:一個管「總共能記多少」,一個管「這次能寫多長」。遇到寫一半停住,通常打「請繼續」就會接下去。

我怎麼知道對話「快滿了」?

一般網頁版不會直接顯示 token 用量,但有幾個徵兆可以判斷:AI 開始前後矛盾、忘記你一開始的設定、重複問你已經講過的事,或回答明顯變得空泛。出現這些訊號,就是該開新對話、重貼重點的時候了。


參考來源

№ · further reading

延伸閱讀