回到頂部
文字經過 Token、向量、Attention 與推理步驟後生成 AI 回答的流程

AI 怎麼產生回答?Token、上下文、Attention 與推理一次看懂

AI 真的會思考嗎?從 Token、向量、Transformer、上下文視窗到推理模型,逐步看懂 ChatGPT 如何把輸入變成回答,以及每一步會錯在哪裡。

內容查核: 連結查核: 來源查核:

本文含聯盟連結

ChatGPT 回答得像在思考,但畫面背後沒有一個人類式的小腦袋在默念答案。比較準確的描述是:模型把你的文字轉成 Token,根據上下文計算彼此關係,再一個 Token 接一個 Token 產生輸出。

理解這條流程很實用。你會知道為什麼長對話會漏掉早期細節、為什麼同一句提示詞可能得到不同答案,也會知道推理模式可以改善哪些任務,卻不能取代查證。

第一步:文字先被切成 Token

Token 是模型處理文字的單位,可以是一個字、字的一部分、標點或多個字的組合。原始句子會先轉成一串 Token 編號,才進入後續運算。

切法由分詞器決定。同一句中文交給不同模型,Token 數量可能不同;英文單字也可能被拆成數段。因此「一個中文字固定等於幾個 Token」或「中文一定比英文多幾倍」都不可靠。要估 API 費用或文件長度,應使用該模型的計算工具,例如 OpenAI Tokenizer或相應 SDK,而不是套固定比例。

Token 會影響三件事:輸入能放多少資料、輸出最多能有多長,以及按 Token 計價的 API 成本。更完整的估算方式可看 Token 入門

第二步:Token 變成可計算的向量

Token 編號本身沒有語意。模型會把它轉成一組數值,並加入位置與上下文資訊。經過多層運算後,同一個詞在不同句子裡會形成不同表示。

例如「蘋果發表新產品」和「我吃了一顆蘋果」中的「蘋果」,字面相同,附近的詞卻讓模型判斷前者比較像公司,後者比較像水果。這比「把每個詞固定放在一張三維地圖」更接近現代語言模型的運作方式。

向量也讓語意搜尋、文件分類與 RAG 能找出用詞不同但意思接近的內容。不過相似代表模式接近,不等於模型已經核實事實。

第三步:Attention 計算前後文的關係

2017 年的 Attention Is All You Need 論文提出 Transformer 架構。它的核心之一是 self-attention:處理某個 Token 時,計算它和同一段序列中其他 Token 的關聯,再把相關資訊整合進新的表示。

你可以把它想成「每個詞都在查看目前句子裡哪些位置和自己有關」。但 Attention 權重不是人類注意力,也不能直接當成模型思考理由。它只是神經網路中的計算機制。

這套架構可以在大量資料上學會語法、文體、知識關聯與解題模式。模型最後根據目前所有可見內容,計算下一個 Token 的機率,再反覆生成,直到答案完成或碰到輸出上限。

上下文視窗是工作區,不是永久記憶

上下文視窗指一次請求中模型能處理的 Token 範圍。它可能包含系統指令、你的問題、先前對話、上傳文件、工具結果、模型輸出與內部使用的 Token;不能只把產品頁寫的上限全部留給一份文件。

更大的視窗適合長文件、程式碼庫與多輪任務,但「放得下」不等於「每段都記得一樣好」。資訊埋在大量無關內容中、前後矛盾或切分位置不佳,都可能使模型漏讀。重要資料應放在清楚標題下,要求模型引用段落或頁碼,再用問題測試它是否真的找到。

聊天產品若提供跨對話記憶,那通常是另一套儲存與檢索功能。上下文視窗會隨請求重新組成,不應當成無限、永久又精準的記憶。

推理模型多做了什麼

推理模型會在回答前使用額外運算,處理分解、規劃、驗算或工具選擇。這類模型通常更適合數學、程式、科學分析與多條件規劃。以 OpenAI 為例,官方模型目錄會分別標示推理等級、上下文、最大輸出與工具支援,選型時應看任務而不是只看名稱。

「使用額外推理 Token」不等於模型擁有人類的後設認知,也不代表使用者看到的說明就是完整內部過程。你真正能驗收的是最後答案、可重現步驟、引用與工具結果。

簡單翻譯、改寫和分類通常不需要最高推理強度;複雜除錯、約束很多的計畫或需要反覆驗算的問題才值得多花時間與成本。

從輸入到回答,完整流程長這樣

  1. 切分:文字被分詞器轉成 Token。
  2. 表示:Token 轉成向量,加入位置與上下文資訊。
  3. 關聯:Transformer 多層計算 Token 之間的關係。
  4. 預測:模型依目前脈絡計算下一個 Token 的機率。
  5. 生成:選出 Token,放回脈絡,再預測下一個。
  6. 工具與推理:視模型和任務,先搜尋、執行程式、讀檔或使用額外推理計算。

這個流程可以產生非常有用的答案,也解釋了 AI 幻覺為什麼存在:模型原生目標是生成合適的後續文字,答案流暢並不能證明每個事實都正確。

知道原理後,提示詞可以怎麼改

給足資料,也要刪掉雜訊。 與其丟進十份文件,不如先說明哪一份是規則、哪一份是資料、衝突時以誰為準。

把要求寫成可驗收結果。 要模型列引用段落、計算步驟、假設與待確認資訊,比要求「深入思考」更容易檢查。可以直接套用 Prompt 七格公式

高風險答案仍要外部查核。 推理模式和大上下文會提高能力,卻不提供正確保證。數字、法條、論文、醫療與財務資訊應回到原始來源。

常見問題

一個中文字等於幾個 Token?

沒有固定答案。分詞器、字詞常見程度、前後文和模型版本都會影響切法。要估成本或長度,請用該模型官方 Tokenizer 或 SDK 實際計算。

上下文視窗越大,回答一定越準嗎?

不一定。大視窗能容納更多資料,但無關內容、矛盾資料與不清楚的文件結構仍會干擾檢索。先整理資料、標示優先順序並要求引用,比單純塞滿上限更重要。

Attention 就是 AI 在關注重要句子嗎?

這是方便理解的比喻,但不完全準確。Attention 是計算序列各位置關聯的機制,權重不等於人類注意力,也不能單獨證明模型為什麼下某個結論。

推理模型會比一般模型更可靠嗎?

它在多步驟推理、程式與規劃任務通常更有優勢,但仍可能算錯、接受錯誤前提或捏造來源。是否可靠要靠你的測試集、可重現步驟與外部證據判斷。

資料來源

№ · further reading

延伸閱讀