ChatGPT 回答得像在思考,但畫面背後沒有一個人類式的小腦袋在默念答案。比較準確的描述是:模型把你的文字轉成 Token,根據上下文計算彼此關係,再一個 Token 接一個 Token 產生輸出。
理解這條流程很實用。你會知道為什麼長對話會漏掉早期細節、為什麼同一句提示詞可能得到不同答案,也會知道推理模式可以改善哪些任務,卻不能取代查證。
第一步:文字先被切成 Token
Token 是模型處理文字的單位,可以是一個字、字的一部分、標點或多個字的組合。原始句子會先轉成一串 Token 編號,才進入後續運算。
切法由分詞器決定。同一句中文交給不同模型,Token 數量可能不同;英文單字也可能被拆成數段。因此「一個中文字固定等於幾個 Token」或「中文一定比英文多幾倍」都不可靠。要估 API 費用或文件長度,應使用該模型的計算工具,例如 OpenAI Tokenizer或相應 SDK,而不是套固定比例。
Token 會影響三件事:輸入能放多少資料、輸出最多能有多長,以及按 Token 計價的 API 成本。更完整的估算方式可看 Token 入門。
第二步:Token 變成可計算的向量
Token 編號本身沒有語意。模型會把它轉成一組數值,並加入位置與上下文資訊。經過多層運算後,同一個詞在不同句子裡會形成不同表示。
例如「蘋果發表新產品」和「我吃了一顆蘋果」中的「蘋果」,字面相同,附近的詞卻讓模型判斷前者比較像公司,後者比較像水果。這比「把每個詞固定放在一張三維地圖」更接近現代語言模型的運作方式。
向量也讓語意搜尋、文件分類與 RAG 能找出用詞不同但意思接近的內容。不過相似代表模式接近,不等於模型已經核實事實。
第三步:Attention 計算前後文的關係
2017 年的 Attention Is All You Need 論文提出 Transformer 架構。它的核心之一是 self-attention:處理某個 Token 時,計算它和同一段序列中其他 Token 的關聯,再把相關資訊整合進新的表示。
你可以把它想成「每個詞都在查看目前句子裡哪些位置和自己有關」。但 Attention 權重不是人類注意力,也不能直接當成模型思考理由。它只是神經網路中的計算機制。
這套架構可以在大量資料上學會語法、文體、知識關聯與解題模式。模型最後根據目前所有可見內容,計算下一個 Token 的機率,再反覆生成,直到答案完成或碰到輸出上限。
上下文視窗是工作區,不是永久記憶
上下文視窗指一次請求中模型能處理的 Token 範圍。它可能包含系統指令、你的問題、先前對話、上傳文件、工具結果、模型輸出與內部使用的 Token;不能只把產品頁寫的上限全部留給一份文件。
更大的視窗適合長文件、程式碼庫與多輪任務,但「放得下」不等於「每段都記得一樣好」。資訊埋在大量無關內容中、前後矛盾或切分位置不佳,都可能使模型漏讀。重要資料應放在清楚標題下,要求模型引用段落或頁碼,再用問題測試它是否真的找到。
聊天產品若提供跨對話記憶,那通常是另一套儲存與檢索功能。上下文視窗會隨請求重新組成,不應當成無限、永久又精準的記憶。
推理模型多做了什麼
推理模型會在回答前使用額外運算,處理分解、規劃、驗算或工具選擇。這類模型通常更適合數學、程式、科學分析與多條件規劃。以 OpenAI 為例,官方模型目錄會分別標示推理等級、上下文、最大輸出與工具支援,選型時應看任務而不是只看名稱。
「使用額外推理 Token」不等於模型擁有人類的後設認知,也不代表使用者看到的說明就是完整內部過程。你真正能驗收的是最後答案、可重現步驟、引用與工具結果。
簡單翻譯、改寫和分類通常不需要最高推理強度;複雜除錯、約束很多的計畫或需要反覆驗算的問題才值得多花時間與成本。
從輸入到回答,完整流程長這樣
- 切分:文字被分詞器轉成 Token。
- 表示:Token 轉成向量,加入位置與上下文資訊。
- 關聯:Transformer 多層計算 Token 之間的關係。
- 預測:模型依目前脈絡計算下一個 Token 的機率。
- 生成:選出 Token,放回脈絡,再預測下一個。
- 工具與推理:視模型和任務,先搜尋、執行程式、讀檔或使用額外推理計算。
這個流程可以產生非常有用的答案,也解釋了 AI 幻覺為什麼存在:模型原生目標是生成合適的後續文字,答案流暢並不能證明每個事實都正確。
知道原理後,提示詞可以怎麼改
給足資料,也要刪掉雜訊。 與其丟進十份文件,不如先說明哪一份是規則、哪一份是資料、衝突時以誰為準。
把要求寫成可驗收結果。 要模型列引用段落、計算步驟、假設與待確認資訊,比要求「深入思考」更容易檢查。可以直接套用 Prompt 七格公式。
高風險答案仍要外部查核。 推理模式和大上下文會提高能力,卻不提供正確保證。數字、法條、論文、醫療與財務資訊應回到原始來源。
常見問題
一個中文字等於幾個 Token?
沒有固定答案。分詞器、字詞常見程度、前後文和模型版本都會影響切法。要估成本或長度,請用該模型官方 Tokenizer 或 SDK 實際計算。
上下文視窗越大,回答一定越準嗎?
不一定。大視窗能容納更多資料,但無關內容、矛盾資料與不清楚的文件結構仍會干擾檢索。先整理資料、標示優先順序並要求引用,比單純塞滿上限更重要。
Attention 就是 AI 在關注重要句子嗎?
這是方便理解的比喻,但不完全準確。Attention 是計算序列各位置關聯的機制,權重不等於人類注意力,也不能單獨證明模型為什麼下某個結論。
推理模型會比一般模型更可靠嗎?
它在多步驟推理、程式與規劃任務通常更有優勢,但仍可能算錯、接受錯誤前提或捏造來源。是否可靠要靠你的測試集、可重現步驟與外部證據判斷。