回到頂部
提示模板、可替換變數卡、測試案例列、雙版本輸出與修訂印章組成提示工程工作台

Claude Console Workbench 教學:Prompt Generator、變數與 Eval

Claude Console 適合把聊天 prompt 變成可重複測試的 API 模板。從 Workbench、雙大括號變數、Prompt Improver 到 Evaluation Tool 實作一次看懂。

內容查核: 來源查核:

Claude Console Workbench 適合已經在 Claude 試出一個有用做法,準備把它變成 API 功能的人。它能把固定指令與每次變動的內容拆開,批次換測試案例,比在一般聊天裡複製貼上更容易比較版本。

如果只是個人問答、寫作或整理文件,留在 claude.ai;若要管理單一專案知識,先看 Claude Projects;要做可重複 API prompt、匯出程式碼與 eval,才進 Claude Console。三個入口資料與帳務範圍不同,不能因為都叫 Claude 就混著用。

建立第一個可測模板

先選一個重複任務,例如客服工單分流。固定內容寫任務定義、分類規則與輸出格式;每張工單內容用 {{ticket}} 變數。Claude Console 以雙大括號辨識動態欄位,Evaluation Tool 也需要至少 1–2 個變數才能建立 test set。

接著放 10–20 個真實但已去識別的案例:正常案例只占一半,另外加入資訊不足、同時包含兩種意圖、情緒強烈與不在分類表內的內容。先定成功標準,例如分類正確、JSON 可解析、理由不超過 40 字,再跑模型。

只要結果會影響客戶、金流、醫療、法律或權限,輸出必須保留人工確認。Console 能讓 prompt 更穩,無法把高風險任務變成零監督工作。

Prompt Generator 和 Improver 怎麼用?

Prompt Generator 解決空白頁問題:描述任務、輸入與理想輸出,讓工具先產生含變數的模板,再由你刪掉不必要規則。它適合建立第一版,不適合直接當正式規格。

Prompt Improver 用在「已有 prompt,但知道哪裡常失敗」。輸入原模板、目前問題、範例 input 與 ideal output,它會重整結構、XML tags、examples 和推理指令。官方也提醒,改善後的模板常更長、更完整,可能提高延遲與成本;分類、抽取等簡單任務若原本已穩定,不必為了看起來專業而變複雜。

改善後一定回到同一組 test cases 比較。只看新版的兩個漂亮輸出,無法知道舊案例是否退步。

Evaluation Tool 怎麼判斷版本?

Console 可手動新增案例、逐筆生成案例或匯入 CSV,也能把多個 prompt 版本並排執行。先用真實案例建立基準,再讓 Test Case Generator 補你沒想到的邊界;生成案例必須人工檢查,否則模型可能同時出題、作答又評自己。

評分時不要只用「喜不喜歡」。抽取任務看欄位正確率與解析失敗;客服草稿看政策符合、資訊完整與需重寫比例;摘要看關鍵事實遺漏。Console 的 5 分制可以快速標記品質,但正式上線仍應把案例與指標帶進 LLM 評測流程

常見問題

Claude Console 和 claude.ai 差在哪?

claude.ai 是一般使用者的聊天與工作產品;Console 是 Claude API 的開發平台,用來管理 key、prompt template、Workbench、eval 與程式串接,費用與權限也要分開確認。

Workbench 一定要會寫程式嗎?

前期測 prompt 不一定,但要把成果放進網站、內部工具或自動化,仍需要理解 API key、伺服器端呼叫、錯誤處理、成本與資料安全。

Prompt Generator 產生的模板可以直接上線嗎?

不建議。先刪除不必要規則,加入真實案例與成功標準,再用 Evaluation Tool 跑邊界案例。高風險輸出還要人工覆核。

Prompt Improver 一定會讓結果更好嗎?

不一定。它可能提高複雜任務的穩定性,也可能讓 prompt 變長、速度變慢、費用上升。請用同一組 test cases 比較品質、延遲與 token 成本。

參考來源

№ · further reading

延伸閱讀