一份叫 SWE-Explore 的研究,把 AI coding agent 的修 bug 流程拆開,先問一個更前面的問題:agent 在動手改之前,到底有沒有找到真正該讀的那幾行程式碼? 它涵蓋 848 個 issue、203 個開源 repo、10 種語言,並把「成功修復軌跡中實際讀過的行」蒸餾成標準答案。
結果很值得每個用 coding agent 的團隊記住:通用的 AI coding agent,「找對檔案」的命中率約 66%,但「找對該改的那幾行」只有 14 到 19%。也就是說,它常常進對了房間,卻找錯抽屜。 而更關鍵、也最反直覺的一點是——主要的通用 agent(Claude Code、Codex、OpenHands 等)在這件事上的分數幾乎沒差。這代表它是架構和方法的瓶頸,不是模型強弱的問題。
所以對台灣團隊,這篇研究的結論很直接:別急著升級到最貴的模型,那救不了 context 問題。真正的槓桿,是把你的 issue、文件、測試補好。
研究到底發現什麼
先看幾個關鍵數字(都出自論文與 The Decoder 的整理)。通用 agent 的「檔案級」定位約 66%、但「行級」只有 14 到 19%——這個落差就是「找對檔案、找不對行」的證據。相對地,一個專門做程式碼定位的系統 CoSIL,能把行級命中拉到約 0.79(不過它的檔案級反而較弱),說明「找對行」是一個可以被專門優化的能力,而通用 agent 目前還沒做好。
還有兩個發現對實務特別有用。第一,研究發現修復成功率的跳升,發生在「關鍵 context 涵蓋率介於 50% 到 75%」之間——低於 50%,agent 幾乎只修得動簡單題。第二,「漏看」比「多看」更傷:少讀到關鍵證據的代價,遠大於多讀了一些冗餘內容。把這兩點合起來看,重點很清楚:讓 agent 讀到夠多對的 context,比換一個更聰明的模型重要。
對台灣團隊:別急著換更貴的模型
台灣的開發圈,很多討論還停在「Claude Code、Codex、Copilot 該選誰、哪個便宜」。但這份研究說的是:在「找對 context」這件事上,這些通用 agent 幾乎沒差,換模型救不了。
而台灣團隊真實的瓶頸,剛好和論文的結論同構:issue 寫得太短、repo 文件不全、關鍵的 domain knowledge 鎖在資深工程師的腦子裡——這些等於人為壓低了 agent 能讀到的 context 品質。論文的「漏看比多看更傷」加上「涵蓋率 50% 才開始修得動」,等於把台灣團隊「文件債」的代價量化了。導入 Claude Code、Codex、Antigravity 類工具 時,很多團隊才發現自家的編碼風格、分支策略、命名規則從沒正式文件化——這正是 agent 找不對 context 的根因。
哪類任務適合交給 agent
用「找對檔案、找不對行」這個事實,就能給出很實用的分層:
- 適合交(context 淺、範圍明確):單檔或已知模組內的 bug——人先用 grep 或 stack trace 把檔案指出來,agent 補那幾行;樣板化改動,例如加 log、改 API 呼叫、rename、寫符合既有 pattern 的測試;以及有清楚 reproduction 和預期行為的 issue(等於幫 agent 把 context 涵蓋率推過 50% 門檻)。
- 有條件才交:跨多檔案、需要理解呼叫鏈或相容性的改動——要求 agent 先輸出一份「context 計畫」再動手。
- 暫時別全交:隱性的 domain 規則、散在多檔的邊界條件、文件不全的老 monorepo——這些正是 14–19% 命中率會漏掉的部分。
台灣團隊最該把力氣放在哪?不是升級模型,而是補 issue template、reproduction、測試命名和 fixture 文件——直接把 agent 的可讀 context 推過門檻。要把評估做扎實,可用 企業 AI Coding Agent 評估指南;代理一直找不對、一直重試,也會直接燒掉成本,這點在 GitHub 按量計費下的代理成本 有講。
常見問題
AI coding agent 為什麼常常改錯地方?
因為它「找對檔案、卻找不對行」。研究顯示通用 agent 的檔案級定位約 66%,但真正該改的行級命中只有 14–19%。同一個檔案可能上千行,找錯區段就會產生錯的 patch。這是它探索 repository 的能力瓶頸,不是它不會寫 code。
換更強、更貴的模型能解決嗎?
幾乎不能。研究發現主要通用 agent(Claude Code、Codex、OpenHands)在「找對 context」上的分數幾乎相同,這是架構與方法的瓶頸,不是模型強弱。與其花錢升級模型,把 issue 寫清楚、補齊 reproduction 和文件,讓 agent 讀到夠多對的 context,投資報酬高得多。
哪類任務適合交給 coding agent?
context 淺、範圍明確的任務最適合:單檔或已知模組的 bug(人先指出檔案)、樣板化改動(加 log、rename、寫測試)、有清楚 reproduction 的 issue。跨多檔案、需理解呼叫鏈的改動要求它先出 context 計畫;隱性 domain 規則和文件不全的老專案暫時別全交,那正是它最容易漏看的地方。