AI News HubLIVE
站內改寫1 分鐘閱讀

TraceCoder:通過位置鍵片段版本控制實現可解釋、可審計的代碼生成

LLM代碼生成通常是不透明的黑盒。TraceCoder 提出三種互補機制——關係型片段歷史模式、瀏覽器可視化工具和分數位置鍵索引方案——使代碼生成的“敍事”可審計、可重放。在30個算法任務上評估,平均Chg%達到30%,30%的代碼片段帶有可追溯修復記錄。

來源arXiv AI作者: Rwaida Alssadi, Muntaser Syed, Balaji Kasula, Lamine Deen, Majed Alotaibi, Mohammed Alghamdi, Tyler Ton, Ali Alqarni, Marius Silaghi

在當今的軟件開發中,基於大語言模型(LLM)的編程助手已經能自動生成大量代碼,但這些代碼往往被視為“黑盒”輸出:每一行代碼背後的推理過程不可見,基準驅動的修復過程中代碼如何演變也無從追蹤,事後審計幾乎不可能。針對這一痛點,一篇新論文提出了 TraceCoder 概念,旨在通過三種互補機制讓自動代碼生成的內部“敍事”變得可審計、可重放。

TraceCoder 的第一種機制是關係型片段歷史模式。該模式針對每次修復事件記錄基準引用、輪次編號、失敗文本以及 LLM 的解釋,從而支持完整的溯源查詢。第二種機制是瀏覽器端可視化工具,將這段歷史渲染為熱力圖映射、懸停註釋的源代碼,使用户能直觀地看到每個代碼片段受到哪些基準失敗的影響。第三種機制則是競爭性的分數位置鍵索引方案,配合樹節點分隔符,為每個代碼片段分配穩定且字典序排列的標識符,在不干擾相鄰代碼行的前提下實現細粒度追蹤。

研究團隊在 30 個算法編程任務上對 TraceCoder 進行了評估,這些任務覆蓋字符串處理、數學計算和數據結構操作,並使用了兩種提供方配置。結果顯示,其中有 10 個任務在具有微妙邊界行為的情況下耗盡了 6 次迭代預算。平均變動百分比(Chg%)達到 30%,約十分之三的代碼片段帶有可追蹤的修復事件行;而在一個 20 任務子集中,當僅使用 Gemini 2.0 Flash 作為提供方時,這一比例為 21%。論文還通過三個詳細案例研究展示了系統如何解釋哪些具體的基準失敗塑造了最終程序的每一行。

這一成果的意義在於,它為生產環境中的信任和責任提供了關鍵支撐。當代碼生成過程不再是黑盒,開發者和審計者就能回放並核查自動修復的每個步驟,從而更容易發現錯誤、評估風險並建立對模型的信心。TraceCoder 目前以 arXiv 預印本形式發佈,並被 AGENTICS 2026(2026 年 5 月截止日期提交版本)接收。