AI News HubLIVE
站內改寫2 分鐘閱讀

AI程式碼看起來乾淨,這就是陷阱

一項AI程式設計競賽顯示,前沿模型生成的程式碼雖然表面上看起來很專業,但在真實資料和時間壓力下,往往因細微錯誤而失敗。競賽揭示了AI編碼的致命弱點:程式碼看似正確,卻無法應對邊緣情況。

來源Hacker News AI作者: bazlightyear

近日,一場由ThinkPol發起的AI程式設計競賽揭示了當前前沿AI模型在編碼任務中的致命弱點。該競賽要求多個前沿AI模型(包括Nemotron、MiniMax、Gemini、DeepSeek、GLM、Grok、Kimi、ChatGPT等)根據一份規格說明編寫Python程式碼,並讓這些程式碼即時連線到TCP伺服器,解決一系列演算法挑戰。每個模型只有一次機會,且只能使用標準庫,沒有反饋迴圈。競賽條件並不苛刻:固定的、文件化的協議,沒有對抗性輸入,沒有併發,沒有安全模型,沒有模式演變,沒有部分失敗,沒有真實世界的資料損壞。然而,大多數前沿模型生成的程式碼要麼無法正確連線,要麼誤解最基本的行格式,要麼在遇到意外情況時悄無聲息地崩潰。在18個挑戰中,一個典型例子是“CollectTheDots”問題:每個機器人需要用最少的非重疊圓覆蓋矩形內的N個點,共十輪,點數從50到100不等。Nemotron的解析器讀取DOT行時,錯誤地使用欄位索引1作為x座標,索引2作為y座標,導致索引偏移一位,所有提交均被伺服器拒絕。MiniMax則因浮點精度問題,在接近邊界時新增微小容差,導致六輪提交被拒。Gemini的機器人有299行程式碼,但開始後96毫秒就斷開連線,且由於過度使用try/except,沒有留下任何錯誤資訊。DeepSeek在前七輪表現出色,但在第8輪時,因網格解析度不匹配,從領先跌至最後。GLM在前四輪有效,但從第5輪開始超時。最終Grok獲勝,但並非因為解法最優,而是其錯誤破壞性最小。在其他挑戰中,如WarehouseRobot,Nemotron的解析器因檢查令牌數量錯誤而忽略所有ITEM行;PalinPrimeBits中,Kimi因種子錯誤而大部分時間失敗,卻因偶然在第10輪正確;Blurry Image Reveal中,ChatGPT和MiMo因解析大影像資料超時,而Gemini以簡潔的程式碼獲勝。這些失敗都表明,當前AI模型擅長模仿程式碼的表面外觀,但無法驗證程式碼在所有輸入下的正確性。它們最佳化的是“看起來像見過的程式碼”,而非“能經受住考驗的程式碼”。實際開發中,人類透過執行、看到失敗、迭代修復來彌補這一缺陷。一旦去掉人類監督,AI程式碼就會暴露出巨大的風險。競賽主理人總結道:“程式碼僅僅看起來完成是不夠的。在這個競賽中,最不脆弱的程式碼獲勝;在現實系統中,這可能還不夠——因為失敗的代價不僅是少一塊獎牌,而是各種只有在未經測試條件下才會出現的故障。”完整比賽結果和所有18個挑戰的機器人原始碼可在aicc.rayonnant.ai上檢視。