AI News HubLIVE
站內改寫2 分鐘閱讀

AI代碼看起來乾淨,這就是陷阱

一項AI編程競賽顯示,前沿模型生成的代碼雖然表面上看起來很專業,但在真實數據和時間壓力下,往往因細微錯誤而失敗。競賽揭示了AI編碼的致命弱點:代碼看似正確,卻無法應對邊緣情況。

來源Hacker News AI作者: bazlightyear

近日,一場由ThinkPol發起的AI編程競賽揭示了當前前沿AI模型在編碼任務中的致命弱點。該競賽要求多個前沿AI模型(包括Nemotron、MiniMax、Gemini、DeepSeek、GLM、Grok、Kimi、ChatGPT等)根據一份規格説明編寫Python代碼,並讓這些代碼實時連接到TCP服務器,解決一系列算法挑戰。每個模型只有一次機會,且只能使用標準庫,沒有反饋循環。競賽條件並不苛刻:固定的、文檔化的協議,沒有對抗性輸入,沒有併發,沒有安全模型,沒有模式演變,沒有部分失敗,沒有真實世界的數據損壞。然而,大多數前沿模型生成的代碼要麼無法正確連接,要麼誤解最基本的行格式,要麼在遇到意外情況時悄無聲息地崩潰。在18個挑戰中,一個典型例子是“CollectTheDots”問題:每個機器人需要用最少的非重疊圓覆蓋矩形內的N個點,共十輪,點數從50到100不等。Nemotron的解析器讀取DOT行時,錯誤地使用字段索引1作為x座標,索引2作為y座標,導致索引偏移一位,所有提交均被服務器拒絕。MiniMax則因浮點精度問題,在接近邊界時添加微小容差,導致六輪提交被拒。Gemini的機器人有299行代碼,但開始後96毫秒就斷開連接,且由於過度使用try/except,沒有留下任何錯誤信息。DeepSeek在前七輪表現出色,但在第8輪時,因網格分辨率不匹配,從領先跌至最後。GLM在前四輪有效,但從第5輪開始超時。最終Grok獲勝,但並非因為解法最優,而是其錯誤破壞性最小。在其他挑戰中,如WarehouseRobot,Nemotron的解析器因檢查令牌數量錯誤而忽略所有ITEM行;PalinPrimeBits中,Kimi因種子錯誤而大部分時間失敗,卻因偶然在第10輪正確;Blurry Image Reveal中,ChatGPT和MiMo因解析大圖像數據超時,而Gemini以簡潔的代碼獲勝。這些失敗都表明,當前AI模型擅長模仿代碼的表面外觀,但無法驗證代碼在所有輸入下的正確性。它們優化的是“看起來像見過的代碼”,而非“能經受住考驗的代碼”。實際開發中,人類通過運行、看到失敗、迭代修復來彌補這一缺陷。一旦去掉人類監督,AI代碼就會暴露出巨大的風險。競賽主理人總結道:“代碼僅僅看起來完成是不夠的。在這個競賽中,最不脆弱的代碼獲勝;在現實系統中,這可能還不夠——因為失敗的代價不僅是少一塊獎牌,而是各種只有在未經測試條件下才會出現的故障。”完整比賽結果和所有18個挑戰的機器人源代碼可在aicc.rayonnant.ai上查看。