AI News HubLIVE
站内改写2 分钟阅读

AI代码看起来干净,这就是陷阱

一项AI编程竞赛显示,前沿模型生成的代码虽然表面上看起来很专业,但在真实数据和时间压力下,往往因细微错误而失败。竞赛揭示了AI编码的致命弱点:代码看似正确,却无法应对边缘情况。

来源Hacker News AI作者: bazlightyear

近日,一场由ThinkPol发起的AI编程竞赛揭示了当前前沿AI模型在编码任务中的致命弱点。该竞赛要求多个前沿AI模型(包括Nemotron、MiniMax、Gemini、DeepSeek、GLM、Grok、Kimi、ChatGPT等)根据一份规格说明编写Python代码,并让这些代码实时连接到TCP服务器,解决一系列算法挑战。每个模型只有一次机会,且只能使用标准库,没有反馈循环。竞赛条件并不苛刻:固定的、文档化的协议,没有对抗性输入,没有并发,没有安全模型,没有模式演变,没有部分失败,没有真实世界的数据损坏。然而,大多数前沿模型生成的代码要么无法正确连接,要么误解最基本的行格式,要么在遇到意外情况时悄无声息地崩溃。在18个挑战中,一个典型例子是“CollectTheDots”问题:每个机器人需要用最少的非重叠圆覆盖矩形内的N个点,共十轮,点数从50到100不等。Nemotron的解析器读取DOT行时,错误地使用字段索引1作为x坐标,索引2作为y坐标,导致索引偏移一位,所有提交均被服务器拒绝。MiniMax则因浮点精度问题,在接近边界时添加微小容差,导致六轮提交被拒。Gemini的机器人有299行代码,但开始后96毫秒就断开连接,且由于过度使用try/except,没有留下任何错误信息。DeepSeek在前七轮表现出色,但在第8轮时,因网格分辨率不匹配,从领先跌至最后。GLM在前四轮有效,但从第5轮开始超时。最终Grok获胜,但并非因为解法最优,而是其错误破坏性最小。在其他挑战中,如WarehouseRobot,Nemotron的解析器因检查令牌数量错误而忽略所有ITEM行;PalinPrimeBits中,Kimi因种子错误而大部分时间失败,却因偶然在第10轮正确;Blurry Image Reveal中,ChatGPT和MiMo因解析大图像数据超时,而Gemini以简洁的代码获胜。这些失败都表明,当前AI模型擅长模仿代码的表面外观,但无法验证代码在所有输入下的正确性。它们优化的是“看起来像见过的代码”,而非“能经受住考验的代码”。实际开发中,人类通过运行、看到失败、迭代修复来弥补这一缺陷。一旦去掉人类监督,AI代码就会暴露出巨大的风险。竞赛主理人总结道:“代码仅仅看起来完成是不够的。在这个竞赛中,最不脆弱的代码获胜;在现实系统中,这可能还不够——因为失败的代价不仅是少一块奖牌,而是各种只有在未经测试条件下才会出现的故障。”完整比赛结果和所有18个挑战的机器人源代码可在aicc.rayonnant.ai上查看。