AI News HubLIVE
站内改写2 分钟阅读

人类制作,非生成式AI

该项目提供徽章,用于标识项目未使用生成式AI(尤其是LLM)创建。文章详细讨论了AI在代码生成中的问题,包括版权侵犯、引入更多bug、生态破坏以及AI自我污染等,旨在鼓励透明度和减少AI滥用。

来源Hacker News AI作者: monax

由Supercip971创建的“by-human”项目旨在提供一系列徽章,以表明项目未使用生成式AI(尤其是大型语言模型)进行创作。使用徽章的条件是确保AI生成的代码占总代码行数的比例低于1%。即使无法精确统计AI代码比例,但只要认同反对AI滥用的立场,仍可使用该徽章。项目目标是提高透明度,减少代码库中对AI的过度依赖。

该项目还附带了一份基于科学研究的解释文档,用以支持其各项主张,但该部分仍在完善中。项目明确规定了AI的预期使用方式:不应使用AI生成代码,但可将其用作智能搜索(如grep或Google)、代码审查助手、学习代码库(如通过示例学习)、请求调试帮助(但不编写修复代码)、询问功能实现思路(但不编写最终实现)。每次使用AI辅助思考后,必须由人类审查并承担责任。AI应谨慎使用,仅在人类无法提供快速解决方案时才考虑,同时需考虑能耗和生态足迹。

文章详细阐述了为何认为生成式AI编写代码存在问题。首先是版权、抄袭和许可证清洗问题。AI可能在无意中进行许可证清洗,已有案例显示Claude Code被用来“重写”整个项目,并将许可证从LGPL改为MIT,这明显违反了许可证规定。此外,LLM在训练时无法理解代码许可证,研究显示其生成的代码中有3.35%来自强copyleft许可,且无法通过提示避免。这不同于人类学习代码后基于理解进行创作,LLM只是记忆并逐字输出,导致许可证侵权风险。

其次是引入大量bug。数据表明,Chat-GPT 4的即时失败率约为8%,代码质量仅在60%的情况下合格。AI在pull request中引入70%的重大缺陷和40%的关键问题,是人类的两倍。GitHub Copilot在发现漏洞方面能力有限,仅能修正拼写错误。自AI引入以来,代码的回退率从3.97%上升至7.09%,导致技术债务积累。更严重的是,AI会使用户产生虚假的能力提升感:在练习中AI使用者的成绩可能提高48-127%,但在实际测试中反而下降17%,且用户无法意识到自己学习效果变差。

生态方面,AI的资源消耗惊人。70%的RAM生产专用于数据中心,Chat-GPT的功耗一年内增长98%(从2022年的2.69 MW增至2023年的5.43 MW)。每天处理25亿次请求,消耗约804,400升水。单个Chat-GPT 4.5请求能耗约为20.5千瓦时。尽管这些数字存在估算成分,但AI对环境的负面影响不容忽视。此外,AI模型正面临“近亲繁殖”问题:LLM的训练数据中越来越多是由AI自身生成的代码,且无法区分人类与AI代码,导致训练质量下降。微软曾表示,LLM生成的代码中有40%未经修改就被使用。仅需20份文档就能污染任意规模的LLM。

计算能力的增长也面临瓶颈。AI的发展依赖更强大的硬件、更多数据和更多训练,但这些资源有限。有研究指出,Sutton的“苦涩教训”部分错误,因为AI的进步并非源于计算成本的持续下降,而是资源投入的不断增加。当资源无法满足需求时,AI产业可能崩溃,而过度依赖AI的人将无法找回失去的知识。

总而言之,使用AI编写代码看似神奇,但实则让开发者变得更差,破坏环境和经济,同时污染自身数据集。投资者不断投入巨资,但回报却越来越少。这不过是一块暂时的“闪亮石头”,最终会褪色。