AI News HubLIVE
站内改写1 分钟阅读

五分钟回顾LLM过去半年:从编码助手到本地模型

Simon Willison在PyCon US 2026上的五分钟闪电演讲,总结了LLM领域过去六个月的关键进展。2025年11月成为转折点:编码代理变得实用,最佳模型多次易手,同时涌现出OpenClaw等个人AI助手,以及Gemini 3.1 Pro、GLM-5.1、Qwen3.6等强大本地模型。

在PyCon US 2026上,Simon Willison用五分钟闪电演讲总结了LLM领域过去六个月的发展。2025年11月是一个关键转折点,编码代理变得真正可用——OpenAI和Anthropic通过强化学习从可验证奖励中大幅提升了模型生成代码的质量。在此之前,最佳模型(按主观感受判断)在Anthropic、OpenAI和Google之间五次易手:9月29日的Claude Sonnet 4.5,11月的GPT-5.1、Gemini 3、GPT-5.1 Codex Max,再到11月24日的Claude Opus 4.5。

Willison使用“生成一只骑自行车的鹈鹕”的测试来展示模型差异。Gemini 3的鹈鹕最佳,但Opus 4.5保持了数月的领先地位。假日期间(12月至1月),许多开发者测试了新模型和编码代理,甚至出现了“LLM妄想症”——Willison本人用“vibe coding”实现了一个JavaScript到Python的移植项目micro-javascript,虽然实用价值有限。

2026年2月,名为Warelay的项目经过多次更名后以OpenClaw之名爆红。OpenClaw是一种“个人AI助手”,而这类工具被统称为“Claws”。硅谷甚至出现Mac Mini抢购潮,因为人们购买它们来运行Claws。Drew Breunig戏称它们像数字宠物,Mac Mini则是完美的“水族箱”。Willison还引用《蜘蛛侠2》中的章鱼博士作为Claws的隐喻——AI触手在防护芯片失效时可能失控。

同期,Google发布了Gemini 3.1 Pro,生成了极佳的动态鹈鹕骑自行车动画,甚至还有青蛙骑小轮车、长颈鹿开微型车等创意内容。同年4月,Google的Gemma 4系列成为美国公司最优秀的开源权重模型。中国AI实验室GLM推出了1.5TB的GLM-5.1,性能强大但硬件要求高。Qwen的Qwen3.6-35B-A3B模型仅20.9GB,可在笔记本上运行,生成的鹈鹕甚至优于Claude Opus 4.7。不过,Willison指出鹈鹕测试已失去基准意义。

总结过去六个月的两大主题:编码代理变得真正可靠,以及本地模型虽弱于前沿但远远超出预期。