AI News HubLIVE
站內改寫1 分鐘閱讀

五分鐘回顧LLM過去半年:從編碼助手到本地模型

Simon Willison在PyCon US 2026上的五分鐘閃電演講,總結了LLM領域過去六個月的關鍵進展。2025年11月成為轉折點:編碼代理變得實用,最佳模型多次易手,同時湧現出OpenClaw等個人AI助手,以及Gemini 3.1 Pro、GLM-5.1、Qwen3.6等強大本地模型。

在PyCon US 2026上,Simon Willison用五分鐘閃電演講總結了LLM領域過去六個月的發展。2025年11月是一個關鍵轉折點,編碼代理變得真正可用——OpenAI和Anthropic通過強化學習從可驗證獎勵中大幅提升了模型生成代碼的質量。在此之前,最佳模型(按主觀感受判斷)在Anthropic、OpenAI和Google之間五次易手:9月29日的Claude Sonnet 4.5,11月的GPT-5.1、Gemini 3、GPT-5.1 Codex Max,再到11月24日的Claude Opus 4.5。

Willison使用“生成一隻騎自行車的鵜鶘”的測試來展示模型差異。Gemini 3的鵜鶘最佳,但Opus 4.5保持了數月的領先地位。假日期間(12月至1月),許多開發者測試了新模型和編碼代理,甚至出現了“LLM妄想症”——Willison本人用“vibe coding”實現了一個JavaScript到Python的移植項目micro-javascript,雖然實用價值有限。

2026年2月,名為Warelay的項目經過多次更名後以OpenClaw之名爆紅。OpenClaw是一種“個人AI助手”,而這類工具被統稱為“Claws”。硅谷甚至出現Mac Mini搶購潮,因為人們購買它們來運行Claws。Drew Breunig戲稱它們像數字寵物,Mac Mini則是完美的“水族箱”。Willison還引用《蜘蛛俠2》中的章魚博士作為Claws的隱喻——AI觸手在防護芯片失效時可能失控。

同期,Google發佈了Gemini 3.1 Pro,生成了極佳的動態鵜鶘騎自行車動畫,甚至還有青蛙騎小輪車、長頸鹿開微型車等創意內容。同年4月,Google的Gemma 4系列成為美國公司最優秀的開源權重模型。中國AI實驗室GLM推出了1.5TB的GLM-5.1,性能強大但硬件要求高。Qwen的Qwen3.6-35B-A3B模型僅20.9GB,可在筆記本上運行,生成的鵜鶘甚至優於Claude Opus 4.7。不過,Willison指出鵜鶘測試已失去基準意義。

總結過去六個月的兩大主題:編碼代理變得真正可靠,以及本地模型雖弱於前沿但遠遠超出預期。