開放權重AI模型已足夠優秀
作者評測了Kimi K3和Qwen 3.8 Max等中國開放權重模型,認為它們在AI輔助編程方面已達到“足夠好”的水平,雖不及前沿模型但已可用,並討論了開放模型作為保險、中國模型審查問題及硬件現狀。
本文作者在2026年7月使用了兩款中國開放權重模型——Moonshot AI的Kimi K3和阿里巴巴的Qwen 3.8 Max,二者均號稱性能可比肩Anthropic的Fable 5和OpenAI的GPT-5.5 Sol這類前沿西方模型。作者認為雖然這有些誇張,但這些模型確實非常強大。在AI編程測試中,兩款模型均表現出色。例如,在作者開發的“氛圍編碼基準”測試中,Fable、Sol、K3和Qwen生成的迷你遊戲表現相近。更嚴格的測試涉及根據規範構建Web應用,K3、Qwen和Fable生成的結果高度相似,而AI評判(通過Codex調用GPT-5.5 Sol)對三者的代碼評審均給予正面評價,但Fable略優。
作者最興奮的是,開放權重模型已達到“足夠好”的閾值,可用於嚴肅的AI輔助工程。Anthropic和OpenAI的模型在去年10月至11月達到此水平,並引發了軟件行業的廣泛採用浪潮。然而,之前始終存在風險:智能(token)可能變得過於昂貴、模型可能被明確限制(如Fable事件)或被過度過濾(如Fable和Sol的激進用法限制)。開放模型正是對抗這些風險的保險。儘管這些模型過大,無法在本地合理運行,但已有第三方推理提供商的小產業,而對於需要嚴格保護數據的組織,也可選擇成本高昂的自託管方案。
西方對中國模型的擔憂主要來自兩個方面:一是這些模型可能反映不完全符合傳統西方價值觀的世界觀;二是可能有違反西方實驗室服務條款或抄襲之嫌。但作者指出,Anthropic和OpenAI自身也抓取了整個公共互聯網並使用了受版權保護的資料(如書籍),因此無權抱怨。作者個人認為,使用受版權材料訓練屬於合理使用,但不應禁止基於API結果進行訓練。中國模型的審查和對齊問題確實存在,但不應低估西方實驗室對不同主題的對齊行為。不過,由於模型開放,審查層可以通過後訓練相對容易地剝離。
除了中國模型,西方也有重要的開放模型,如Google DeepMind的Gemma、Laguna S2.1、Nemotron 3、Mistral Small 4等。這些模型雖不常引起轟動,但能力很強。整體來看,開放LLM生態健康,涵蓋從4B到3T參數不等的模型。多數為開放權重(僅提供權重),部分為完全開源(含訓練數據)。隨着這些模型在各自領域或特定用例(如AI編程)達到“足夠好”的水平,它們已成為大型流行模型的可靠替代品。
開放權重模型與自由軟件在用户體驗上的最大區別在於所需硬件。截至2026年中,普通愛好者無法以可用方式運行大型模型。Mac Studio、NVIDIA DGX Spark或AMD Strix Halo等配備統一內存的電腦成本約5000美元,僅能運行100B-200B參數的模型,而Kimi K3和Qwen 3.8 Max分別高達2.8T和2.6T參數。但作者持樂觀態度:AI硬件領域資金充裕(NVIDIA市值5萬億美元、利潤率85%,高帶寬內存製造商也利潤豐厚),競爭加劇、性能提升和價格下降是必然趨勢,儘管建設工廠需要時間。