AI News HubLIVE
站內改寫2 分鐘閱讀

開放權重AI模型已足夠優秀

作者評測了Kimi K3和Qwen 3.8 Max等中國開放權重模型,認為它們在AI輔助程式設計方面已達到“足夠好”的水平,雖不及前沿模型但已可用,並討論了開放模型作為保險、中國模型審查問題及硬體現狀。

來源Hacker News AI作者: chistev

本文作者在2026年7月使用了兩款中國開放權重模型——Moonshot AI的Kimi K3和阿里巴巴的Qwen 3.8 Max,二者均號稱效能可比肩Anthropic的Fable 5和OpenAI的GPT-5.5 Sol這類前沿西方模型。作者認為雖然這有些誇張,但這些模型確實非常強大。在AI程式設計測試中,兩款模型均表現出色。例如,在作者開發的“氛圍編碼基準”測試中,Fable、Sol、K3和Qwen生成的迷你遊戲表現相近。更嚴格的測試涉及根據規範構建Web應用,K3、Qwen和Fable生成的結果高度相似,而AI評判(透過Codex呼叫GPT-5.5 Sol)對三者的程式碼評審均給予正面評價,但Fable略優。

作者最興奮的是,開放權重模型已達到“足夠好”的閾值,可用於嚴肅的AI輔助工程。Anthropic和OpenAI的模型在去年10月至11月達到此水平,並引發了軟體行業的廣泛採用浪潮。然而,之前始終存在風險:智慧(token)可能變得過於昂貴、模型可能被明確限制(如Fable事件)或被過度過濾(如Fable和Sol的激進用法限制)。開放模型正是對抗這些風險的保險。儘管這些模型過大,無法在本地合理執行,但已有第三方推理提供商的小產業,而對於需要嚴格保護資料的組織,也可選擇成本高昂的自託管方案。

西方對中國模型的擔憂主要來自兩個方面:一是這些模型可能反映不完全符合傳統西方價值觀的世界觀;二是可能有違反西方實驗室服務條款或抄襲之嫌。但作者指出,Anthropic和OpenAI自身也抓取了整個公共網際網路並使用了受版權保護的資料(如書籍),因此無權抱怨。作者個人認為,使用受版權材料訓練屬於合理使用,但不應禁止基於API結果進行訓練。中國模型的審查和對齊問題確實存在,但不應低估西方實驗室對不同主題的對齊行為。不過,由於模型開放,審查層可以透過後訓練相對容易地剝離。

除了中國模型,西方也有重要的開放模型,如Google DeepMind的Gemma、Laguna S2.1、Nemotron 3、Mistral Small 4等。這些模型雖不常引起轟動,但能力很強。整體來看,開放LLM生態健康,涵蓋從4B到3T引數不等的模型。多數為開放權重(僅提供權重),部分為完全開源(含訓練資料)。隨著這些模型在各自領域或特定用例(如AI程式設計)達到“足夠好”的水平,它們已成為大型流行模型的可靠替代品。

開放權重模型與自由軟體在使用者體驗上的最大區別在於所需硬體。截至2026年中,普通愛好者無法以可用方式執行大型模型。Mac Studio、NVIDIA DGX Spark或AMD Strix Halo等配備統一記憶體的電腦成本約5000美元,僅能執行100B-200B引數的模型,而Kimi K3和Qwen 3.8 Max分別高達2.8T和2.6T引數。但作者持樂觀態度:AI硬體領域資金充裕(NVIDIA市值5萬億美元、利潤率85%,高頻寬記憶體製造商也利潤豐厚),競爭加劇、效能提升和價格下降是必然趨勢,儘管建設工廠需要時間。