开放权重AI模型已足够优秀
作者评测了Kimi K3和Qwen 3.8 Max等中国开放权重模型,认为它们在AI辅助编程方面已达到“足够好”的水平,虽不及前沿模型但已可用,并讨论了开放模型作为保险、中国模型审查问题及硬件现状。
本文作者在2026年7月使用了两款中国开放权重模型——Moonshot AI的Kimi K3和阿里巴巴的Qwen 3.8 Max,二者均号称性能可比肩Anthropic的Fable 5和OpenAI的GPT-5.5 Sol这类前沿西方模型。作者认为虽然这有些夸张,但这些模型确实非常强大。在AI编程测试中,两款模型均表现出色。例如,在作者开发的“氛围编码基准”测试中,Fable、Sol、K3和Qwen生成的迷你游戏表现相近。更严格的测试涉及根据规范构建Web应用,K3、Qwen和Fable生成的结果高度相似,而AI评判(通过Codex调用GPT-5.5 Sol)对三者的代码评审均给予正面评价,但Fable略优。
作者最兴奋的是,开放权重模型已达到“足够好”的阈值,可用于严肃的AI辅助工程。Anthropic和OpenAI的模型在去年10月至11月达到此水平,并引发了软件行业的广泛采用浪潮。然而,之前始终存在风险:智能(token)可能变得过于昂贵、模型可能被明确限制(如Fable事件)或被过度过滤(如Fable和Sol的激进用法限制)。开放模型正是对抗这些风险的保险。尽管这些模型过大,无法在本地合理运行,但已有第三方推理提供商的小产业,而对于需要严格保护数据的组织,也可选择成本高昂的自托管方案。
西方对中国模型的担忧主要来自两个方面:一是这些模型可能反映不完全符合传统西方价值观的世界观;二是可能有违反西方实验室服务条款或抄袭之嫌。但作者指出,Anthropic和OpenAI自身也抓取了整个公共互联网并使用了受版权保护的资料(如书籍),因此无权抱怨。作者个人认为,使用受版权材料训练属于合理使用,但不应禁止基于API结果进行训练。中国模型的审查和对齐问题确实存在,但不应低估西方实验室对不同主题的对齐行为。不过,由于模型开放,审查层可以通过后训练相对容易地剥离。
除了中国模型,西方也有重要的开放模型,如Google DeepMind的Gemma、Laguna S2.1、Nemotron 3、Mistral Small 4等。这些模型虽不常引起轰动,但能力很强。整体来看,开放LLM生态健康,涵盖从4B到3T参数不等的模型。多数为开放权重(仅提供权重),部分为完全开源(含训练数据)。随着这些模型在各自领域或特定用例(如AI编程)达到“足够好”的水平,它们已成为大型流行模型的可靠替代品。
开放权重模型与自由软件在用户体验上的最大区别在于所需硬件。截至2026年中,普通爱好者无法以可用方式运行大型模型。Mac Studio、NVIDIA DGX Spark或AMD Strix Halo等配备统一内存的电脑成本约5000美元,仅能运行100B-200B参数的模型,而Kimi K3和Qwen 3.8 Max分别高达2.8T和2.6T参数。但作者持乐观态度:AI硬件领域资金充裕(NVIDIA市值5万亿美元、利润率85%,高带宽内存制造商也利润丰厚),竞争加剧、性能提升和价格下降是必然趋势,尽管建设工厂需要时间。