AI News HubLIVE
站内改写2 分钟阅读

Kimi K3 完全开发者指南

Kimi K3 是 Moonshot AI 推出的 2.8 万亿参数开源权重模型,也是首个 3 万亿参数级别的开源模型。本文介绍其架构亮点、Together AI 上的调用方式、推理强度、视觉输入、结构化输出、工具调用与动态工具加载等关键开发要点。

Kimi K3 是 Moonshot AI 目前最强的模型,也是世界上第一个进入 3 万亿参数级别的开源权重模型。它拥有 2.8 万亿参数,是迄今最大的开源权重模型,目标是为长期编码、端到端知识工作和深度推理等前沿任务提供支持。Together AI 正与 Moonshot 团队直接合作,在美国基础设施上提供该模型,支持完整的 1M 上下文、自动前缀缓存和 OpenAI 兼容 API。

在架构层面,K3 引入了两项关键更新:Kimi Delta Attention(KDA)是一种混合线性注意力机制,为超长上下文的注意力扩展提供了高效基础;Attention Residuals(AttnRes)则跨网络深度选择性地检索表示,而非均匀累积。Moonshot 还通过 Stable LatentMoE 框架进一步推进了专家混合稀疏性:模型共有 896 个专家,每个 token 只激活约 16 个,即约 2% 的专家。为了在这种稀疏度下稳定训练,团队加入了 Quantile Balancing(基于路由器分数分位数分配专家)、Per-Head Muon(独立优化注意力头)、Sigmoid Tanh Unit(改进激活控制)和 Gated MLA(增强注意力选择性)等支持技术。

在 Together AI 上调用 K3 非常简单。安装 together>=2.0.0 后,设置 TOGETHER_API_KEY,即可通过 client.chat.completions.create 发送消息。顶级字段 reasoning_effort 支持 low、high、max 三档,默认 max,也可以通过 reasoning={'enabled': False} 关闭思考,此时不会计费思考 token。流式响应会区分 reasoning_content(思考过程)与最终答案的 content 增量。

视觉方面,K3 支持通过 URL 或 base64 传入多张图片。虽然没有图片数量上限,但整个请求体需小于 100 MB;官方建议图片分辨率不超过 4K(4096x2160),更高的分辨率只会增加处理时间和 token 消耗。结构化输出可使用 response_format 搭配 json_schema 和 strict: true,也可以使用更宽松的 json_object 模式;注意要留足 max_tokens,因为思考过程会先于 schema 约束 token 输出。

工具调用遵循标准 OpenAI 循环:声明 tools,模型返回 tool_calls 后追加完整的助手消息,再为每次调用追加带匹配 tool_call_id 的 tool 消息,然后再次调用。可用 tool_choice='required' 强制首轮调用工具,之后再切回 'auto',切换不会使前缀缓存失效。K3 还支持动态工具加载:将带有 tools 字段且无 content 的系统消息放入消息历史,即可从该位置起启用对应工具;这种声明只对当次请求有效,服务器不会保留,因此需要自己保留该消息以维持工具可用性和缓存前缀。对于大型工具目录,推荐先声明一个 search_tools 函数,首轮强制检索,再按需注入匹配的工具定义,最后让模型直接调用。

此外,Together 支持完整的 1M 上下文,上下文缓存是自动的。将系统提示等长前缀保持在消息开头,可以提高缓存命中率;修改或删除较早位置的动态声明可能影响后续缓存命中。在实际生产中,还应在对话开始前就决定 reasoning_effort 的档位,以便在质量与成本之间取得平衡。