AI News HubLIVE
站内改写2 分钟阅读

NVIDIA Nemotron 3.5 Lightning:AI智能体的高效执行引擎

NVIDIA Nemotron 3.5 Lightning 是专为AI智能体执行层设计的开源权重模型,拥有30B总参数和3B激活参数,采用混合Mamba-2+MoE+注意力架构,支持最高1M上下文。它旨在让昂贵的前沿模型负责规划,自身承担高频工具调用等执行工作,据称输出速度可达同类模型的4倍,并通过多个渠道提供免费或低成本访问。

来源Analytics Vidhya作者: Harsh Mishra

长时运行的AI智能体往往把大部分时间花在常规执行而非困难推理上。在制定计划之后,智能体可能需要执行数百次工具调用、文件读取、验证、命令和格式化步骤。如果每一步都调用前沿推理模型,成本和延迟都会显著上升。NVIDIA Nemotron 3.5 Lightning 的出发点是:让昂贵的大模型负责思考,让快速的小模型负责执行。

Nemotron 3.5 Lightning 是NVIDIA推出的一款开源权重推理与指令模型,主要面向智能体系统的执行层。它拥有约300亿总参数,但每个token只激活约30亿参数;采用混合Mamba-2、Mixture-of-Experts和选择性注意力架构,上下文窗口最高支持100万token,支持工具调用和可配置的推理模式。模型提供NVFP4和W4A16等量化选项,同时发布BF16全精度检查点。官方NVFP4模型卡还列出了在DGX Spark GB10或H100上的单GPU部署方案,并覆盖Blackwell、Hopper和Ampere等硬件。模型主要面向英语和编程语言,同时也官方支持西班牙语、法语、德语、意大利语和日语。模型于2026年8月11日发布,采用OpenMDW 1.1许可证。

NVIDIA推出这个模型的核心理由是:长时运行的智能体在执行阶段有大量高吞吐需求。以编码智能体为例,理解缺陷和制定计划属于困难推理,值得使用前沿模型;但后续的读取文件、运行命令、验证结果、委派子任务等操作并不需要那么高的推理能力。NVIDIA认为,适合的问题不再是“哪一个模型能驱动我的智能体”,而是“哪一种模型应该处理智能体内的哪一类工作”。这正是Lightning的架构理念。

在架构上,Lightning结合了几种技术。Mixture-of-Experts使模型拥有300亿参数带来的表示能力,却只激活约30亿参数;配置中有128个路由专家和1个共享专家,每个token选择6个路由专家,共52个隐藏层。Mamba-2层基于状态空间建模,能够比全注意力更高效地处理长序列;选择性注意力层则保留在需要跨远距离比较信息的场景,例如长文档、代码库、多步工具轨迹、对话历史和检索文档。多Token预测(MTP)让模型在训练时学习同时预测多个未来token,并在推理时配合投机解码验证候选token,从而提升生成吞吐。NVIDIA还提供DSpark和DFlash两种草稿模型供不同并发场景选用。官方表示,相比同尺寸模型,Lightning的输出速度最高可提升4倍,并处于高吞吐智能体负载的精度-速度帕累托前沿。

NVIDIA公布了BF16和NVFP4两种精度下的官方基准结果,覆盖知识、推理、编码、智能体、指令遵循和长上下文等任务。对比来看,NVFP4量化后的成绩与BF16非常接近,例如MMLU Pro分别为81.62和81.94,GPQA Diamond(无工具)分别为75.57和75.44,SWE-bench Verified分别为52.80和51.56。NVIDIA称这些评测通过一致的NeMo Gym和NeMo Evaluator工具链运行,并发布了可复现的基准配置。

价格方面,由于模型是开源权重,获取渠道不同价格也不同。截至2026年8月12日,NVIDIA Build API提供免费的1M上下文原型端点;OpenRouter有免费1M上下文路由,标准路由价格为每百万输入token 0.05美元、每百万输出token 0.20美元,但当前标准路由上下文为262K;Fireworks的serverless价格同样是每百万输入0.05美元、每百万缓存输入0.01美元、每百万输出0.20美元,上下文为262K;Ollama本地运行没有按token费用;自托管vLLM则只需承担基础设施成本,上下文最高可达1M。用户可以通过build.nvidia.com生成API密钥调用NVIDIA API,也可以用Ollama运行 ollama run nemotron-3.5-lightning,或在OpenRouter上获取API密钥使用。NVIDIA也提醒,价格和上下文限制在模型发布初期可能快速变化。