NVIDIA Nemotron 3.5 Lightning:AI智能體的高效執行引擎
NVIDIA Nemotron 3.5 Lightning 是專為AI智能體執行層設計的開源權重模型,擁有30B總參數和3B激活參數,採用混合Mamba-2+MoE+注意力架構,支持最高1M上下文。它旨在讓昂貴的前沿模型負責規劃,自身承擔高頻工具調用等執行工作,據稱輸出速度可達同類模型的4倍,並通過多個渠道提供免費或低成本訪問。
長時運行的AI智能體往往把大部分時間花在常規執行而非困難推理上。在制定計劃之後,智能體可能需要執行數百次工具調用、文件讀取、驗證、命令和格式化步驟。如果每一步都調用前沿推理模型,成本和延遲都會顯著上升。NVIDIA Nemotron 3.5 Lightning 的出發點是:讓昂貴的大模型負責思考,讓快速的小模型負責執行。
Nemotron 3.5 Lightning 是NVIDIA推出的一款開源權重推理與指令模型,主要面向智能體系統的執行層。它擁有約300億總參數,但每個token只激活約30億參數;採用混合Mamba-2、Mixture-of-Experts和選擇性注意力架構,上下文窗口最高支持100萬token,支持工具調用和可配置的推理模式。模型提供NVFP4和W4A16等量化選項,同時發佈BF16全精度檢查點。官方NVFP4模型卡還列出了在DGX Spark GB10或H100上的單GPU部署方案,並覆蓋Blackwell、Hopper和Ampere等硬件。模型主要面向英語和編程語言,同時也官方支持西班牙語、法語、德語、意大利語和日語。模型於2026年8月11日發佈,採用OpenMDW 1.1許可證。
NVIDIA推出這個模型的核心理由是:長時運行的智能體在執行階段有大量高吞吐需求。以編碼智能體為例,理解缺陷和制定計劃屬於困難推理,值得使用前沿模型;但後續的讀取文件、運行命令、驗證結果、委派子任務等操作並不需要那麼高的推理能力。NVIDIA認為,適合的問題不再是“哪一個模型能驅動我的智能體”,而是“哪一種模型應該處理智能體內的哪一類工作”。這正是Lightning的架構理念。
在架構上,Lightning結合了幾種技術。Mixture-of-Experts使模型擁有300億參數帶來的表示能力,卻只激活約30億參數;配置中有128個路由專家和1個共享專家,每個token選擇6個路由專家,共52個隱藏層。Mamba-2層基於狀態空間建模,能夠比全注意力更高效地處理長序列;選擇性注意力層則保留在需要跨遠距離比較信息的場景,例如長文檔、代碼庫、多步工具軌跡、對話歷史和檢索文檔。多Token預測(MTP)讓模型在訓練時學習同時預測多個未來token,並在推理時配合投機解碼驗證候選token,從而提升生成吞吐。NVIDIA還提供DSpark和DFlash兩種草稿模型供不同併發場景選用。官方表示,相比同尺寸模型,Lightning的輸出速度最高可提升4倍,並處於高吞吐智能體負載的精度-速度帕累託前沿。
NVIDIA公佈了BF16和NVFP4兩種精度下的官方基準結果,覆蓋知識、推理、編碼、智能體、指令遵循和長上下文等任務。對比來看,NVFP4量化後的成績與BF16非常接近,例如MMLU Pro分別為81.62和81.94,GPQA Diamond(無工具)分別為75.57和75.44,SWE-bench Verified分別為52.80和51.56。NVIDIA稱這些評測通過一致的NeMo Gym和NeMo Evaluator工具鏈運行,併發布了可復現的基準配置。
價格方面,由於模型是開源權重,獲取渠道不同價格也不同。截至2026年8月12日,NVIDIA Build API提供免費的1M上下文原型端點;OpenRouter有免費1M上下文路由,標準路由價格為每百萬輸入token 0.05美元、每百萬輸出token 0.20美元,但當前標準路由上下文為262K;Fireworks的serverless價格同樣是每百萬輸入0.05美元、每百萬緩存輸入0.01美元、每百萬輸出0.20美元,上下文為262K;Ollama本地運行沒有按token費用;自託管vLLM則只需承擔基礎設施成本,上下文最高可達1M。用户可以通過build.nvidia.com生成API密鑰調用NVIDIA API,也可以用Ollama運行 ollama run nemotron-3.5-lightning,或在OpenRouter上獲取API密鑰使用。NVIDIA也提醒,價格和上下文限制在模型發佈初期可能快速變化。