AI News HubLIVE
站內改寫2 分鐘閱讀

NVIDIA Nemotron 3.5 Lightning:AI智慧體的高效執行引擎

NVIDIA Nemotron 3.5 Lightning 是專為AI智慧體執行層設計的開源權重模型,擁有30B總引數和3B啟用引數,採用混合Mamba-2+MoE+注意力架構,支援最高1M上下文。它旨在讓昂貴的前沿模型負責規劃,自身承擔高頻工具呼叫等執行工作,據稱輸出速度可達同類模型的4倍,並透過多個渠道提供免費或低成本訪問。

來源Analytics Vidhya作者: Harsh Mishra

長時執行的AI智慧體往往把大部分時間花在常規執行而非困難推理上。在制定計劃之後,智慧體可能需要執行數百次工具呼叫、檔案讀取、驗證、命令和格式化步驟。如果每一步都呼叫前沿推理模型,成本和延遲都會顯著上升。NVIDIA Nemotron 3.5 Lightning 的出發點是:讓昂貴的大模型負責思考,讓快速的小模型負責執行。

Nemotron 3.5 Lightning 是NVIDIA推出的一款開源權重推理與指令模型,主要面向智慧體系統的執行層。它擁有約300億總引數,但每個token只啟用約30億引數;採用混合Mamba-2、Mixture-of-Experts和選擇性注意力架構,上下文視窗最高支援100萬token,支援工具呼叫和可配置的推理模式。模型提供NVFP4和W4A16等量化選項,同時釋出BF16全精度檢查點。官方NVFP4模型卡還列出了在DGX Spark GB10或H100上的單GPU部署方案,並覆蓋Blackwell、Hopper和Ampere等硬體。模型主要面向英語和程式語言,同時也官方支援西班牙語、法語、德語、義大利語和日語。模型於2026年8月11日釋出,採用OpenMDW 1.1許可證。

NVIDIA推出這個模型的核心理由是:長時執行的智慧體在執行階段有大量高吞吐需求。以編碼智慧體為例,理解缺陷和制定計劃屬於困難推理,值得使用前沿模型;但後續的讀取檔案、執行命令、驗證結果、委派子任務等操作並不需要那麼高的推理能力。NVIDIA認為,適合的問題不再是“哪一個模型能驅動我的智慧體”,而是“哪一種模型應該處理智慧體內的哪一類工作”。這正是Lightning的架構理念。

在架構上,Lightning結合了幾種技術。Mixture-of-Experts使模型擁有300億引數帶來的表示能力,卻只啟用約30億引數;配置中有128個路由專家和1個共享專家,每個token選擇6個路由專家,共52個隱藏層。Mamba-2層基於狀態空間建模,能夠比全注意力更高效地處理長序列;選擇性注意力層則保留在需要跨遠距離比較資訊的場景,例如長文件、程式碼庫、多步工具軌跡、對話歷史和檢索文件。多Token預測(MTP)讓模型在訓練時學習同時預測多個未來token,並在推理時配合投機解碼驗證候選token,從而提升生成吞吐。NVIDIA還提供DSpark和DFlash兩種草稿模型供不同併發場景選用。官方表示,相比同尺寸模型,Lightning的輸出速度最高可提升4倍,並處於高吞吐智慧體負載的精度-速度帕累託前沿。

NVIDIA公佈了BF16和NVFP4兩種精度下的官方基準結果,覆蓋知識、推理、編碼、智慧體、指令遵循和長上下文等任務。對比來看,NVFP4量化後的成績與BF16非常接近,例如MMLU Pro分別為81.62和81.94,GPQA Diamond(無工具)分別為75.57和75.44,SWE-bench Verified分別為52.80和51.56。NVIDIA稱這些評測透過一致的NeMo Gym和NeMo Evaluator工具鏈執行,併發布了可復現的基準配置。

價格方面,由於模型是開源權重,獲取渠道不同價格也不同。截至2026年8月12日,NVIDIA Build API提供免費的1M上下文原型端點;OpenRouter有免費1M上下文路由,標準路由價格為每百萬輸入token 0.05美元、每百萬輸出token 0.20美元,但當前標準路由上下文為262K;Fireworks的serverless價格同樣是每百萬輸入0.05美元、每百萬快取輸入0.01美元、每百萬輸出0.20美元,上下文為262K;Ollama本地執行沒有按token費用;自託管vLLM則只需承擔基礎設施成本,上下文最高可達1M。使用者可以透過build.nvidia.com生成API金鑰呼叫NVIDIA API,也可以用Ollama執行 ollama run nemotron-3.5-lightning,或在OpenRouter上獲取API金鑰使用。NVIDIA也提醒,價格和上下文限制在模型釋出初期可能快速變化。