“我们喜欢两种模型都能使用的世界”:NVIDIA如何看待本地模型与前沿模型
NVIDIA高级总监Joey Conway表示,本地小型模型与前沿大模型正协同工作,通过路由器分配任务,企业可借此降低成本、提高效率。NVIDIA推出DGX Spark等硬件支持本地运行大模型,并强调数据控制与安全性。
NVIDIA高级总监Joey Conway在接受The New Stack采访时表示,如今本地模型和开源模型的能力已足够强大,问题不再是能否运行它们,而是如何充分利用它们。Conway认为,任务复杂度不同,处理它们的模型也应有所区别。他提到早期开源推理模型会为“2+2”这类简单问题耗费大量计算资源,而合理的做法是将简单任务路由到快速本地模型,复杂任务则交给更先进的模型,从而在降低成本的同时提高效率。
Conway描述了一个“模型系统”的概念:企业可以构建一个由专业代理组成的团队,每个代理专注于特定任务并不断优化。对用户而言,这一切都隐藏在一个统一界面之后,背后则是多种模型协同工作。实现这一系统的关键在于路由技术,而NVIDIA的贡献在于其开源推理服务软件Dynamo,它能够将每个查询导向最近处理过类似请求的GPU。至于具体任务最适合哪种模型,NVIDIA交由更广泛的路由器生态系统来决定,其中一些路由器本身就是模型,能够权衡预算、延迟和模态。
NVIDIA还展示了与LangChain的合作成果:基于Nemotron 3 Ultra(5500亿参数的开源模型)的Deep Agents在商业任务上达到了顶级闭源模型的性能,成本却降低了10倍。Conway指出,这些提升完全来自对提示词、工具描述和中间件的调优,无需重新训练模型。
对于希望本地运行大模型的企业,NVIDIA推出了DGX Spark(售价4,699美元,配备128GB统一内存,支持高达2000亿参数的模型)和更高端的DGX Station(748GB内存)。这些设备让AI计算完全在本地进行,无需考虑网络延迟。Conway强调,企业应该“将AI带到数据所在之处”,而不是将数据交给外部供应商。通过微调开源模型,企业可以像雇佣员工一样将其融入自身业务流程,同时确保知识产权安全。
当需要处理更广泛的问题时,企业仍可随时调用云端的前沿模型。无论模型运行在桌面还是云端,其底层芯片都是NVIDIA的产品,因此对NVIDIA而言,这种“混合模型”策略无疑是双赢的选择。