AI News HubLIVE
站内改写5 分钟阅读

[AINews] NVIDIA Cosmos 3, Nemotron 3 Ultra 和 RTX Spark

NVIDIA 发布了 Cosmos 3 统一多模态世界模型、Nemotron 3 Ultra 高效 LLM 和 RTX Spark 个人 AI 超级芯片。同时,MiniMax M3、Qwen3.7-Plus 和 JetBrains Mellum2 等开放模型推动智能体领域发展。

今日播客嘉宾曾是一年前 NVIDIA Cosmos 项目的负责人,讨论了视频生成和世界模型的训练。恰逢其时,Cosmos 3 于今日发布,它将语言、图像、视频、音频和动作统一在 Mixture-of-Transformers 架构中,该架构将自回归推理器与扩散生成器配对,提供基础版 Nano(16B:8B 推理塔 + 8B 生成塔)和 Super(64B:32B 推理塔 + 32B 生成塔)模型,以及针对文本到图像和图像到视频的 Super 微调版本,现已成为开放权重图像和视频生成模型的新 SOTA,仅次于 Nano Banana 2。在台湾 Computex 上,黄仁勋还带来了 Nemotron 3 Ultra,这是一款 550B 参数(A55B)的高效快速开放权重 LLM,成为美国最新 SOTA。此外,RTX Spark 个人计算机(1 petaflop 超级芯片)与 Microsoft、OpenClaw 和 Hermes Agent 作为启动合作伙伴进行了预览(这里有很好的分析)。AI 新闻日期为 2026 年 5 月 30 日至 6 月 1 日。我们检查了 12 个子版块、544 个 Twitter 账户和无其他 Discord 频道。AINews 网站可搜索所有过刊。提醒:AINews 现为 Latent Space 的一部分,您可以选择接收邮件频率。

AI Twitter 回顾:NVIDIA 的 Cosmos 3、Nemotron 3 Ultra 和开放物理 AI 的推动

NVIDIA 的开放源代码周:NVIDIA 以 Cosmos 3(一个开放的全模态世界模型系列,用于物理 AI)以及 Nemotron 3 Ultra(550B 开放权重模型,多位发帖者称其为迄今为止最强的美国开放模型)主导了开放模型讨论。Cosmos 3 被定位为全栈发布——权重、代码、数据集和微调配方——NVIDIA 还与 Runway 等合作伙伴共同推出了 Cosmos 联盟,以构建世界模型的开放生态系统。@NVIDIAAI 生态系统背景、@runwayml 联盟公告、@kimmonismus Cosmos 帖子、@ClementDelangue 关于 NVIDIA 在 HF 上的足迹。

Cosmos 3 的技术重要性:除了机器人技术修辞,更具体的细节是 Cosmos 3 在单一的 Mixture-of-Transformers 设计中统一了语言、图像、视频、音频和动作,将自回归推理器与扩散生成器配对。Artificial Analysis 表示 Cosmos 3 在其文本到图像和图像到视频排行榜上均位居开放权重模型之首,并指出生成器使用结构化 JSON 提示,可由外部提示上采样工具或其自身的推理分支驱动。此外,NVIDIA 的硬件+软件推动还扩展到采用 OpenMDW 框架以及 fal 等平台上的合作伙伴生态系统集成。@ArtificialAnlys, @fal。

Nemotron 3 Ultra 的反响:社区对 Nemotron 3 Ultra 的反馈异常热烈,这是一个全新的开放发布。发帖者强调了性能和服务特性,包括声称它已经在一些开放评估中名列前茅,并且在某些设置下可以达到 300+ tok/s 的服务速度——远快于大型 DeepSeek/Kimi 类模型。@scaling01, @ctnzr, @caspar_br。还有一些技术讨论,认为 Nemotron 的稀疏性似乎低于 Kimi K2 / DeepSeek V4 等同类模型——约 10% 激活 vs 约 3%——这可能会影响成本和行为。@eliebakouch。

MiniMax M3、Qwen3.7-Plus 和 JetBrains Mellum2 扩展了开放智能体模型领域

MiniMax M3 的发布是当天最大的模型发布:M3 被定位为开放权重的多模态智能体/编程模型,具有 1M 上下文、原生多模态性和具有竞争力的智能体基准。发布合作伙伴重复的关键数字包括 59.0% SWE-Bench Pro、66.0% Terminal Bench 2.1 和 74.2% MCP Atlas。@MiniMax_AI, @PBDTokenRouter, @kimmonismus。多个基础设施供应商发布了首日支持——Novita、Vercel AI Gateway、Cloudflare AI Gateway、OpenClaude、Flowith 等——表明生态系统采用异常迅速。@MiniMax_AI on Novita, @rauchg, @gitlawb。

基准测试与实际体验好坏参半:M3 在前端生成、视觉/游戏任务和性价比方面获得了赞誉,并排演示显示了强大的一次性 UI/游戏输出,以及在 Next.js 智能体评估方面的显著基准排名。@notjazii, @lostinlatencyX, @rauchg。但一些评估者也报告了高令牌消耗、冗长的自检循环以及在长任务中偶尔出现的需求漂移,使 M3 看起来更像是一个“质量优先,效率其次”的模型。@ZhihuFrontier 评论, @teortaxesTex 怀疑。

Qwen3.7-Plus:阿里巴巴发布了 Qwen3.7-Plus,这是一个多模态交互式混合智能体,统一了 GUI 和 CLI 操作、视觉推理、编程和搜索增强问答。它可通过阿里云模型工作室 API 使用,并迅速被添加到 Cline 等工具中。@Alibaba_Qwen 发布, @cline。这次发布强化了趋势:开放的亚洲实验室不再发布“仅聊天模型”,而是发布具备完整智能体能力的多模态系统。

JetBrains Mellum2:JetBrains 发布了 Mellum2,一个 12B MoE 模型,具有 2.5B 活跃参数,训练约 11T 令牌,并使用 RLVR 进行后训练,发布基础 / SFT / RL 检查点和技术报告。@nv_pavlichenko, @jetbrains。其预期定位尤其有趣:用于路由、RAG、子智能体和 IDE 使用的超低延迟推理,并立即被 vLLM 支持。@vllm_project。这看起来像是针对“用于开发人员工作流程的快速小型开放模型”的严肃尝试,而不是追求基准的前沿发布。

智能体、沙箱、内存和搜索正成为真正的产品界面

堆栈正从模型调用转向智能体运行时:多个发布趋同于一个观点,即主要的工程杠杆现在在于工具而非模型。Perplexity 的“搜索即代码”是最清晰的例子:模型不是进行迭代搜索工具调用,而是针对搜索 SDK 编写 Python,从而实现自定义排名管道、索引上的映射归约、批处理、聚合和更低的令牌开销。Perplexity 报告其内部 WANDR 基准从 0.152 跃升至 0.386。@perplexity_ai, @AravSrinivas。

托管智能体 + 沙箱正成为标准:Google 详细介绍了 Gemini API 中的托管智能体,单个 API 调用即可启动一个智能体,该智能体可以进行推理、编写/运行代码、管理文件并在托管的 Linux 沙箱内操作。@_philschmid, @GoogleAIStudio。LangChain 围绕 Deep Agents、Context Hub 和 LangSmith Sandboxes/Engine 推动了类似想法,强调持久上下文、智能体生命周期工具和自动故障分类。@LangChain, @hwchase17。

内存仍然是一个缺失的原始要素:一个反复出现的抱怨是,巨大的上下文窗口仍然无法解决跨会话内存问题。关于 HydraDB 的一个帖子认为,“RAG + 手动上下文注入”被误称为内存,而实际的持久会话知识仍然服务不足。@kimmonismus。相关研究线程指向可重用的上下文管理策略,如 AdaCoM,它通过 RL 训练单独的 LLM 来修剪/保留冻结智能体的上下文。@dair_ai。

安全仍然是企业智能体的瓶颈问题:Microsoft 安全情报部门发布了一个重大警告,关于影响 90 多个 redhat-cloud-services 包的主要 npm 供应链攻击,包括一个自传播蠕虫,窃取 npm/GitHub/AWS/SSH 凭据。@MsftSecIntel。与此同时,企业智能体供应商强调沙箱、运行时隔离和安全堆栈集成是部署的先决条件,包括对 NVIDIA OpenShell 和 LangChain 沙箱主题演讲的讨论。@shannholmberg, @LangChain。

Codex、Claude Code 和竞争性的编程智能体竞赛

OpenAI 将 Codex 扩展到更多地方:OpenAI 宣布前沿模型和 Codex 现已在 AWS / Amazon Bedrock 上普遍可用,直接面向希望在现有 AWS 安全/合规工作流程中使用 OpenAI 功能的企业。@OpenAI, @OpenAIDevs。OpenAI 还发布了 Codex Python SDK,支持线程、轮次、流式、恢复、图像和沙箱控制@reach_vb,以及支持基于 Bedrock 的 Codex 工作流程。@reach_vb on Bedrock config。

Claude Code 发生了真实运维事故:Anthropic 在修复一个错误后重置了 Pro 和 Max 用户的 5 小时和周速率限制,该错误导致一些 Opus 4.8 会话产生了过多并行子智能体/工具调用,意外消耗了使用量。@ClaudeDevs, 后续。这提醒我们,编程智能体产品质量越来越由编排行为决定,而不仅仅是原始模型智商。

编程模型之间的行为差异仍然很大:开发者强调了 GPT、Claude 和其他模型在 ProgramBench 和 WeirdML 等基准上的巨大定性差异,Opus 有时更倾向于探索而不是分数最大化,或表现出特定基准的怪癖。@OfirPress, @htihle。另一个长帖子认为,较新的 Claude Opus 4.6–4.8 变体可以在非编程领域编造看似合理但虚构的概念,表明可能存在真实性/对齐退化,而不仅仅是普通幻觉。@distributionat。

基础设施、硬件和本地 AI 系统

NVIDIA 进军个人电脑:讨论最多的硬件发布是 RTX Spark,一款 NVIDIA/Microsoft“个人 AI 计算机”,基于 Grace + Blackwell,具有高达 128GB 统一内存和声称的 1 PFLOP FP4。关键战略解读:NVIDIA 不再仅仅销售加速器,而是提供一个端到端的本地 AI 系统,同时与 Apple Silicon、x86 PC 和 Qualcomm 竞争。@kimmonismus, @swyx。

集群/网络更新:在数据中心方面,Lambda 表示它率先采用 NVIDIA Quantum-X InfiniBand Photonics Q3450-LD 交换机,推动共封装光学以降低大型 AI 集群中的网络功耗和故障。@LambdaAPI。OpenAI 还宣布了 Stargate Michigan,一个计划中的 1GW 数据中心,采用闭环冷却,并附带劳动力/教育承诺。@OpenAINewsroom。

本地开放模型工具正在快速改进:MLX-VLM v0.6.0 版本是更有实质意义的本地推理/工具更新之一,增加了推测解码、Anthropic 风格和响应风格 API、工具调用、对许多新多模态模型的支持以及图像/音频功能,明确旨在将 Apple 设备变成“真正的本地智能体机器”。@Prince_Canuma。这与不断增长的 DGX Spark + vLLM 本地 NVFP4 MoE 服务实验相辅相成。@vllm_project。

热门推文(按参与度排序,过滤技术相关性)

Anthropic 的 IPO 路径:Anthropic 表示已向 SEC 秘密提交了 S-1 草案,为 IPO 铺平道路,等待审查。@AnthropicAI。

Claude Code 使用事件:Anthropic 在发现 Opus 4.8 并行子智能体/工具调用错误导致过度配额消耗后重置了用户速率限制。@ClaudeDevs。

Qwen3.7-Plus:阿里巴巴发布了覆盖 GUI/CLI 操作、编程和视觉任务的多模态智能体模型。@Alibaba_Qwen。

OpenAI on Bedrock:OpenAI 模型和 Codex 现可通过 Amazon Bedrock 用于企业工作流程。@OpenAI。

ARC-AGI-3 进展:Claude Opus 4.8 在 ARC-AGI-3 上发布了新的 SOTA,达到 1.5%,绝对值仍然很小,但在该基准上是一次有意义的跳跃。@arcprize。

AI Reddit 回顾

/r/LocalLlama + /r/localLLM 回顾

  1. 新前沿模型发布和早期测试

MiniMax M3 - 编程和智能体前沿,1M 上下文,多模态(活动:1090):MiniMax M3 被宣布为开放权重前沿模型,专注于编程/智能体,原生多模态/视觉,以及 MiniMax 稀疏注意力,支持高达 1M 令牌上下文,保证最低 512K(MiniMax M3)。声称的长期智能体结果包括 12 小时 ICLR 论文复现、Hopper FP8 GEMM CUDA/Triton 优化在 147 次迭代后达到 9.4 倍加速,以及 PostTrainBench 排名第三,仅次于 Opus 4.7 和 GPT-5.5。目前通过 API/MiniMax Code 访问,计划在 HuggingFace/GitHub 上发布权重和本地部署。评论者谨慎地关注廉价高效视觉加上长上下文智能体编程的组合,但由于公告称其为“开放权重”,而...(为控制 AI 成本而截断)