AI News HubLIVE
站內改寫5 分鐘閱讀

[AINews] NVIDIA Cosmos 3, Nemotron 3 Ultra 和 RTX Spark

NVIDIA 發佈了 Cosmos 3 統一多模態世界模型、Nemotron 3 Ultra 高效 LLM 和 RTX Spark 個人 AI 超級芯片。同時,MiniMax M3、Qwen3.7-Plus 和 JetBrains Mellum2 等開放模型推動智能體領域發展。

今日播客嘉賓曾是一年前 NVIDIA Cosmos 項目的負責人,討論了視頻生成和世界模型的訓練。恰逢其時,Cosmos 3 於今日發佈,它將語言、圖像、視頻、音頻和動作統一在 Mixture-of-Transformers 架構中,該架構將自迴歸推理器與擴散生成器配對,提供基礎版 Nano(16B:8B 推理塔 + 8B 生成塔)和 Super(64B:32B 推理塔 + 32B 生成塔)模型,以及針對文本到圖像和圖像到視頻的 Super 微調版本,現已成為開放權重圖像和視頻生成模型的新 SOTA,僅次於 Nano Banana 2。在台灣 Computex 上,黃仁勳還帶來了 Nemotron 3 Ultra,這是一款 550B 參數(A55B)的高效快速開放權重 LLM,成為美國最新 SOTA。此外,RTX Spark 個人計算機(1 petaflop 超級芯片)與 Microsoft、OpenClaw 和 Hermes Agent 作為啓動合作伙伴進行了預覽(這裏有很好的分析)。AI 新聞日期為 2026 年 5 月 30 日至 6 月 1 日。我們檢查了 12 個子版塊、544 個 Twitter 賬户和無其他 Discord 頻道。AINews 網站可搜索所有過刊。提醒:AINews 現為 Latent Space 的一部分,您可以選擇接收郵件頻率。

AI Twitter 回顧:NVIDIA 的 Cosmos 3、Nemotron 3 Ultra 和開放物理 AI 的推動

NVIDIA 的開放源代碼周:NVIDIA 以 Cosmos 3(一個開放的全模態世界模型系列,用於物理 AI)以及 Nemotron 3 Ultra(550B 開放權重模型,多位發帖者稱其為迄今為止最強的美國開放模型)主導了開放模型討論。Cosmos 3 被定位為全棧發佈——權重、代碼、數據集和微調配方——NVIDIA 還與 Runway 等合作伙伴共同推出了 Cosmos 聯盟,以構建世界模型的開放生態系統。@NVIDIAAI 生態系統背景、@runwayml 聯盟公告、@kimmonismus Cosmos 帖子、@ClementDelangue 關於 NVIDIA 在 HF 上的足跡。

Cosmos 3 的技術重要性:除了機器人技術修辭,更具體的細節是 Cosmos 3 在單一的 Mixture-of-Transformers 設計中統一了語言、圖像、視頻、音頻和動作,將自迴歸推理器與擴散生成器配對。Artificial Analysis 表示 Cosmos 3 在其文本到圖像和圖像到視頻排行榜上均位居開放權重模型之首,並指出生成器使用結構化 JSON 提示,可由外部提示上採樣工具或其自身的推理分支驅動。此外,NVIDIA 的硬件+軟件推動還擴展到採用 OpenMDW 框架以及 fal 等平台上的合作伙伴生態系統集成。@ArtificialAnlys, @fal。

Nemotron 3 Ultra 的反響:社區對 Nemotron 3 Ultra 的反饋異常熱烈,這是一個全新的開放發佈。發帖者強調了性能和服務特性,包括聲稱它已經在一些開放評估中名列前茅,並且在某些設置下可以達到 300+ tok/s 的服務速度——遠快於大型 DeepSeek/Kimi 類模型。@scaling01, @ctnzr, @caspar_br。還有一些技術討論,認為 Nemotron 的稀疏性似乎低於 Kimi K2 / DeepSeek V4 等同類模型——約 10% 激活 vs 約 3%——這可能會影響成本和行為。@eliebakouch。

MiniMax M3、Qwen3.7-Plus 和 JetBrains Mellum2 擴展了開放智能體模型領域

MiniMax M3 的發佈是當天最大的模型發佈:M3 被定位為開放權重的多模態智能體/編程模型,具有 1M 上下文、原生多模態性和具有競爭力的智能體基準。發佈合作伙伴重複的關鍵數字包括 59.0% SWE-Bench Pro、66.0% Terminal Bench 2.1 和 74.2% MCP Atlas。@MiniMax_AI, @PBDTokenRouter, @kimmonismus。多個基礎設施供應商發佈了首日支持——Novita、Vercel AI Gateway、Cloudflare AI Gateway、OpenClaude、Flowith 等——表明生態系統採用異常迅速。@MiniMax_AI on Novita, @rauchg, @gitlawb。

基準測試與實際體驗好壞參半:M3 在前端生成、視覺/遊戲任務和性價比方面獲得了讚譽,並排演示顯示了強大的一次性 UI/遊戲輸出,以及在 Next.js 智能體評估方面的顯著基準排名。@notjazii, @lostinlatencyX, @rauchg。但一些評估者也報告了高令牌消耗、冗長的自檢循環以及在長任務中偶爾出現的需求漂移,使 M3 看起來更像是一個“質量優先,效率其次”的模型。@ZhihuFrontier 評論, @teortaxesTex 懷疑。

Qwen3.7-Plus:阿里巴巴發佈了 Qwen3.7-Plus,這是一個多模態交互式混合智能體,統一了 GUI 和 CLI 操作、視覺推理、編程和搜索增強問答。它可通過阿里雲模型工作室 API 使用,並迅速被添加到 Cline 等工具中。@Alibaba_Qwen 發佈, @cline。這次發佈強化了趨勢:開放的亞洲實驗室不再發布“僅聊天模型”,而是發佈具備完整智能體能力的多模態系統。

JetBrains Mellum2:JetBrains 發佈了 Mellum2,一個 12B MoE 模型,具有 2.5B 活躍參數,訓練約 11T 令牌,並使用 RLVR 進行後訓練,發佈基礎 / SFT / RL 檢查點和技術報告。@nv_pavlichenko, @jetbrains。其預期定位尤其有趣:用於路由、RAG、子智能體和 IDE 使用的超低延遲推理,並立即被 vLLM 支持。@vllm_project。這看起來像是針對“用於開發人員工作流程的快速小型開放模型”的嚴肅嘗試,而不是追求基準的前沿發佈。

智能體、沙箱、內存和搜索正成為真正的產品界面

堆棧正從模型調用轉向智能體運行時:多個發佈趨同於一個觀點,即主要的工程槓桿現在在於工具而非模型。Perplexity 的“搜索即代碼”是最清晰的例子:模型不是進行迭代搜索工具調用,而是針對搜索 SDK 編寫 Python,從而實現自定義排名管道、索引上的映射歸約、批處理、聚合和更低的令牌開銷。Perplexity 報告其內部 WANDR 基準從 0.152 躍升至 0.386。@perplexity_ai, @AravSrinivas。

託管智能體 + 沙箱正成為標準:Google 詳細介紹了 Gemini API 中的託管智能體,單個 API 調用即可啓動一個智能體,該智能體可以進行推理、編寫/運行代碼、管理文件並在託管的 Linux 沙箱內操作。@_philschmid, @GoogleAIStudio。LangChain 圍繞 Deep Agents、Context Hub 和 LangSmith Sandboxes/Engine 推動了類似想法,強調持久上下文、智能體生命週期工具和自動故障分類。@LangChain, @hwchase17。

內存仍然是一個缺失的原始要素:一個反覆出現的抱怨是,巨大的上下文窗口仍然無法解決跨會話內存問題。關於 HydraDB 的一個帖子認為,“RAG + 手動上下文注入”被誤稱為內存,而實際的持久會話知識仍然服務不足。@kimmonismus。相關研究線程指向可重用的上下文管理策略,如 AdaCoM,它通過 RL 訓練單獨的 LLM 來修剪/保留凍結智能體的上下文。@dair_ai。

安全仍然是企業智能體的瓶頸問題:Microsoft 安全情報部門發佈了一個重大警告,關於影響 90 多個 redhat-cloud-services 包的主要 npm 供應鏈攻擊,包括一個自傳播蠕蟲,竊取 npm/GitHub/AWS/SSH 憑據。@MsftSecIntel。與此同時,企業智能體供應商強調沙箱、運行時隔離和安全堆棧集成是部署的先決條件,包括對 NVIDIA OpenShell 和 LangChain 沙箱主題演講的討論。@shannholmberg, @LangChain。

Codex、Claude Code 和競爭性的編程智能體競賽

OpenAI 將 Codex 擴展到更多地方:OpenAI 宣佈前沿模型和 Codex 現已在 AWS / Amazon Bedrock 上普遍可用,直接面向希望在現有 AWS 安全/合規工作流程中使用 OpenAI 功能的企業。@OpenAI, @OpenAIDevs。OpenAI 還發布了 Codex Python SDK,支持線程、輪次、流式、恢復、圖像和沙箱控制@reach_vb,以及支持基於 Bedrock 的 Codex 工作流程。@reach_vb on Bedrock config。

Claude Code 發生了真實運維事故:Anthropic 在修復一個錯誤後重置了 Pro 和 Max 用户的 5 小時和周速率限制,該錯誤導致一些 Opus 4.8 會話產生了過多並行子智能體/工具調用,意外消耗了使用量。@ClaudeDevs, 後續。這提醒我們,編程智能體產品質量越來越由編排行為決定,而不僅僅是原始模型智商。

編程模型之間的行為差異仍然很大:開發者強調了 GPT、Claude 和其他模型在 ProgramBench 和 WeirdML 等基準上的巨大定性差異,Opus 有時更傾向於探索而不是分數最大化,或表現出特定基準的怪癖。@OfirPress, @htihle。另一個長帖子認為,較新的 Claude Opus 4.6–4.8 變體可以在非編程領域編造看似合理但虛構的概念,表明可能存在真實性/對齊退化,而不僅僅是普通幻覺。@distributionat。

基礎設施、硬件和本地 AI 系統

NVIDIA 進軍個人電腦:討論最多的硬件發佈是 RTX Spark,一款 NVIDIA/Microsoft“個人 AI 計算機”,基於 Grace + Blackwell,具有高達 128GB 統一內存和聲稱的 1 PFLOP FP4。關鍵戰略解讀:NVIDIA 不再僅僅銷售加速器,而是提供一個端到端的本地 AI 系統,同時與 Apple Silicon、x86 PC 和 Qualcomm 競爭。@kimmonismus, @swyx。

集羣/網絡更新:在數據中心方面,Lambda 表示它率先採用 NVIDIA Quantum-X InfiniBand Photonics Q3450-LD 交換機,推動共封裝光學以降低大型 AI 集羣中的網絡功耗和故障。@LambdaAPI。OpenAI 還宣佈了 Stargate Michigan,一個計劃中的 1GW 數據中心,採用閉環冷卻,並附帶勞動力/教育承諾。@OpenAINewsroom。

本地開放模型工具正在快速改進:MLX-VLM v0.6.0 版本是更有實質意義的本地推理/工具更新之一,增加了推測解碼、Anthropic 風格和響應風格 API、工具調用、對許多新多模態模型的支持以及圖像/音頻功能,明確旨在將 Apple 設備變成“真正的本地智能體機器”。@Prince_Canuma。這與不斷增長的 DGX Spark + vLLM 本地 NVFP4 MoE 服務實驗相輔相成。@vllm_project。

熱門推文(按參與度排序,過濾技術相關性)

Anthropic 的 IPO 路徑:Anthropic 表示已向 SEC 秘密提交了 S-1 草案,為 IPO 鋪平道路,等待審查。@AnthropicAI。

Claude Code 使用事件:Anthropic 在發現 Opus 4.8 並行子智能體/工具調用錯誤導致過度配額消耗後重置了用户速率限制。@ClaudeDevs。

Qwen3.7-Plus:阿里巴巴發佈了覆蓋 GUI/CLI 操作、編程和視覺任務的多模態智能體模型。@Alibaba_Qwen。

OpenAI on Bedrock:OpenAI 模型和 Codex 現可通過 Amazon Bedrock 用於企業工作流程。@OpenAI。

ARC-AGI-3 進展:Claude Opus 4.8 在 ARC-AGI-3 上發佈了新的 SOTA,達到 1.5%,絕對值仍然很小,但在該基準上是一次有意義的跳躍。@arcprize。

AI Reddit 回顧

/r/LocalLlama + /r/localLLM 回顧

  1. 新前沿模型發佈和早期測試

MiniMax M3 - 編程和智能體前沿,1M 上下文,多模態(活動:1090):MiniMax M3 被宣佈為開放權重前沿模型,專注於編程/智能體,原生多模態/視覺,以及 MiniMax 稀疏注意力,支持高達 1M 令牌上下文,保證最低 512K(MiniMax M3)。聲稱的長期智能體結果包括 12 小時 ICLR 論文復現、Hopper FP8 GEMM CUDA/Triton 優化在 147 次迭代後達到 9.4 倍加速,以及 PostTrainBench 排名第三,僅次於 Opus 4.7 和 GPT-5.5。目前通過 API/MiniMax Code 訪問,計劃在 HuggingFace/GitHub 上發佈權重和本地部署。評論者謹慎地關注廉價高效視覺加上長上下文智能體編程的組合,但由於公告稱其為“開放權重”,而...(為控制 AI 成本而截斷)