[AINews] NVIDIA Cosmos 3, Nemotron 3 Ultra 和 RTX Spark
NVIDIA 釋出了 Cosmos 3 統一多模態世界模型、Nemotron 3 Ultra 高效 LLM 和 RTX Spark 個人 AI 超級晶片。同時,MiniMax M3、Qwen3.7-Plus 和 JetBrains Mellum2 等開放模型推動智慧體領域發展。
今日播客嘉賓曾是一年前 NVIDIA Cosmos 專案的負責人,討論了影片生成和世界模型的訓練。恰逢其時,Cosmos 3 於今日釋出,它將語言、影像、影片、音訊和動作統一在 Mixture-of-Transformers 架構中,該架構將自迴歸推理器與擴散生成器配對,提供基礎版 Nano(16B:8B 推理塔 + 8B 生成塔)和 Super(64B:32B 推理塔 + 32B 生成塔)模型,以及針對文本到影像和影像到影片的 Super 微調版本,現已成為開放權重影像和影片生成模型的新 SOTA,僅次於 Nano Banana 2。在臺灣 Computex 上,黃仁勳還帶來了 Nemotron 3 Ultra,這是一款 550B 引數(A55B)的高效快速開放權重 LLM,成為美國最新 SOTA。此外,RTX Spark 個人計算機(1 petaflop 超級晶片)與 Microsoft、OpenClaw 和 Hermes Agent 作為啟動合作伙伴進行了預覽(這裡有很好的分析)。AI 新聞日期為 2026 年 5 月 30 日至 6 月 1 日。我們檢查了 12 個子版塊、544 個 Twitter 賬戶和無其他 Discord 頻道。AINews 網站可搜尋所有過刊。提醒:AINews 現為 Latent Space 的一部分,您可以選擇接收郵件頻率。
AI Twitter 回顧:NVIDIA 的 Cosmos 3、Nemotron 3 Ultra 和開放物理 AI 的推動
NVIDIA 的開放原始碼周:NVIDIA 以 Cosmos 3(一個開放的全模態世界模型系列,用於物理 AI)以及 Nemotron 3 Ultra(550B 開放權重模型,多位發帖者稱其為迄今為止最強的美國開放模型)主導了開放模型討論。Cosmos 3 被定位為全棧釋出——權重、程式碼、資料集和微調配方——NVIDIA 還與 Runway 等合作伙伴共同推出了 Cosmos 聯盟,以構建世界模型的開放生態系統。@NVIDIAAI 生態系統背景、@runwayml 聯盟公告、@kimmonismus Cosmos 帖子、@ClementDelangue 關於 NVIDIA 在 HF 上的足跡。
Cosmos 3 的技術重要性:除了機器人技術修辭,更具體的細節是 Cosmos 3 在單一的 Mixture-of-Transformers 設計中統一了語言、影像、影片、音訊和動作,將自迴歸推理器與擴散生成器配對。Artificial Analysis 表示 Cosmos 3 在其文本到影像和影像到影片排行榜上均位居開放權重模型之首,並指出生成器使用結構化 JSON 提示,可由外部提示上取樣工具或其自身的推理分支驅動。此外,NVIDIA 的硬體+軟體推動還擴充套件到採用 OpenMDW 框架以及 fal 等平臺上的合作伙伴生態系統整合。@ArtificialAnlys, @fal。
Nemotron 3 Ultra 的反響:社群對 Nemotron 3 Ultra 的反饋異常熱烈,這是一個全新的開放釋出。發帖者強調了效能和服務特性,包括聲稱它已經在一些開放評估中名列前茅,並且在某些設定下可以達到 300+ tok/s 的服務速度——遠快於大型 DeepSeek/Kimi 類模型。@scaling01, @ctnzr, @caspar_br。還有一些技術討論,認為 Nemotron 的稀疏性似乎低於 Kimi K2 / DeepSeek V4 等同類模型——約 10% 啟用 vs 約 3%——這可能會影響成本和行為。@eliebakouch。
MiniMax M3、Qwen3.7-Plus 和 JetBrains Mellum2 擴充套件了開放智慧體模型領域
MiniMax M3 的釋出是當天最大的模型釋出:M3 被定位為開放權重的多模態智慧體/程式設計模型,具有 1M 上下文、原生多模態性和具有競爭力的智慧體基準。釋出合作伙伴重複的關鍵數字包括 59.0% SWE-Bench Pro、66.0% Terminal Bench 2.1 和 74.2% MCP Atlas。@MiniMax_AI, @PBDTokenRouter, @kimmonismus。多個基礎設施供應商釋出了首日支援——Novita、Vercel AI Gateway、Cloudflare AI Gateway、OpenClaude、Flowith 等——表明生態系統採用異常迅速。@MiniMax_AI on Novita, @rauchg, @gitlawb。
基準測試與實際體驗好壞參半:M3 在前端生成、視覺/遊戲任務和價效比方面獲得了讚譽,並排演示顯示了強大的一次性 UI/遊戲輸出,以及在 Next.js 智慧體評估方面的顯著基準排名。@notjazii, @lostinlatencyX, @rauchg。但一些評估者也報告了高令牌消耗、冗長的自檢迴圈以及在長任務中偶爾出現的需求漂移,使 M3 看起來更像是一個“質量優先,效率其次”的模型。@ZhihuFrontier 評論, @teortaxesTex 懷疑。
Qwen3.7-Plus:阿里巴巴釋出了 Qwen3.7-Plus,這是一個多模態互動式混合智慧體,統一了 GUI 和 CLI 操作、視覺推理、程式設計和搜尋增強問答。它可透過阿里雲模型工作室 API 使用,並迅速被新增到 Cline 等工具中。@Alibaba_Qwen 釋出, @cline。這次釋出強化了趨勢:開放的亞洲實驗室不再發布“僅聊天模型”,而是釋出具備完整智慧體能力的多模態系統。
JetBrains Mellum2:JetBrains 釋出了 Mellum2,一個 12B MoE 模型,具有 2.5B 活躍引數,訓練約 11T 令牌,並使用 RLVR 進行後訓練,釋出基礎 / SFT / RL 檢查點和技術報告。@nv_pavlichenko, @jetbrains。其預期定位尤其有趣:用於路由、RAG、子智慧體和 IDE 使用的超低延遲推理,並立即被 vLLM 支援。@vllm_project。這看起來像是針對“用於開發人員工作流程的快速小型開放模型”的嚴肅嘗試,而不是追求基準的前沿釋出。
智慧體、沙箱、記憶體和搜尋正成為真正的產品介面
堆疊正從模型呼叫轉向智慧體執行時:多個釋出趨同於一個觀點,即主要的工程槓桿現在在於工具而非模型。Perplexity 的“搜尋即程式碼”是最清晰的例子:模型不是進行迭代搜尋工具呼叫,而是針對搜尋 SDK 編寫 Python,從而實現自定義排名管道、索引上的對映歸約、批處理、聚合和更低的令牌開銷。Perplexity 報告其內部 WANDR 基準從 0.152 躍升至 0.386。@perplexity_ai, @AravSrinivas。
託管智慧體 + 沙箱正成為標準:Google 詳細介紹了 Gemini API 中的託管智慧體,單個 API 呼叫即可啟動一個智慧體,該智慧體可以進行推理、編寫/執行程式碼、管理檔案並在託管的 Linux 沙箱內操作。@_philschmid, @GoogleAIStudio。LangChain 圍繞 Deep Agents、Context Hub 和 LangSmith Sandboxes/Engine 推動了類似想法,強調持久上下文、智慧體生命週期工具和自動故障分類。@LangChain, @hwchase17。
記憶體仍然是一個缺失的原始要素:一個反覆出現的抱怨是,巨大的上下文視窗仍然無法解決跨會話記憶體問題。關於 HydraDB 的一個帖子認為,“RAG + 手動上下文注入”被誤稱為記憶體,而實際的持久會話知識仍然服務不足。@kimmonismus。相關研究執行緒指向可重用的上下文管理策略,如 AdaCoM,它透過 RL 訓練單獨的 LLM 來修剪/保留凍結智慧體的上下文。@dair_ai。
安全仍然是企業智慧體的瓶頸問題:Microsoft 安全情報部門釋出了一個重大警告,關於影響 90 多個 redhat-cloud-services 包的主要 npm 供應鏈攻擊,包括一個自傳播蠕蟲,竊取 npm/GitHub/AWS/SSH 憑據。@MsftSecIntel。與此同時,企業智慧體供應商強調沙箱、執行時隔離和安全堆疊整合是部署的先決條件,包括對 NVIDIA OpenShell 和 LangChain 沙箱主題演講的討論。@shannholmberg, @LangChain。
Codex、Claude Code 和競爭性的程式設計智慧體競賽
OpenAI 將 Codex 擴充套件到更多地方:OpenAI 宣佈前沿模型和 Codex 現已在 AWS / Amazon Bedrock 上普遍可用,直接面向希望在現有 AWS 安全/合規工作流程中使用 OpenAI 功能的企業。@OpenAI, @OpenAIDevs。OpenAI 還發布了 Codex Python SDK,支援執行緒、輪次、流式、恢復、影像和沙箱控制@reach_vb,以及支援基於 Bedrock 的 Codex 工作流程。@reach_vb on Bedrock config。
Claude Code 發生了真實運維事故:Anthropic 在修復一個錯誤後重置了 Pro 和 Max 使用者的 5 小時和周速率限制,該錯誤導致一些 Opus 4.8 會話產生了過多並行子智慧體/工具呼叫,意外消耗了使用量。@ClaudeDevs, 後續。這提醒我們,程式設計智慧體產品質量越來越由編排行為決定,而不僅僅是原始模型智商。
程式設計模型之間的行為差異仍然很大:開發者強調了 GPT、Claude 和其他模型在 ProgramBench 和 WeirdML 等基準上的巨大定性差異,Opus 有時更傾向於探索而不是分數最大化,或表現出特定基準的怪癖。@OfirPress, @htihle。另一個長帖子認為,較新的 Claude Opus 4.6–4.8 變體可以在非程式設計領域編造看似合理但虛構的概念,表明可能存在真實性/對齊退化,而不僅僅是普通幻覺。@distributionat。
基礎設施、硬體和本地 AI 系統
NVIDIA 進軍個人電腦:討論最多的硬體釋出是 RTX Spark,一款 NVIDIA/Microsoft“個人 AI 計算機”,基於 Grace + Blackwell,具有高達 128GB 統一記憶體和聲稱的 1 PFLOP FP4。關鍵戰略解讀:NVIDIA 不再僅僅銷售加速器,而是提供一個端到端的本地 AI 系統,同時與 Apple Silicon、x86 PC 和 Qualcomm 競爭。@kimmonismus, @swyx。
叢集/網路更新:在資料中心方面,Lambda 表示它率先採用 NVIDIA Quantum-X InfiniBand Photonics Q3450-LD 交換機,推動共封裝光學以降低大型 AI 叢集中的網路功耗和故障。@LambdaAPI。OpenAI 還宣佈了 Stargate Michigan,一個計劃中的 1GW 資料中心,採用閉環冷卻,並附帶勞動力/教育承諾。@OpenAINewsroom。
本地開放模型工具正在快速改進:MLX-VLM v0.6.0 版本是更有實質意義的本地推理/工具更新之一,增加了推測解碼、Anthropic 風格和響應風格 API、工具呼叫、對許多新多模態模型的支援以及影像/音訊功能,明確旨在將 Apple 裝置變成“真正的本地智慧體機器”。@Prince_Canuma。這與不斷增長的 DGX Spark + vLLM 本地 NVFP4 MoE 服務實驗相輔相成。@vllm_project。
熱門推文(按參與度排序,過濾技術相關性)
Anthropic 的 IPO 路徑:Anthropic 表示已向 SEC 秘密提交了 S-1 草案,為 IPO 鋪平道路,等待審查。@AnthropicAI。
Claude Code 使用事件:Anthropic 在發現 Opus 4.8 並行子智慧體/工具呼叫錯誤導致過度配額消耗後重置了使用者速率限制。@ClaudeDevs。
Qwen3.7-Plus:阿里巴巴釋出了覆蓋 GUI/CLI 操作、程式設計和視覺任務的多模態智慧體模型。@Alibaba_Qwen。
OpenAI on Bedrock:OpenAI 模型和 Codex 現可透過 Amazon Bedrock 用於企業工作流程。@OpenAI。
ARC-AGI-3 進展:Claude Opus 4.8 在 ARC-AGI-3 上釋出了新的 SOTA,達到 1.5%,絕對值仍然很小,但在該基準上是一次有意義的跳躍。@arcprize。
AI Reddit 回顧
/r/LocalLlama + /r/localLLM 回顧
- 新前沿模型釋出和早期測試
MiniMax M3 - 程式設計和智慧體前沿,1M 上下文,多模態(活動:1090):MiniMax M3 被宣佈為開放權重前沿模型,專注於程式設計/智慧體,原生多模態/視覺,以及 MiniMax 稀疏注意力,支援高達 1M 令牌上下文,保證最低 512K(MiniMax M3)。聲稱的長期智慧體結果包括 12 小時 ICLR 論文復現、Hopper FP8 GEMM CUDA/Triton 最佳化在 147 次迭代後達到 9.4 倍加速,以及 PostTrainBench 排名第三,僅次於 Opus 4.7 和 GPT-5.5。目前透過 API/MiniMax Code 訪問,計劃在 HuggingFace/GitHub 上釋出權重和本地部署。評論者謹慎地關注廉價高效視覺加上長上下文智慧體程式設計的組合,但由於公告稱其為“開放權重”,而...(為控制 AI 成本而截斷)