本文提出了一種延遲逐步獎勵歸因方法,結合資格門控、異步rollout生成等,使8B參數開源模型在NeurIPS 2025 MindGames Arena基準測試中擊敗GPT-5等大型系統,贏得雙賽道第一。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
提出一種基於最優傳輸理論的置換不變貝葉斯優化方法(PIBO),用於解決海上風電場佈局優化問題。相比傳統貝葉斯優化,PIBO能利用問題對稱性,在降低計算時間約一半的同時獲得更優佈局。
多目標分子優化需要在衝突目標下搜索廣闊的化學空間,早期設計決策嚴重約束後續結果。現有方法通常依賴單一策略或固定標量化,限制了表示多樣權衡和探索多個有前途設計軌跡的能力。本文提出ATOM,一種多智能體框架,將分子優化建模為樹結構搜索。每個節點對應原子操作,並託管一個針對特定目標或決策情境的智能體。智能體沿樹的不同路徑協調,而非強制執行全局共識,從而能夠維護和比較替代分子進化軌跡。全局記憶進一步支持跨目標的平衡探索與利用。在涉及活性、可合成性和ADMET相關屬性的挑戰性多目標基準上,ATOM始終優於強基線,展示了路徑多智能體協調的有效性。
提出了一種結合三個治理層(知識工件生命週期、聲譽加權審議投票、漸進式制裁)的審慎策展協議。通過100個智能體的仿真,顯示在逆境下比多數投票具有更強的韌性。
提出Consilium協議,一種基於拜占庭容錯的架構,用於多模型AI結構化審議。通過分配認知人物,低成本模型可達到前沿模型的分析質量,並揭示RLHF對齊帶來的領域特定認知盲點。
本文提出,混合整數線性規劃(MILP)決策引擎在部署時面臨求解後魯棒性缺口,即成本、需求等微小擾動可能導致不可行或解突變。作者主張在優化流水線中增加一個審計層,形式化定義了參數空間中的ε-近優可行鄰域和決策空間中的解平滑性,並綜合了敏感性分析、魯棒優化等領域的成果,呼籲建立統一的求解後魯棒性層,包括已求解的 certified 內逼近、概率魯棒性估計、對抗魯棒性邊界以及基於學習的預測與解釋。最後提出了報告模板和評估協議。
該法案旨在建立美國首個專注於人工智能領域的主權財富基金,以推動AI技術發展並確保國家競爭力。
NVIDIA 發佈了 Cosmos 3 統一多模態世界模型、Nemotron 3 Ultra 高效 LLM 和 RTX Spark 個人 AI 超級芯片。同時,MiniMax M3、Qwen3.7-Plus 和 JetBrains Mellum2 等開放模型推動智能體領域發展。
本文演示如何在Amazon Bedrock AgentCore Gateway上為MCP服務器實現OAuth授權碼流程作為入站授權機制。完成後,每個AI助手請求都將使用來自組織身份提供者的有效用户身份令牌進行身份驗證。
Meta 的 AI 支持系統完整提示被泄露,揭示了其內部指令,包括語言規則、問題處理流程和領域代理選擇機制。
Novus是一款AI工具,可在軟件部署過程中自動識別並修復可用性問題,幫助團隊提升用户體驗。
Jan 是一款開源的本地 AI 助手,注重隱私和個性化,支持多種模型,即將推出記憶功能。
Branda 是一款AI驅動的品牌創建工具,能將一個名字和想法在幾分鐘內轉化為完整的品牌身份,包括策略、標誌、調色板、字體和全套品牌套件。提供引導式流程和視覺提示,導出可用的資產。
X.Org Server和XWayland中發現了九項新安全漏洞,其中八項由Trend Micro的TrendAI發現,一項由Red Hat的Peter Hutterer發現。漏洞類型包括緩衝區溢出、釋放後使用等。已發佈xorg-server 21.1.23和xwayland 24.1.12補丁。
NVIDIA 在 COMPUTEX 上宣佈推出 JetPack 7.2 和 Jetson 上的 NemoClaw 支持,將自主 AI 帶到邊緣設備。這些更新包括 Yocto 支持、CUDA 13、性能提升、MIG 支持以及用於在機器人、檢測和工業自動化中部署 AI 代理的 NemoClaw 框架。
《知識工作的下一個時代》報告探討了 Codex 如何通過 AI 驅動的研究、數據分析、工作流自動化和內容創作來提升生產力。
微軟對GitHub Copilot實施基於使用量的計費政策,開發者抱怨每月配額在數小時內耗盡,成本激增,引發大量用户考慮遷移至其他AI服務。
本文詳細介紹瞭如何從源碼構建 NVIDIA Apex,檢測融合內核,並基準測試 FusedAdam、FusedLayerNorm 和 torch.amp 在 Transformer 訓練中的性能提升。
GitHub Copilot 引入基於使用量的計費系統,使用信用點數計費。成本取決於模型和令牌數,高級模型費用高,且簡單查詢也可能消耗大量信用點。用户需注意自動模式可能選擇昂貴模型。
Normal Computing的工程師利用AI智能體在CIRCT之上構建了實用的驗證堆棧,包括仿真、形式驗證、變異測試等。
aweskill 是一個專為AI編碼智能體設計的命令行技能包管理器,允許智能體自主安裝、更新和管理技能,無需人工干預。通過一次引導,智能體可執行搜索、安裝、創建捆綁包、檢查更新等操作,且內置兩個元技能用於常規管理和修復。
當 AI 網關積分耗盡時,所有請求都會被阻止,包括使用自帶密鑰(BYOK)的請求,這與文檔描述不符。
Together AI 通過KV塊主稀疏注意力、分頁MSA解碼、優化索引評分內核以及基於Rust的多模態預處理網關等創新,實現了對MiniMax M3模型的高效服務,在不同併發級別下吞吐量提升81%–125%。
儘管AI在編程、圖像和文本生成方面取得巨大進展,但遊戲開發仍耗時多年。文章解釋了AI公司為何優先關注通用領域,並預測它們將很快轉向遊戲開發,因為遊戲行業市場規模巨大,技術障礙已大部分被克服。
Databricks為其AI編碼助手Genie Code引入了指令、技能和MCP服務器等個性化功能,使AI能更好地遵循團隊編碼標準、內部工作流程和外部工具。指令設置全局偏好,技能捕獲可重複的工作流程,MCP服務器連接外部系統如Jira、GitHub等。
作者接手了一個內部AI應用的前端,代碼質量堪憂,大部分由AI生成。面對15萬用户,他決定逐步重構,改善代碼質量,同時保持業務運行。
伯克希爾·哈撒韋通過私募方式向Alphabet追加投資100億美元,顯示出對AI領域頭部玩家的信心。此舉是Alphabet 800億美元股票發行計劃的一部分,資金將用於AI基礎設施擴建。
Tokenmaxxing指的是公司將AI預算全部花費在token上而不清楚投資回報率的做法。本文主張將token支出分為四個利潤表類別——研發、銷售成本、銷售與營銷(客户獲取成本)和留存(淨收入留存),每個類別使用不同的指標進行評估,並以Mintlify的產品套件為例進行説明。
AI自動化看似威脅工作,但實際上創造了更多人類工作。文章通過內部實踐和行業案例,闡述了AI代理需要人類監督、維護和協作,導致工作量增加。AI商品化顯性專業知識,反而提升了對人類專家的需求。
未來工作的特點是AI代理自主執行低風險任務,同時涉及一些人類協作。