跳到主要內容
AI News HubLIVE

本期精選

模型

OpenAI 釋出 MentalHealthBench:面向心理健康對話的開放基準

  • 由 80 多位來自 22 個國家、使用 19 種語言的持證心理健康專家共同打造。
  • 覆蓋非急性、高急性與緊急場景,以及成人、13–17 歲青少年、照護者和臨床醫生四類使用者畫像。
OpenAI News站內正文OpenAI 釋出 MentalHealthBench:面向心理健康對話的開放基準

[AINews] Claude Opus 5.5 成為 AINews 新預設模型——各家公司降價 40-50%

  • Opus 5.5 在智慧體編碼、計算機使用和知識工作上領先,官方稱比 Opus 5 快約 30%,API 令牌價格從每百萬 5/25 美元降至 4/20 美元。
  • Artificial Analysis 發現最大 effort 下每任務成本與 Opus 5 基本持平(5.98 美元對 5.86 美元),因為更高 token 用量抵消了降價。
Latent Space站內正文[AINews] Claude Opus 5.5 成為 AINews 新預設模型——各家公司降價 40-50%

OpenAI 釋出 GPT-6 Sol 與 Luna,token 價格砍半

  • 價格:Sol 每百萬輸入/輸出 token 為 2/10 美元,Luna 為 0.10/0.50 美元,較 GPT-5.6 同系列砍半以上,且為預設價而非促銷價。
  • 效能:Zapier 的 AutomationBench 上 Luna 提升 5.4 個百分點;DeepSWE v1.1 上 Sol 與 Anthropic Fable 5 基本持平,但成本僅約 20%。
The New Stack AI站內正文OpenAI 釋出 GPT-6 Sol 與 Luna,token 價格砍半

相同數量,不同答案:語言模型中的數值表示不變性

  • 研究在 3,600 道精確有理數題和 8,600 條提示上評測五個開放權重模型,覆蓋五類保持等值的改寫。
  • 經過固定語法審計後,正準準確率為 0.969–0.996,但軌道正確率和軌道不變性降至 0.848–0.981 與 0.851–0.981。
arXiv Computational Linguistics站內正文相同數量,不同答案:語言模型中的數值表示不變性
Agent

Grab 與 OpenAI 將實用 AI 技能帶到東南亞

  • “GO Forward with AI”計劃將在兩年內覆蓋 Grab 在東南亞的 3 萬名司機、配送和商戶合作伙伴。
  • 專案從新加坡起步,年內擴充套件至泰國、印尼和菲律賓,2027 年進入馬來西亞和越南。
OpenAI News站內正文Grab 與 OpenAI 將實用 AI 技能帶到東南亞

Genie One MCP:讓任意 AI 智慧體獲得正確的業務上下文

  • Genie One MCP 把 Genie Ontology 的受治理業務上下文擴充套件到任何相容 MCP 的 AI 助手與編碼智慧體。
  • Genie Ontology 彙總獲批指標、業務定義、資料關係、所有權與訪問策略,並依據權威性和認證狀態消解來源衝突。
Databricks Blog站內正文Genie One MCP:讓任意 AI 智慧體獲得正確的業務上下文
政策

深度偽造與合成媒體:生成、檢測與治理

  • 綜述涵蓋 GAN、擴散模型、神經渲染與影片合成等深度偽造生成技術。
  • 檢測依賴空間、時間、頻域和生理偽影,CNN、Transformer 與頻域方法是主要方法族。
arXiv Computer Vision站內正文深度偽造與合成媒體:生成、檢測與治理
研究

Peerify:面向同行評審論斷驗證的基準測試

  • Peerify 將評審意見拆解為原子化論斷,檢索稿件證據,並判斷每個論斷是否得到論文支援。
  • 基準包含 800 條來自 NeurIPS 2024 和 ICLR 2024 真實評審互動的論斷,其中 300 條經人工標註用於審計自動監督。
arXiv Computational Linguistics站內正文Peerify:面向同行評審論斷驗證的基準測試

揭示深度不平衡迴歸評估中的盲點

  • DIR 評估受限於影像基準主導、標準協議不完整和尾部穩定性未檢驗三大盲點。
  • 研究在 MuViS 多模態虛擬感測基準上評估九個時間序列迴歸任務,覆蓋六個物理領域。
arXiv Machine Learning站內正文揭示深度不平衡迴歸評估中的盲點

已閱讀至本期精選末尾。

我的稍後讀
其餘更新(116 條)
Agent

MIT 歡迎 David Siegel(SM ’86、PhD ’91)出任下一任創新研究員

電腦科學家、企業家兼慈善家 David Siegel 將在 2026-27 學年擔任 MIT 創新研究員,與 MIT Schwarzman 計算學院合作,研究人工智慧如何加速科學發現。

MIT News AI站內正文MIT 歡迎 David Siegel(SM ’86、PhD ’91)出任下一任創新研究員

YouTube 正在打造幾乎能替創作者包辦一切的 AI 工具

在 Made on YouTube 活動上,YouTube 宣佈升級其 AI 創作者工具,新增可在後臺最佳化頻道的 AI 代理,能生成縮圖、標題並整理品牌提案。平臺還推出動態縮圖和最多三個影片版本測試。YouTube 未提供資料證明工具能提升指標,只強調可節省創作者時間。

The Verge AI站內正文YouTube 正在打造幾乎能替創作者包辦一切的 AI 工具

IntellAgents.io:用一個 AI 智慧體應對每一通電話、聊天與私信

IntellAgents.io 在 Product Hunt 上以一句話定位亮相:為每一通電話、每一次聊天和每一條私信配備一個 AI 智慧體。該頁面目前披露的資訊非常有限,僅給出這一定位口號與討論入口。

Product Hunt AI站內正文IntellAgents.io:用一個 AI 智慧體應對每一通電話、聊天與私信

待翻譯:MCP Is Not Just Another API Standard

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Ask most engineers what MCP is and you’ll get the same answer: a way to plug tools into an LLM. Fair enough, as far as it goes. But that description treats MCP like plumbing, and after months building MCP-based integrations for large enterprise platforms, I don’t think plumbing is the right metaphor. Plumbing moves water […]

O'Reilly AI & ML Radar來源內容 · 翻譯待補全待翻譯:MCP Is Not Just Another API Standard

LaterOn v2:代理式電子郵件平臺

LaterOn v2 是 Product Hunt 上出現的一款代理式電子郵件平臺,主打只需描述一次郵件任務,就能讓系統自動把工作完成。

Product Hunt AI站內正文LaterOn v2:代理式電子郵件平臺

SpeakON 推出帶獨立麥克風的 MagSafe AI 語音按鈕

SpeakON 釋出了一款 25 克的 MagSafe AI 語音按鈕,內建獨立麥克風、電池和儲存,可作為 iOS 鍵盤擴充套件把處理後的文本直接寫入任意輸入框;支援離線緩衝,並提供智慧潤色、列表、風格、翻譯、詞典、語音編輯和筆記等功能。裝置在美國以 129 美元一次性買斷出售,含 Pro Lifetime,SpeakON Agent 將於 2026 年 10 月推出。

MarkTechPost站內正文SpeakON 推出帶獨立麥克風的 MagSafe AI 語音按鈕

SpeakON 釋出自帶麥克風的 MagSafe AI 語音按鍵:把語音變成打磨過的溝通與跨應用操作

SpeakON 推出一枚重 25 克的 MagSafe 磁吸語音按鍵,自帶麥克風和電池,透過 iOS 鍵盤擴充套件把經過潤色的文字直接寫入任意應用的輸入框。它支援鎖屏與離線使用,內建 Smart Polish、Smart List、Style、Translation 等文本處理功能,美國一次性售價 129 美元,含 Pro 終身授權,無訂閱費。

MarkTechPost站內正文SpeakON 釋出自帶麥克風的 MagSafe AI 語音按鍵:把語音變成打磨過的溝通與跨應用操作

舊金山10月14日:一場關於「智慧體工程」的同行交流夜談

Simon Willison 與 Jesse Vincent 將於 10 月 14 日(週三)晚在舊金山舉辦一場面向編碼智慧體(coding agents)構建者的非正式交流活動,形式接近「智慧體版作品展示會」,鼓勵分享尚未公開的奇怪實驗、未完成專案與早期探索,而非產品推銷。

Simon Willison's Weblog站內正文舊金山10月14日:一場關於「智慧體工程」的同行交流夜談

Kaiku

Kaiku 是一款面向 AI 代理的任務追蹤工具,其 Product Hunt 標語稱它是“你的 AI 代理已經知道如何使用”的任務追蹤器。

Product Hunt AI站內正文Kaiku

待翻譯:How to serve trillions of tokens for trillion-parameter coding agents

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Learn how we optimized performance and efficiency serving the workload that is changing software engineering forever — and you can too.

Modal Blog來源內容 · 翻譯待補全待翻譯:How to serve trillions of tokens for trillion-parameter coding agents

Rabbit 推出無需 R1 硬體即可執行的 AI 代理

Rabbit 釋出獨立 AI 代理,無需其 R1 硬體即可使用。基於雲端的 OS3“代理式作業系統”可跨 Windows、Mac 和 Linux 在本地執行任務,每個賬戶最多繫結五臺裝置與偏好的 AI 模型,並可透過桌面網站、Telegram/iMessage 以及 R1 訪問。Rabbit 已停止生產 R1,轉而籌備執行 OS3 的“cyberdeck”。公司稱 OS3 不會儲存、複製、使用或出售使用者資料,但聊天記錄與記憶仍留在其伺服器,第三方 AI 提供商按其自身隱私政策處理資料。

The Verge AI站內正文Rabbit 推出無需 R1 硬體即可執行的 AI 代理

Jev State:把 AI 對話變成測試與可執行程式碼

Jev State 是在 Product Hunt 上亮相的一款工具,主打把與 AI 的對話內容轉化為測試用例,並進一步生成可執行的程式碼。目前官方只給出了一句功能描述,具體工作流、支援的框架與生成程式碼的可用性尚未公開。

Product Hunt AI站內正文Jev State:把 AI 對話變成測試與可執行程式碼

引用:@therealcornpop 談 AI 寫指令碼為何一眼可辨

TikTok 創作者 @therealcornpop 指出,用 AI 撰寫短影片指令碼的破綻不在表面的「AI 腔調」,而在於內容空洞、缺乏個人聲音與真實觀點。Simon Willison 於 2026 年 9 月 22 日在其部落格上收集併發布了這段引用。

Simon Willison's Weblog站內正文引用:@therealcornpop 談 AI 寫指令碼為何一眼可辨

待翻譯:Evaluate skill-equipped agents with Strands Evals and Amazon Bedrock AgentCore

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Skills let you encode domain-specific procedures as reusable, portable instructions for agents, but a fluent answer doesn't prove the agent picked the right skill or followed it. Learn how to measure skill selection and instruction following with Strands Evals and Amazon Bedrock AgentCore Evaluations.

AWS Machine Learning Blog來源內容 · 翻譯待補全待翻譯:Evaluate skill-equipped agents with Strands Evals and Amazon Bedrock AgentCore

瞭解 Databricks 成本的 5 個系統表查詢

Databricks 系統表可近即時地按產品、SQL 倉庫和標籤拆解成本。本文介紹五個 SQL 查詢:每日產品支出、倉庫成本趨勢、基於標籤的成本歸因、14 天異常檢測,以及 AI 驅動的支出預測,並說明注意事項和儀表板落地方式。

Databricks Blog站內正文瞭解 Databricks 成本的 5 個系統表查詢

Genie One MCP 現已正式全面可用

Databricks 宣佈 Genie One MCP 伺服器正式全面可用。它讓任意 AI 智慧體透過統一介面,從 Genie One 獲取結構化與非結構化資料、洞察和答案,並以 Genie Ontology 的受治理業務上下文為基礎。該 MCP 現已作為 Unity Gateway 中的託管 MCP 服務提供,支援集中治理、細粒度策略和審計日誌。

Databricks Blog站內正文Genie One MCP 現已正式全面可用

待翻譯:AI Change Management | Cohere

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Change management has long covered two familiar kinds of change: the rollout of new tools and technologies, and broader human-led transformations such as leadership changes and restructuring. But that distinction starts…

Cohere Blog來源內容 · 翻譯待補全待翻譯:AI Change Management | Cohere

待翻譯:The frontier isn’t a model. It’s a router.

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:The frontier isn’t a model. It’s a router. Join us for our inaugural conference, Forge 2026 Blog The Frontier Isnt A Model Its A Router The frontier isn’t a model. It’s a router. PUBLISHED 9/21/2026 Table of Contents Ho…

Fireworks AI Blog來源內容 · 翻譯待補全待翻譯:The frontier isn’t a model. It’s a router.

待翻譯:The Accelerationist Case for Frontier Pacing

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:The following article originally appeared on Venkatesh Rao’s Substack, Contraptions, and is being republished here with the author’s permission. The sole athletic achievement of my life came in 1993: winning the IIT Bombay freshman 50m freestyle race with a time of 41s. That got me into the college swim team (it was a bad recruitment […]

O'Reilly AI & ML Radar來源內容 · 翻譯待補全待翻譯:The Accelerationist Case for Frontier Pacing

待翻譯:Pinecone BYOC: Trusted AI Knowledge in the Customer Cloud | Pinecone

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:← Blog Pinecone BYOC: Trusted AI Knowledge in the Customer Cloud Jeff Zhu, Joerg Schad Sep 23, 2026 Product Share: Today, we are announcing the general availability of Pinecone Bring Your Own Cloud (BYOC) on AWS, Google…

Pinecone Blog來源內容 · 翻譯待補全待翻譯:Pinecone BYOC: Trusted AI Knowledge in the Customer Cloud | Pinecone
工具

我與AI的(複雜)關係:常常誘人、偶爾令人沮喪,且始終需要保持警惕

一位多語種學者在從利物浦開往倫敦的火車上發現,車廂裡半數乘客正與ChatGPT、Claude、Gemini等聊天機器人深談。她承認AI為多語種研究者拉平了競爭環境,但堅持自己仍要思考、判斷,並形成那些固執地屬於自己的想法——與AI的關係往往誘人,偶爾令人沮喪,而且始終需要保持警惕。

The Guardian AI站內正文我與AI的(複雜)關係:常常誘人、偶爾令人沮喪,且始終需要保持警惕

Aks.ai:引導式自我反思的個人伴侶

Aks.ai 在 Product Hunt 上以“引導式自我反思的個人伴侶”為定位亮相,目前頁面資訊精簡,細節仍待官方補充。

Product Hunt AI站內正文Aks.ai:引導式自我反思的個人伴侶

Anthropic 釋出 Opus 5.5:效能強勁,價格仍走高階路線

Anthropic 推出 Opus 5.5,強調其強大的效能表現,但定價依然偏高。在與競爭對手的價格戰中,這家 AI 實驗室仍處於落後位置。

AI Business站內正文Anthropic 釋出 Opus 5.5:效能強勁,價格仍走高階路線

待翻譯:OpenAI nabs key Patreon execs ahead of upcoming announcement

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Patreon co-founder Sam Yam is joing OpenAI to lead Creator Product. | Image: The Verge OpenAI has hired three former Patreon execs to anchor its product strategy for creators. After starting the creator subscription platform 13 years ago, co-founder and technology chief Sam Yam announced on X that he's joining OpenAI to lead Creator Product. He's also bringing Patreon's former product head Drew Rowny and engineering head Shannon Ma with him on the new venture, both of whom stepped down in the past few weeks. "We're going to build together with Creators at OpenAI and share early access to a new set of tools that I think will be critically valuable to Creators and their communities," Yam said in his announcement. "Pay attention … Read the full story at The Verge.

The Verge AI來源內容 · 翻譯待補全待翻譯:OpenAI nabs key Patreon execs ahead of upcoming announcement

Lisen:採用 Cartesia 語音的免費朗讀工具

Lisen 是在 Product Hunt 上釋出的一款工具,主打免費朗讀功能,語音由 Cartesia 提供。目前公開資訊較少,頁面僅包含產品名稱、簡短介紹以及討論與連結入口。

Product Hunt AI站內正文Lisen:採用 Cartesia 語音的免費朗讀工具

英國將設新機構應對俄羅斯等國的“資訊戰”,伯納姆表示

英國首相安迪·伯納姆宣佈,安全部門將成立國家資訊防禦中心,以應對外國敵對勢力藉助AI傳播的虛假資訊與深度偽造內容,並整合情報機構、執法部門與社交媒體公司,對外國勢力的資訊攻擊進行偵測、歸因與阻斷。

The Guardian AI站內正文英國將設新機構應對俄羅斯等國的“資訊戰”,伯納姆表示

ChatGPT 廣告擴充套件至東南亞和臺灣

OpenAI 將 ChatGPT 廣告陸續推向印度尼西亞、馬來西亞、菲律賓、新加坡、泰國、越南和臺灣,使該廣告產品覆蓋 60 多個國家。廣告僅向 Free 和 Go 套餐使用者展示,Plus、Pro 和 Enterprise 訂閱繼續保持無廣告。

OpenAI News站內正文ChatGPT 廣告擴充套件至東南亞和臺灣

AI 究竟會如何“消滅全人類”?最有可能的五種情景 | 託比·沃爾什

衛報評論文章從 AI 研究員 Jacob Coxon 從 Anthropic 辭職一事切入,引出業內對“AI 可能在本十年內滅絕人類”的公開擔憂,並梳理了從新型生物武器到社會全面崩潰等五種最被討論的末日情景。

The Guardian AI站內正文AI 究竟會如何“消滅全人類”?最有可能的五種情景 | 託比·沃爾什

Bracket

Bracket 在 Product Hunt 上亮相,定位為“企業的記憶層”,旨在為業務提供統一的資訊記憶與呼叫能力。目前公開資訊有限,官方僅給出這一句產品定位。

Product Hunt AI站內正文Bracket

AgreeGuard

AgreeGuard 是一款在 Product Hunt 上亮相的 AI 工具,可在你點選“我同意”前閱讀細則,幫助使用者瞭解條款與隱私政策。

Product Hunt AI站內正文AgreeGuard

Speechka:聽起來像你的即時語音翻譯

Speechka 是一款即時語音翻譯工具,主打讓翻譯後的語音聽起來仍像說話者本人。它在 Product Hunt 上釋出,並提供討論與連結入口。

Product Hunt AI站內正文Speechka:聽起來像你的即時語音翻譯

特朗普稱美國將正式把AI更名為“超級智慧”

特朗普在聯合國大會演講中宣稱,美國現在“正式”把人工智慧(AI)改稱為“超級智慧”,理由是他認為“人工”一詞讓智慧顯得虛假。此番表態與他對伊朗、“全球主義者”和跨性別者的抨擊出現在同一場講話中,目前並無證據顯示存在相應的官方更名程式。

The Verge AI站內正文特朗普稱美國將正式把AI更名為“超級智慧”
機器人

Sakeena Fiza 助力 NVIDIA 硬體實現規模化成功

NVIDIA 驗證工程師 Sakeena Fiza 講述團隊如何在產品釋出前對資料中心繫統進行壓力測試,從首次通電到機架級部署,力求在客戶發現問題之前先發現並解決故障。

NVIDIA Blog站內正文Sakeena Fiza 助力 NVIDIA 硬體實現規模化成功

HOTICE:雜亂環境中的全身人形機器人物體運輸

HOTICE 是一個面向雜亂環境的全身人形機器人物體運輸學習框架。它提出 Humanoid-Object Decoupled Potential Fields,將機器人本體與搬運物體的避障引導聯合編碼;並設計上下身解耦的雙智慧體強化學習架構,透過共享狀態觀測與獎勵維持全身協調。訓練上採用專家到通用蒸餾,把多個特權教師策略壓縮為單一可部署學生策略。研究在 MuJoCo 模擬和真實 Unitree G1 人形機器人上驗證,顯示其能運輸不同形狀物體、泛化到未見雜亂場景,並取得較強的 sim2real 表現。

arXiv Robotics站內正文HOTICE:雜亂環境中的全身人形機器人物體運輸

從人類示範中學習主動協助:人機協同搬運框架 PROACT

研究者提出 PROACT 框架,把對人類協作行為的預測融入柔順全身控制,使機器人在與人共同搬運重物時既能高效移動物體,又能順應使用者的施力。在 108 次真實世界試驗中,該方法顯著降低了互動做功與任務完成時間。

arXiv Robotics站內正文從人類示範中學習主動協助:人機協同搬運框架 PROACT

在人機協作中學習規劃:面向自適應互動的多模態強化學習

一篇新的 arXiv 論文提出用強化學習自動生成機器人助手的多模態互動策略,基於人類資料訓練的模擬器和簡單高層獎勵函式。真實場景人類研究顯示可用性高、任務完成有效,為手工設計互動管理器提供可擴充套件且可解釋的替代方案。

arXiv Robotics站內正文在人機協作中學習規劃:面向自適應互動的多模態強化學習
模型

🔬生物安全是一場 AI 軍備競賽——專訪 Radical Numerics CEO Eric Nguyen

Radical Numerics 聯合創始人兼 CEO Eric Nguyen 在訪談中解釋,基因組語言模型(GLM)正把長上下文、思維鏈和多模態能力帶入生物學,既提升生物能力,也關係防禦能否跟上。他回顧了 Evo/Evo 2 生成可合成病毒基因組的突破,並介紹用 DNA 語言做“思維鏈”的實驗,以及團隊為何主張繼續推進前沿。

Latent Space站內正文🔬生物安全是一場 AI 軍備競賽——專訪 Radical Numerics CEO Eric Nguyen

Concurrence 如何藉助 Unity Gateway 以萬億級 Token 規模治理臨床 AI

Concurrence 在 Databricks 上整合 Lakebase、Unity Catalog 與 Unity Gateway,讓臨床 AI 智慧體在合規與安全約束下規模化執行。其生產環境每 30 天處理約 1008 億輸入 Token 和 1120 萬次 LLM 呼叫,年化約 1.2 萬億輸入 Token,並透過模擬測試、BAA 覆蓋路由和統一 AI 閘道器同時治理開發與生產工作負載。

Databricks Blog站內正文Concurrence 如何藉助 Unity Gateway 以萬億級 Token 規模治理臨床 AI

The Sequence 學習迴圈 第938期:Jev、Gemini 與 Paper2Agent 如何把模型智慧變成可用軟體

本週圍繞三個進展展開:TypeSafe 推出面向結構化決策的模型 Jev,Google 釋出兩個取向不同的 Gemini Live 模型,斯坦福的 Paper2Agent 登上 Nature,展示科研方法如何變成可複用的智慧體工具。核心觀點是:模型周圍的“介面”與模型本身同樣值得投入。

TheSequence站內正文The Sequence 學習迴圈 第938期:Jev、Gemini 與 Paper2Agent 如何把模型智慧變成可用軟體

invideo 如何藉助 GPT‑6 Astra 將調色效率提升 3 倍

OpenAI 案例研究:invideo 使用 GPT‑6 Astra 規劃複雜影片編輯,將調色與校正成功率提升約 3 倍,並在一天內建立 50 個自定義特效。

OpenAI News站內正文invideo 如何藉助 GPT‑6 Astra 將調色效率提升 3 倍

PixVerse R2:可探索、可改變即時的世界模型

PixVerse R2 在 Product Hunt 上線,定位為一款即時世界模型,使用者可以在其中自由探索並即時改變場景內容。目前公開資訊有限,僅包含簡短的產品定位描述。

Product Hunt AI站內正文PixVerse R2:可探索、可改變即時的世界模型

諾基亞開源 AnyJev:無需訓練,把任意開放 LLM 變成校準後的決策模型

諾基亞應用研究團隊開源了 AnyJev,一個無需訓練即可把開放 LLM 變成決策模型的 Python 庫。它讀取模型的下一個 token 機率,回答選擇、是/否和評分三類帶型別問題,並透過迴圈移位與先驗校正壓低位置偏差和標籤偏差。在 Qwen3-8B 與 BANKING77 上,L0 把選項反轉時的翻轉率從 0.230 降到 0.073,L1 把 5% 誤差下可自動決策的流量從 7.7% 提升到 52.0%。專案以 Apache-2.0 許可釋出在 PyPI,支援 Hugging Face 與 vLLM 後端。

MarkTechPost站內正文諾基亞開源 AnyJev:無需訓練,把任意開放 LLM 變成校準後的決策模型

Kyutai 釋出 Voice of Reason:用強化學習解口頭數學題的語音原生模型

Kyutai 釋出了兩款開源權重、語音到語音的 Voice of Reason 模型,基於 GLM-4-Voice-9B,結合監督微調與強化學習,把口語版 GSM8K 的準確率從 27.3% 提升到 77.1%。整個流程不含轉寫步驟,也不插入獨立的文本 LLM,兩個檢查點均可在單張 H100 上執行。

MarkTechPost站內正文Kyutai 釋出 Voice of Reason:用強化學習解口頭數學題的語音原生模型

OpenAI 釋出 GPT-6 Sol 與 Luna:API 價格下調 50% 並公佈基準測試

OpenAI 推出 GPT-6 Sol 與 GPT-6 Luna 兩款低價 API 專用模型,定位低於本月的 GPT-6 Astra。Sol 每百萬 tokens 定價 2/10 美元,Luna 為 0.10/0.50 美元,相當於 GPT-5.6 促銷價的一半。OpenAI 同時公佈多項基準測試,併為長時間執行的智慧體改進提示快取。

MarkTechPost站內正文OpenAI 釋出 GPT-6 Sol 與 Luna:API 價格下調 50% 並公佈基準測試

面向語義意圖共享控制的 capability-aware 仲裁機制

該論文提出一種 capability-aware 共享控制框架:由視覺語言模型(VLM)推斷人類意圖並給出語義意圖置信度,同時由視覺-語言-動作(VLA)策略生成自主動作,並從隨機動作軌跡的離散度與區域性不穩定性線上估計 VLA 能力置信度。透過 sigmoid 對映將貝葉斯濾波後的意圖置信度與 VLA 能力置信度結合,非線性仲裁機器人控制權。12 名參與者實驗顯示該方法任務成功率達 92%,高於手動遙操作(83%)、僅意圖仲裁(44%)和固定等權混合(10%),並提升控制友好度、降低控制權加權分歧。

arXiv Robotics站內正文面向語義意圖共享控制的 capability-aware 仲裁機制

JAMB:用於雙臂操作的聯合動作-運動擴散策略

研究者提出JAMB,一種在共享Transformer中聯合去噪雙臂動作與未來3D點軌跡的擴散策略。透過將多模態表示統一到共享時空座標系,動作與運動假設可在去噪過程中相互修正。在RoboTwin 2.0的16項模擬任務中,JAMB平均成功率達83.4%,比最強基線高23.9個百分點;在三個真實機器人任務上,分別比僅動作策略和輔助幾何預測方法高50.0和21.2個百分點,並對雜亂場景和分佈外背景表現出更強泛化能力。

arXiv Robotics站內正文JAMB:用於雙臂操作的聯合動作-運動擴散策略

基於分離截面本構律的修剪螺旋麵軟臂 Cosserat 建模

本文針對修剪螺旋麵軟臂提出一種分離截面本構律,修正傳統 Cosserat 杆模型在跨截面求和剛度假設下的誤差。該方法分別在各螺旋域的區域性座標系中評估其本構響應並回拉至主幹,結合稀疏融合力學描述域間相對運動帶來的額外柔順性,得到強各向異性的等效截面剛度。模型嵌入幾何精確動態 Cosserat 框架,採用 GVS 離散與肌腱驅動,在 103 組實測構型上取得約 7% 的歸一化位置誤差,單次全臂求解約 0.3 秒(單核 CPU),支援快速規劃、狀態與負載估計以及形態-控制協同設計。

arXiv Robotics站內正文基於分離截面本構律的修剪螺旋麵軟臂 Cosserat 建模

透過深度強化學習實現人類陪伴機器人的自適應互動策略

一篇已被 IEEE Transactions on Systems, Man, and Cybernetics: Systems 接收的論文,提出用深度強化學習讓移動機器人在陪伴行人時動態調整自身跟蹤位置,並融合模型預測路徑積分控制與控制障礙函式來兼顧精準跟隨、避障與安全。室內外真實場景實驗顯示,該方法將任務成功率與跟蹤精度分別至少提升 24% 與 47%,並能在行人速度最高 1.7 m/s 的情況下靈活伴行、提升人的舒適度。

arXiv Robotics站內正文透過深度強化學習實現人類陪伴機器人的自適應互動策略

面向超低場MRI超解析度的不確定性感知三維殘差小波擴散模型

研究提出三維殘差小波擴散模型,透過無損小波重引數化、殘差移位與域隨機化三項設計,在單塊GPU上實現全腦擴散取樣,為0.064T超低場MRI生成逐體素不確定性圖,並在認知障礙試點佇列中保留與疾病相關的萎縮。

arXiv Computer Vision站內正文面向超低場MRI超解析度的不確定性感知三維殘差小波擴散模型

RULER:面向 SVG 生成的例項感知評分規則獎勵

RULER 是一種基於例項感知評分規則的獎勵方法,用於強化學習訓練文本到 SVG 生成模型。它用視覺語言模型對六項評分規則逐項打分,替代遷移性差的 CLIP、Aesthetic 等標量指標,並在 MMSVG-Illustration 與 MMSVG-Icon 上把評分從 0.432/0.395 提升到 0.693/0.683,無需配對 SVG 真值或人類偏好標籤。

arXiv Computer Vision站內正文RULER:面向 SVG 生成的例項感知評分規則獎勵

ImIR:用影像指令微調實現全能影像修復

ImIR 用源自退化影像本身的連續影像指令替代文本提示,為預訓練影像編輯模型提供條件;僅需在單張 GPU 上訓練約三小時的一個介面卡,即可覆蓋六項修復任務,並支援無需退化標籤的任務無關修復。

arXiv Computer Vision站內正文ImIR:用影像指令微調實現全能影像修復

透過動態語義路由校準緩解大語言模型的過度拒絕

安全對齊的大語言模型常出現過度拒絕,錯誤地拒絕良性但涉及安全主題的指令。該論文從Transformer注意力內部的路由衝突切入,發現稀疏的“超敏感安全頭”在Hard-Safe提示上誤觸發,導致高熵路由衝突;作者提出免訓練的語義路由校準(SRC),在推理時抑制這些安全頭,並配合雙分支logits融合,在儘量保留安全效能的同時緩解過度拒絕。論文被EMNLP 2026主會接收,共33頁、13張圖。

arXiv Computational Linguistics站內正文透過動態語義路由校準緩解大語言模型的過度拒絕

線上策略蒸餾中提示廣度與 rollout 重新整理相互影響

一篇新 arXiv 論文聯合研究線上策略蒸餾(OPD)中的提示廣度和響應生成策略重新整理,發現兩者存在 4.07 個百分點的互動效應:在響應凍結時增加提示會降低準確率,而在每次更新重新整理時則會提高準確率;兩種教師模型下的比較還顯示結論會隨推理預算反轉。

arXiv Computational Linguistics站內正文線上策略蒸餾中提示廣度與 rollout 重新整理相互影響

AIBuildAI-2.5:透過 LLM 引導的樹搜尋實現高效的自主 AI 模型開發

該論文提出 AIBuildAI-2.5,一個用 LLM 智慧體執行樹搜尋的自主 AI 模型構建系統。它用“評判器+選擇器”的 LLM 引導樹搜尋替代按已執行獎勵排序的蒙特卡洛式搜尋,並加入資源感知排程器與按任務難度分派的模型路由器,以改善搜尋決策、提升硬體利用率並壓低推理成本。系統在 MLE-Bench 上以 73.3% 的獎牌率排名第一,並在 AIRS-Bench 的六項自主 AI 研究任務上超過強基線。

arXiv Computational Linguistics站內正文AIBuildAI-2.5:透過 LLM 引導的樹搜尋實現高效的自主 AI 模型開發

面向QMSum的高效查詢聚焦會議摘要:基於檢索片段的訓練

QMSum缺少標準評分器,導致查詢聚焦會議摘要結果難以比較。本文在統一實現下對15個系統重新評分或生成,發現一個已公開的406M Fusion-in-Decoder專用模型從受限長輸入切換到2000詞檢索片段時ROUGE-1下降6.30,但在該片段機制上微調後可恢復損失。測試集上該模型得36.33 ROUGE-1,本文1.2B系統為35.41,差值95%區間為[-0.27, +2.22],統計上無法區分;更小系統引數約為三分之一、峰值推理記憶體不到一半。固定的1.2B基礎模型中,片段微調帶來5.29提升,用2000個檢索詞替換前4500個轉錄詞在測試集提升1.55、驗證集提升0.29。在單一簡潔提示和參考重疊評分器下,406M專用模型至少超過五個專有託管模型6.2 ROUGE-1,但輸出長度與缺少人工或事實性評估限制了該排序。結論僅限QMSum與自動指標。

arXiv Computational Linguistics站內正文面向QMSum的高效查詢聚焦會議摘要:基於檢索片段的訓練

在 Rust 中端到端訓練語言模型:一份經驗報告

作者獨自用純 Rust 完成約 0.4B 引數、孟加拉語優先的語言模型端到端預訓練,租用 GPU 花費 164 美元。論文更重要的貢獻是給出 Candle 與 Burn 作為訓練後端的失敗分類,並提出可捕獲六類靜默失敗的梯度流驗證方法;作者結論是 Rust 目前還不足以勝任訓練,但適合端側推理服務。

arXiv Computational Linguistics站內正文在 Rust 中端到端訓練語言模型:一份經驗報告

緩解擴散模型資料點遺忘中的順序重現現象

這篇 arXiv 論文指出,擴散模型的資料點遺忘評測通常只看刪除剛完成的那一刻,忽略了多次刪除請求連續作用於同一模型時的累積效應。作者識別出“順序重現”這一失敗模式:樣本在刪除後一度被判定為已遺忘,卻在後續針對其他目標的刪除操作後重新回到被記憶的狀態,且無需重新使用被刪資料或對抗性微調。為刻畫該現象,論文提出目標級評測協議,並發現會重現的目標在刪除後呈現更尖銳的區域性去噪損失幾何。

arXiv Machine Learning站內正文緩解擴散模型資料點遺忘中的順序重現現象

面向通用持續學習的類腦分層模組化

該論文提出受果蠅學習與記憶系統啟發的分層模組化原則,透過專家特化與整合整合來協調持續學習中的抗干擾與泛化,並將其例項化為預訓練基礎模型的輕量模組化適配。方法在視覺識別、視覺語言理解、自我-他人影片理解及具身VLA學習等線上不確定資料流中持續提升,具身操作任務上相較無回放方法提升超過50個百分點。

arXiv Machine Learning站內正文面向通用持續學習的類腦分層模組化

大語言模型的機率結構:一篇自洽的機率論綜述

arXiv 上新發布的一篇 27 頁綜述性論文《The Probabilistic Structure of Large Language Models》由 Adnan Aboulalaâ 撰寫,試圖用統一的機率論框架描述大語言模型:把模型視為 token 序列上的機率測度,把訓練視為最大似然估計,把生成視為隨機過程的序貫模擬,並借 KL 散度的不對稱性解釋幻覺以及「統計上合理」與「真實」之間的區別。文章還以擴散模型作為同一視角的補充例證。

arXiv Machine Learning站內正文大語言模型的機率結構:一篇自洽的機率論綜述

量子與經典計算的聯邦化:一種隱私保護的混合方法

一篇新論文(arXiv:2609.25082)評估用聯邦學習把混合量子—經典模型與經典參與方結合起來,採用 Sherpa.ai 的盲式縱向聯邦學習(SBVFL)協議,在自建的 SMPP 基準上把準確率從 0.7227 提升到 0.8757,接近非隱私的集中式訓練水平,且所需可訓練引數明顯少於經典神經網路和隨機森林。

arXiv Machine Learning站內正文量子與經典計算的聯邦化:一種隱私保護的混合方法

“作為一個語言模型……”:聊天模板切換大模型自我指涉口吻,啟用引導可復現該效應

一篇被 COLM 2026 與 KONVENS 2026 研討會接收的論文發現,聊天模板像一個開關:它的存在會抬高模型“我只是個AI”式的免責宣告口吻、壓低“我感覺”式的體驗性口吻;在啟用空間中還存在一個可引導該行為的方向向量,暗示模型關於自身的陳述並不只是權重的事實,而部分由部署方式決定。

arXiv Machine Learning站內正文“作為一個語言模型……”:聊天模板切換大模型自我指涉口吻,啟用引導可復現該效應

一致並不等於證據:LLM 裁判共識中的誤差依賴性

一篇新論文指出,LLM 裁判之間的共識常被高估,因為裁判錯誤並不獨立。十名裁判的平均兩兩誤差相關係數為 0.21,約等於 3.5 名獨立裁判;在最多 28% 的比較中,忽略共享誤差會改變顯著性結論。作者建議用可信樣本估計準確率、識別共同錯誤,並據此選擇投票方法。

arXiv AI站內正文一致並不等於證據:LLM 裁判共識中的誤差依賴性

人工審議群體的智慧

一篇 arXiv 論文將人類的三階段審議正規化遷移到來自三個模型家族的大語言模型,並在四個現實風險遞增的領域進行測試。結果顯示,多模型審議能比簡單聚合獨立回答進一步降低集體誤差,審議後的個體判斷也保留了這部分增益;但該優勢依賴模型多樣性,由同一模型克隆組成的群體沒有從審議中獲益。

arXiv AI站內正文人工審議群體的智慧

託管式LLM中的無永續性復現:動作時信念評估中的測量敏感性

該論文研究託管式語言模型行為評估的可變性,區分復現、測量敏感性與永續性三類問題。作者在 Regent Chess 環境中發現,先前的 Gemini 3.1 Flash-Lite 缺陷可在歷史配置下復現,但在相同公共標識下重建評估與推理配置後端點顯著變化;重建配置下 Gemini 3.1 與 3.7 的 4K 比較甚至反轉方向。論文因此主張,對託管模型的行為結論應顯式標註被測標識、服務期、測量工具與推理配置。

arXiv AI站內正文託管式LLM中的無永續性復現:動作時信念評估中的測量敏感性

目標驅動的流程變體分類:用大模型把業務流程行為對齊到組織目標

該論文提出一種“目標驅動”的流程變體分類方法,顛覆了以往先聚類再人工賦予業務含義的做法:先構建組織目標模型以預先確定分類維度,再把每個流程變體轉寫為行為敘事文本,交由大語言模型結合目標模型進行語義判斷並歸類。作者完成了端到端實現,並在三個規模和多樣性差異顯著的公開日誌上驗證,結果顯示目標模型的引導會產生不同於無引導歸納的劃分,且能對目標模型中備選方案的受控修改作出響應,代價是需要額外編寫目標模型。

arXiv AI站內正文目標驅動的流程變體分類:用大模型把業務流程行為對齊到組織目標

從二維影像和細胞群體統計中學習三維生物物理細胞特性

該研究提出一種群體監督框架,可從單張二維紅細胞影像推斷潛在生物物理量,並聚合為平均紅細胞體積、紅細胞分佈寬度和平均紅細胞血紅蛋白量。模型結合共享區域性推理、面向體積與血紅蛋白的生物物理結構化解碼器、可學習例項加權以及裝置特定校準。作者形式化了聚合觀測識別受限例項預測器的條件,並指出群體一致性本身並不能識別單細胞特性或三維幾何。在390份標本、六臺裝置共1,105次採集上,與Sysmex分析儀相比報告了0.86–0.98的Pearson相關係數。

arXiv AI站內正文從二維影像和細胞群體統計中學習三維生物物理細胞特性

PAANI:面向河流機器人模擬的裝置端視覺證據融合與可解釋引導

PAANI 是一種面向河流監測機器人的裝置端感知到引導架構,在 Arduino UNO Q 上結合 YOLO11n 檢測器與 MobileNetV3 Small 語義分割器,透過時間戳對齊的證據融合和顯式走廊策略提供可檢查的引導。模型精度較高,但研究強調模型準確性與在板執行並不等同於已驗證的水上避碰能力。

arXiv AI站內正文PAANI:面向河流機器人模擬的裝置端視覺證據融合與可解釋引導

教科書知識還是臨床病例?資料型別如何塑造醫療大語言模型

一項被 NLPCC 2026 接收的研究透過詞元對齊實驗,系統考察了教科書式教學資料與真實臨床記錄在醫療大語言模型訓練中的不同作用。結果顯示兩類資料存在不對稱遷移:臨床資料能提升面向臨床的任務,同時在知識密集型任務上保持競爭力;教學資料則主要改善知識密集型任務。錯誤分析還揭示了“知—行鴻溝”,即知識記憶的改善未必能穩定轉化為臨床推理能力。

arXiv AI站內正文教科書知識還是臨床病例?資料型別如何塑造醫療大語言模型

Airbnb 擴大對 GPT‑6 Astra 及 OpenAI 前沿模型的訪問許可權

OpenAI 於 2026 年 9 月 23 日宣佈,Airbnb 依據一項新協議,為其工程與產品開發團隊擴大對 OpenAI 前沿模型(含 GPT‑6 Astra)的訪問。該擴充套件建立在 Airbnb 長期使用 Codex 的基礎上,模型可透過 OpenAI API 與 Amazon Bedrock 呼叫;早期實踐顯示 Astra 在排查缺陷、系統設計與非編碼任務上同樣成效顯著。

OpenAI News站內正文Airbnb 擴大對 GPT‑6 Astra 及 OpenAI 前沿模型的訪問許可權

OpenAI 想讓頂尖數學家幫忙,避免再次搞砸

在把一連串耀眼的數學成果變成聲譽危機後,OpenAI 成立了由九名頂尖數學家組成的獨立顧問組 AGMAI,由普林斯頓高等研究院(IAS)承辦,就 AI 公司如何呈現與釋出數學成果提供建議。研究者歡迎這一接觸,但質疑其遴選透明度、代表性以及實際影響力,而小組的首要任務恰是協調 OpenAI 內部模型產出的大量成果的釋出。

The Verge AI站內正文OpenAI 想讓頂尖數學家幫忙,避免再次搞砸

如何引導你的語言流:Apple 的 probe guidance 為擴散語言模型帶來新 SOTA

Apple 研究團隊提出 probe guidance,利用現有擴散模型凍結的內部狀態構建引導訊號,無需在推理時增加額外前向傳播。該方法在連續擴散語言模型的無條件生成上取得新 SOTA,並在 1.7B 模型上提升多項選擇題問答基準,同時為理解 autoguidance 的實際機制提供了新線索。

Apple Machine Learning Research站內正文如何引導你的語言流:Apple 的 probe guidance 為擴散語言模型帶來新 SOTA

如何用 17 美元訓練自己的 Jev 模型

Together AI 釋出實操教程,介紹如何以約 17 美元、約 25 分鐘把 Qwen3.5 4B 微調成類 Jev 的分類模型:輸入 state 與預設問題,返回分數、布林值或多選答案,完成後部署為專用 HTTP 端點。不想自行訓練的開發者也可直接使用託管在無伺服器平臺上的 together/Tev1-4B-experimental。

Together AI Blog站內正文如何用 17 美元訓練自己的 Jev 模型

Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna:新一輪模型價格戰開打

2026年9月22日,Anthropic 釋出 Claude Opus 5.5,約一小時後 OpenAI 釋出 GPT-6 Sol 與 GPT-6 Luna。兩家都把主力模型價格大幅下調,GPT-6 Luna 降至每百萬 token 輸入 0.10 美元、輸出 0.50 美元;Opus 5.5 輸入輸出各降 20%,快取讀取降價 60%。Simon Willison 的初步測試還發現,Opus 5.5 在 max 思考檔位下會因過度推理耗盡 12.8 萬輸出 token 上限而無法給出結果。

Simon Willison's Weblog站內正文Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna:新一輪模型價格戰開打

🔬 一座奧斯卡、兩顆小行星,以及你 sklearn 裡的演算法:John Platt 談 AI for Science

Google 研究員 John Platt 做客 Latent Space 播客,講述 ERA(Empirical Research Assistance)如何用 Gemini/LLM 驅動樹搜尋來自動化可評分的科學任務,並分享用 AI 緩解氣候變化(如航跡雲與 FireSat)、對獎勵駭客與過擬合的警示,以及為什麼在超級智慧 AI 時代深耕領域專長和親自動手仍然重要。

Latent Space站內正文🔬 一座奧斯卡、兩顆小行星,以及你 sklearn 裡的演算法:John Platt 談 AI for Science

Kelam:讓 AI 代理替你打那些不想打的電話

Kelam 是 Product Hunt 上的一款 AI 工具,主打由代理(agent)代替使用者撥打那些本人不願意親自處理的電話,把溝通負擔交給自動化完成。

Product Hunt AI站內正文Kelam:讓 AI 代理替你打那些不想打的電話

GPT-6 提示快取升級:更高命中率與全新診斷工具

OpenAI 於 2026 年 9 月 22 日釋出 GPT-6 的提示快取改進:預設命中率更高,30 分鐘內複用的合規共享字首可享快取摺扣,快取輸入 token 最高可省 90%,並新增快取儀表盤、未命中診斷工具、顯式快取斷點,以及在不破壞快取的前提下調整推理強度、預熱快取等能力,幫助長時間執行的智慧體更快、更省錢。

OpenAI News站內正文GPT-6 提示快取升級:更高命中率與全新診斷工具

Claude Opus 5.5 實測:有哪些新變化,表現到底如何?

Anthropic 釋出 Claude 5.5 家族首個旗艦模型 Opus 5.5,宣稱推理常開、輸出快 30% 以上、單 token 價格降 20%,並稱典型工作負載總成本可降約 40%。本文梳理新特性與官方基準資料,並透過三項實測檢驗其能力,同時指出基準設定不一致、部分任務由舊模型完成等五點需要注意的地方。

Analytics Vidhya站內正文Claude Opus 5.5 實測:有哪些新變化,表現到底如何?

Anthropic 釋出 Claude Opus 5.5:效能對標 Fable 5.1,執行成本較 Opus 5 降低 40%

Anthropic 推出 Claude 5.5 家族的首個模型 Claude Opus 5.5,聲稱在多數工作上達到 Claude Fable 5.1 的水平,典型工作負載下預設設定的執行成本比 Opus 5 低約 40%。該模型僅以託管 API 形式提供,權重未公開,可透過 Claude Platform、AWS、Google Cloud 和 Microsoft Azure 呼叫。

MarkTechPost站內正文Anthropic 釋出 Claude Opus 5.5:效能對標 Fable 5.1,執行成本較 Opus 5 降低 40%

llm 0.36 釋出:新增 GPT-6 Sol 與 GPT-6 Luna,外掛可宣告不支援多輪對話

Simon Willison 釋出命令列 LLM 工具 llm 0.36,新增對 OpenAI GPT-6 Sol(gpt-6-sol)與 GPT-6 Luna(gpt-6-luna)的支援,允許模型外掛宣告僅支援單輪提示,並把 llm logs 的推理軌跡包進可摺疊標籤。

Simon Willison's Weblog站內正文llm 0.36 釋出:新增 GPT-6 Sol 與 GPT-6 Luna,外掛可宣告不支援多輪對話

在 Amazon Bedrock 上使用 GPT-6 Sol 和 GPT-6 Luna 為日常工作帶來更多智慧

OpenAI 的 GPT-6 Sol 與 GPT-6 Luna 現已在 Amazon Bedrock 全面可用。Sol 面向複雜程式設計與運營任務,Luna 面向大批次重複性工作負載;兩者 API 定價均低於前代 GPT-5.6,並執行在 Bedrock 安全、可擴充套件的推理基礎設施上。

AWS Machine Learning Blog站內正文在 Amazon Bedrock 上使用 GPT-6 Sol 和 GPT-6 Luna 為日常工作帶來更多智慧

待翻譯:Introducing GPT-6 Sol and Luna

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Meet GPT-6 Sol and Luna, two models that bring frontier intelligence to everyday work with different balances of capability and cost.

OpenAI News來源內容 · 翻譯待補全待翻譯:Introducing GPT-6 Sol and Luna

Claude Opus 5.5 現已在 AWS 上線

Anthropic 的 Claude Opus 5.5 作為 Claude 5.5 家族的首個模型,現已在 Amazon Bedrock 和 Claude Platform on AWS 上推出。該模型在令牌效率、成本、自適應思考和安全性方面均有改進,面向智慧體程式設計和知識工作。

AWS Machine Learning Blog站內正文Claude Opus 5.5 現已在 AWS 上線

llm-anthropic 0.29 釋出,新增對 Claude Opus 5.5 的支援

Simon Willison 釋出了 llm 命令列工具的 Anthropic 外掛 llm-anthropic 0.29 版,該版本加入了對 Anthropic 最新模型 Claude Opus 5.5 的呼叫支援,使用者可透過簡單的 llm 命令直接向該模型傳送提示。

Simon Willison's Weblog站內正文llm-anthropic 0.29 釋出,新增對 Claude Opus 5.5 的支援

Jev 解析:一個從不生成任何文字的 AI 模型

TypeSafe AI 於 2026 年 9 月 15 日結束兩年隱身期,釋出不會生成文字的模型 Jev。它一次讀取情境、並行輸出帶置信度的固定答案,可處理 Choice、Score、Noul 三類問題。官方資料顯示批次提問更便宜更快,但所有評測均來自 TypeSafe 自身,尚無獨立驗證,And 其“零幻覺”說法也需附加前提。

Analytics Vidhya站內正文Jev 解析:一個從不生成任何文字的 AI 模型

Anthropic 釋出 Claude Opus 5.5,強化網路安全防護

Anthropic 推出 Claude Opus 5.5,這是 CEO 達里奧·阿莫代伊提出“放慢前沿”計劃後釋出的首個模型,重點加強了針對沙箱逃逸等風險行為的防護,並將部分網路安全和生物學請求轉交給能力較弱的模型處理。

The Verge AI站內正文Anthropic 釋出 Claude Opus 5.5,強化網路安全防護
政策

OpenAI 向烏克蘭擴充套件網路訪問,用於民用防禦

OpenAI 宣佈向烏克蘭政府提供 Daybreak 計劃訪問許可權,以支援民用基礎設施的網路防禦,並提到此前在歐洲的類似部署。

OpenAI News站內正文OpenAI 向烏克蘭擴充套件網路訪問,用於民用防禦

特朗普將會晤習近平,國會醞釀禁止人工超級智慧法案——美國政治直播

特朗普將在今日晚些時候會見習近平,人工智慧預計成為三天訪問的核心議題。與此同時,伯尼·桑德斯和格雷格·卡薩爾將提出法案,禁止人工超級智慧並設立聯邦AI監管機構。聯合國秘書長古特雷斯呼籲美中建立類似冷戰時期的AI對話渠道。

The Guardian AI站內正文特朗普將會晤習近平,國會醞釀禁止人工超級智慧法案——美國政治直播

特朗普稱與伯納姆關係好於斯塔默 首次面對面會晤後

美國總統特朗普在紐約聯合國大會期間首次與英國首相安迪·伯納姆面對面會晤,稱兩國關係在伯納姆領導下比斯塔默時期“更好”,並讚揚伯納姆是“天生的商人”,儘管雙方在人工智慧監管、查戈斯群島和伊朗戰爭等問題上存在緊張。

The Guardian AI站內正文特朗普稱與伯納姆關係好於斯塔默 首次面對面會晤後

“26年曆史中最重大的一步之一”:JetBrains 加碼智慧體開發,押注 IDE 依然重要

JetBrains 正式推出 JetBrains Air,將其定位為面向智慧體軟體開發的開放產品體系,覆蓋 IDE 內體驗、團隊協作與企業治理。該體系整合了 Air 桌面環境、Junie CLI、JetBrains Central 和 AI for Teams,同時 CEO Kirill Skrygan 強調 IDE 仍將是審查、驗證與交付程式碼的核心場所。

The New Stack AI站內正文“26年曆史中最重大的一步之一”:JetBrains 加碼智慧體開發,押注 IDE 依然重要
研究

領域適應中的 RAG 與微調:何時該用哪一種

本文從機制層面拆解檢索增強生成(RAG)與微調的區別,指出二者解決的是兩類不同問題,並給出兩個可執行的程式碼示例與一套六點決策框架,說明何時該用 RAG、何時該用微調,以及何時兩者都需要。

Machine Learning Mastery站內正文領域適應中的 RAG 與微調:何時該用哪一種

山姆·奧特曼在聯合國安理會就人工智慧發表講話

OpenAI執行長山姆·奧特曼在聯合國安理會發表講話,闡述AI既可能帶來“新文藝復興”也可能引發“新工業革命”式動盪,警告失去控制與權力集中兩大風險,提出以人為本的三項原則,並呼籲建立國際前沿AI標準、事件報告機制與安全資訊共享渠道。

OpenAI News站內正文山姆·奧特曼在聯合國安理會就人工智慧發表講話

空手道迴旋踢的角動量分析:一項縱向個案研究

一篇 arXiv 機器人學預印本提出兩項基於角動量的指標,並透過為期一年的空手道迴旋踢縱向研究,比較穩定與不穩定踢擊以及專家教練的資料,以探索人體動態旋轉穩定性及其對機器人和外骨骼的啟示。

arXiv Robotics站內正文空手道迴旋踢的角動量分析:一項縱向個案研究

GINIO:用於神經慣性里程計的幾何 SO(3) 等變介面

GINIO 是一個面向神經慣性里程計的 SO(3) 等變介面,確保學習到的運動測量在任意 IMU 安裝旋轉下按向量與二階張量規律變換。它透過 Last-Frame Alignment 實現感測器座標系訓練,並分離 IMU 偏置等區域性狀態,在 TLIO、NanoBench 和 Fetch 上取得顯著 ATE 改善,包括無需重訓練的物理重安裝魯棒性。

arXiv Robotics站內正文GINIO:用於神經慣性里程計的幾何 SO(3) 等變介面

超越平坦海底:一種閉式雙檢視約束助力側掃聲吶重建

該論文放棄長期沿用的"平坦海底"近似,改用多檢視幾何方法,形式化並證明了一個雙檢視約束:同一共享特徵必須落在球面與平面交線上的一段軌跡內。作者透過蒙特卡洛模擬刻畫了該歧義軌跡的長度規律,並給出面向水面船隻與水下潛航器的測量規劃建議。

arXiv Robotics站內正文超越平坦海底:一種閉式雙檢視約束助力側掃聲吶重建

方向全變差正則化隱式神經表示(DTV-INR):面向退化成像域的連續超解析度

這篇 arXiv 論文提出 DTV-INR,將座標驅動的隱式神經表示(SIREN)與基於結構張量的各向異性全變差正則項結合,把連續到離散的採集過程建模為不適定逆問題。作者在 H^1(Ω) 中證明了變分解的適定性,並用交替投影最佳化演算法解耦網路引數與自適應張量場更新。在臨床腦部 MRI 與生物醫學透射電鏡資料上,方法在連續非整數上取樣下取得最高 +5.05 dB 的 PSNR 提升,並展現對噪聲的良好魯棒性。

arXiv Computer Vision站內正文方向全變差正則化隱式神經表示(DTV-INR):面向退化成像域的連續超解析度

基於CNN遷移學習與可解釋影像統計的鞋外底印痕性別估計

該研究利用公開鞋外底印痕資料集,比較CNN遷移學習與傳統特徵分類在二分類性別推斷中的表現。採用按鞋劃分的訓練/測試集以減少重複掃描導致的資料洩漏;微調CNN整體表現最佳,並優於僅用手工特徵的傳統分類器,凍結核特徵方法則計算成本更低。探索性分析顯示低維CNN表示與頻率閾值比、影像對比度及小波統計量相關,但實際應用前仍需獨立樣本和案件型印痕驗證。

arXiv Computer Vision站內正文基於CNN遷移學習與可解釋影像統計的鞋外底印痕性別估計

MirrorDistill:面向高效低光恢復的照明感知潛在蒸餾

MirrorDistill 是一種用於低光影像增強的照明感知潛在蒸餾框架。它在訓練階段透過特徵映象連線低光域與乾淨域,在推理階段僅保留輕量級學生編碼器-解碼器。該方法在 LOL-v2-Real 上取得優於當前最佳方法的結果,同時計算複雜度(GMACs)最低,並在 LOL-v1 與 LOL-v2-Synthetic 上保持競爭力。

arXiv Computer Vision站內正文MirrorDistill:面向高效低光恢復的照明感知潛在蒸餾

面向3D場景互動理解的幾何與語義耦合方法

arXiv 上新發布的論文提出 Segment-Snap 框架,透過部件與把手的物理關聯,把可動部件分割、運動約束與可操作區域預測耦合起來。在 Articulate3D 驗證集上,把手引導使運動門控 AP 從 13.74% 提升到 40.98%,完整上下文下把手 AP 達到 30.99%。

arXiv Computer Vision站內正文面向3D場景互動理解的幾何與語義耦合方法

你看夠了:面向機器的質量約束影像編碼

arXiv 新論文提出一種質量約束的影像編碼方案:在保證人類觀察質量達到預設可接受水平後,把剩餘位元速率用於提升機器視覺任務表現。作者將聯合壓縮—分割訓練重構為約束最佳化問題,並設計絕對函式與雙線性函式兩種懲罰項;實驗顯示,在相同任務效能下,相比無約束聯合率—失真—任務最佳化和簡單率—失真基線,BD-rate 分別降低 22.82% 和 29.81%,且未增加複雜度。

arXiv Computer Vision站內正文你看夠了:面向機器的質量約束影像編碼

SPARC:面向自監督密集預測的超畫素感知區域對比學習

arXiv 新論文提出 SPARC,一種利用超畫素在增強影像檢視之間建立區域對應關係的區域級對比學習框架。它在影像級目標之外聯合最佳化區域級對比目標,在語義分割上最高提升 9.79 mIoU,在目標檢測上最高提升 4.88 AP,優於 MoCo-v2 和 DenseCL。

arXiv Computer Vision站內正文SPARC:面向自監督密集預測的超畫素感知區域對比學習

從語調到軌跡:連續情感與貨幣政策溝通的形態

這項研究把歐洲央行和美聯儲的新聞釋出會視為有結構的敘事,而非單純的資訊釋出。作者沿貨幣政策立場、經濟前景和不確定性三個維度為每場釋出會構建“情感弧線”,用以檢驗情感在整篇宣告中的走向與強調方式是否攜帶政策訊號。結果表明,弧線形態在預測政策利率變動方面穩健優於基於詞典的平均語調基準;弧線特徵還會影響專業預測者對通脹預期的修正幅度以及彼此之間的分歧程度,說明存在獨立於直接政策訊號的“接收方效應”。作者據此認為,溝通設計——政策語言在宣告中的排序與強調——是政策訊號的一階特徵,而非二階修飾。

arXiv Computational Linguistics站內正文從語調到軌跡:連續情感與貨幣政策溝通的形態

測量梵語文學語義變化的計算方法

一篇新論文探討歷時詞嵌入能否從現代高資源語言遷移到古梵語。作者構建了覆蓋四個經典時期的270萬詞元語料,用神經位元組級連聲拆分器和詞形還原器恢復詞邊界,並按時期訓練嵌入。在21項可測試的語義變遷中,19項方向與文獻學考證一致(符號檢驗 p=0.00011)。

arXiv Computational Linguistics站內正文測量梵語文學語義變化的計算方法

99% 的準確率究竟衡量了什麼?對廣泛使用的假新聞語料庫中捷徑學習的可復現審計

一篇新論文以 TF-IDF 加線性分類器為測量工具,對 ISOT/Kaggle「Fake and Real News」語料庫做可復現審計,發現其超過 0.98 的準確率與 F1 主要來自後設資料、來源標籤和重複文件等捷徑,而非對新聞真實性的判別能力;在主題不重疊的設定下效能大幅下降,遷移到獨立基準 LIAR 後更是接近隨機水平。

arXiv Computational Linguistics站內正文99% 的準確率究竟衡量了什麼?對廣泛使用的假新聞語料庫中捷徑學習的可復現審計

透過增廣拉格朗日學習資料驅動系統的神經反饋線性化

研究者提出一種資料驅動框架,將相對階條件顯式融入學習過程,從而訓練反饋線性化控制器。該方法用神經李導數替代傳統反饋控制器元件,實現完全資料驅動的反饋線性化,並給出在辨識誤差有界時跟蹤誤差有界的充分條件,最後在電樞控制直流電機上驗證。

arXiv Machine Learning站內正文透過增廣拉格朗日學習資料驅動系統的神經反饋線性化

用於最大獨立集的雙GNN多級粗化

arXiv 預印本(2026年9月21日提交)由 Tianfeng Chen 和 Xianyue Li 撰寫,頁面標題為《用於最大獨立集的雙GNN多級粗化》,但摘要介紹的是面向歐幾里得旅行商問題的圖邊稀疏化(GES)方法。該方法利用幾何結構與組合最佳化技術為不同例項自適應生成稀疏圖,在 MATILDA 資料集上最多可剪除 95% 的邊,並在部分大規模 TSPLIB 例項上剪除率超過 99%,同時最優性差距保持在 1% 以內。

arXiv Machine Learning站內正文用於最大獨立集的雙GNN多級粗化

Sheaf SyncMap:用層正則化實現穩定的無監督持續分塊

該論文提出層正則化(sheaf regularization)來抑制 Decentralized SyncMap 這一自組織系統中的區域性不一致,從而穩定無監督持續分塊過程。實驗顯示,該在多數機率性 CGCP 圖上取得最高歸一化互資訊(NMI),並在輸入分佈發生偏移後仍能保持較高表現,同時避免神經網路等系統常見的負遷移。

arXiv Machine Learning站內正文Sheaf SyncMap:用層正則化實現穩定的無監督持續分塊

熵既能流動,也能引導:LEDFlow 將熵引導的生成順序引入均勻離散流

一篇新的 arXiv 論文指出,均勻離散流雖然允許在每個生成位置反覆更新,但持續的修正也會讓原本正確的中間預測被後續錯誤覆蓋——在數獨實驗中,9.4% 的生成格子在中途正確、最終卻錯誤。作者提出 LEDFlow:一種無需訓練的取樣器,透過"選擇性吸收"把生成順序引入均勻離散流,並按區域性熵自適應決定吸收順序,從而避免固化錯誤預測。該方法在數獨求解上達到 0.845 的 Nikoli 準確率,在文生圖和六項多模態理解基準上均取得提升,推理成本與標準流取樣相當。

arXiv Machine Learning站內正文熵既能流動,也能引導:LEDFlow 將熵引導的生成順序引入均勻離散流

IntLawNER:國際法領域的命名實體識別資料集與基準

研究人員釋出 IntLawNER,一個面向國際法成文文本的命名實體識別資料集與評測基準,涵蓋國際法院、聯合國安理會和歐洲人權法院的 2,987 條金標句子與 8,094 個實體跨度。論文還揭示領域專用 NER 中銀標到金標的質量評估陷阱,並給出多種模型的基準表現。

arXiv AI站內正文IntLawNER:國際法領域的命名實體識別資料集與基準

社會影響與AI群體中科學注意力的分配

arXiv新論文將“音樂實驗室”式的社會影響實驗搬到學術注意力市場:1,000個AI智慧體從《美國經濟評論》2025年全部114篇正式論文中挑選成果。能看見同社群先前選擇的智慧體每人少選17.2%的論文、選擇更集中,集體僅覆蓋73篇,而獨立選擇組覆蓋90篇;隨機給論文注入5次初始選擇,可使其後續被選率提高45.55個百分點。

arXiv AI站內正文社會影響與AI群體中科學注意力的分配

低成本AI智慧手杖:面向視障人士的多模態出行輔助方案

一篇新論文提出售價約88美元、完全離線執行的AI智慧手杖,在Raspberry Pi Zero 2W上融合RGB視覺與ToF測距,透過距離相關的振動觸覺反饋與語音提示協助視障人士避障。室內測試宏平均F1為0.82,端到端平均延遲約330毫秒,峰值功耗2.8瓦,12人初步可用性研究給出SUS 78.5的正面評價。

arXiv AI站內正文低成本AI智慧手杖:面向視障人士的多模態出行輔助方案

波伊特拉斯中心將資助50名專注精神疾病研究的青年科學家開啟早期職業生涯

麻省理工學院長期支持者帕特里夏和詹姆斯·波伊特拉斯捐贈1000萬美元,透過波伊特拉斯精神疾病研究中心設立50個兩年期獎學金,未來十年每年資助5名研究生和博士後研究嚴重精神疾病,並使其對MIT心理健康研究的累計支援超過1億美元。

MIT News AI站內正文波伊特拉斯中心將資助50名專注精神疾病研究的青年科學家開啟早期職業生涯

待翻譯:The Reliability Layer for Healthcare AI: Common LangSmith Use Cases

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:See how LangSmith helps healthcare AI teams turn clinical review into reusable evaluators, datasets, and release gates for safer AI in production.

LangChain Blog來源內容 · 翻譯待補全待翻譯:The Reliability Layer for Healthcare AI: Common LangSmith Use Cases

Andreessen Horowitz 將推出“學院”:無作業,並與 Palantir、Google 和 Meta 等合作

風投公司 Andreessen Horowitz(a16z)正在籌建“Horowitz Andreessen Academy”,將其定位為年輕人創辦或加入矽谷初創公司的輸送管道。該專案由 a16z 領投 4200 萬美元,首批合作伙伴包括 Anduril、Anthropic、Coinbase、Google、Meta、NVIDIA、OpenAI、Palantir、Replit 和 Stripe,計劃於 2027 年秋季啟動首個免費一年制專案,僅招收 50 名學生,主要面向應屆高中畢業生。學院不授予學位或認證,學生將參加由 Sam Altman 等科技人物主講的短期課程,並在科技公司進行 co-op 實踐;校方承諾不設傳統成績、考試或作業,同時提供超過 5 萬美元算力額度和 5000 美元差旅研究預算。學生需搬到舊金山並自行解決住房。

The Verge AI站內正文Andreessen Horowitz 將推出“學院”:無作業,並與 Palantir、Google 和 Meta 等合作
AI 日報 2026-09-23 | AI News Hub