OpenAI 釋出 MentalHealthBench:面向心理健康對話的開放基準
- 由 80 多位來自 22 個國家、使用 19 種語言的持證心理健康專家共同打造。
- 覆蓋非急性、高急性與緊急場景,以及成人、13–17 歲青少年、照護者和臨床醫生四類使用者畫像。
日報
2026-09-23 精選 10 條,按主題聚合。
以 UTC+8 劃分日期。優先顯示已有至少 5 篇處理完成的新聞的日期;當天內容不足時可能顯示較早一期,無固定出刊時間。
預計速讀 5 分鐘
已閱讀至本期精選末尾。
我的稍後讀電腦科學家、企業家兼慈善家 David Siegel 將在 2026-27 學年擔任 MIT 創新研究員,與 MIT Schwarzman 計算學院合作,研究人工智慧如何加速科學發現。
在 Made on YouTube 活動上,YouTube 宣佈升級其 AI 創作者工具,新增可在後臺最佳化頻道的 AI 代理,能生成縮圖、標題並整理品牌提案。平臺還推出動態縮圖和最多三個影片版本測試。YouTube 未提供資料證明工具能提升指標,只強調可節省創作者時間。
IntellAgents.io 在 Product Hunt 上以一句話定位亮相:為每一通電話、每一次聊天和每一條私信配備一個 AI 智慧體。該頁面目前披露的資訊非常有限,僅給出這一定位口號與討論入口。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Ask most engineers what MCP is and you’ll get the same answer: a way to plug tools into an LLM. Fair enough, as far as it goes. But that description treats MCP like plumbing, and after months building MCP-based integrations for large enterprise platforms, I don’t think plumbing is the right metaphor. Plumbing moves water […]
LaterOn v2 是 Product Hunt 上出現的一款代理式電子郵件平臺,主打只需描述一次郵件任務,就能讓系統自動把工作完成。
SpeakON 釋出了一款 25 克的 MagSafe AI 語音按鈕,內建獨立麥克風、電池和儲存,可作為 iOS 鍵盤擴充套件把處理後的文本直接寫入任意輸入框;支援離線緩衝,並提供智慧潤色、列表、風格、翻譯、詞典、語音編輯和筆記等功能。裝置在美國以 129 美元一次性買斷出售,含 Pro Lifetime,SpeakON Agent 將於 2026 年 10 月推出。
SpeakON 推出一枚重 25 克的 MagSafe 磁吸語音按鍵,自帶麥克風和電池,透過 iOS 鍵盤擴充套件把經過潤色的文字直接寫入任意應用的輸入框。它支援鎖屏與離線使用,內建 Smart Polish、Smart List、Style、Translation 等文本處理功能,美國一次性售價 129 美元,含 Pro 終身授權,無訂閱費。
Simon Willison 與 Jesse Vincent 將於 10 月 14 日(週三)晚在舊金山舉辦一場面向編碼智慧體(coding agents)構建者的非正式交流活動,形式接近「智慧體版作品展示會」,鼓勵分享尚未公開的奇怪實驗、未完成專案與早期探索,而非產品推銷。
Kaiku 是一款面向 AI 代理的任務追蹤工具,其 Product Hunt 標語稱它是“你的 AI 代理已經知道如何使用”的任務追蹤器。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Learn how we optimized performance and efficiency serving the workload that is changing software engineering forever — and you can too.
Rabbit 釋出獨立 AI 代理,無需其 R1 硬體即可使用。基於雲端的 OS3“代理式作業系統”可跨 Windows、Mac 和 Linux 在本地執行任務,每個賬戶最多繫結五臺裝置與偏好的 AI 模型,並可透過桌面網站、Telegram/iMessage 以及 R1 訪問。Rabbit 已停止生產 R1,轉而籌備執行 OS3 的“cyberdeck”。公司稱 OS3 不會儲存、複製、使用或出售使用者資料,但聊天記錄與記憶仍留在其伺服器,第三方 AI 提供商按其自身隱私政策處理資料。
Jev State 是在 Product Hunt 上亮相的一款工具,主打把與 AI 的對話內容轉化為測試用例,並進一步生成可執行的程式碼。目前官方只給出了一句功能描述,具體工作流、支援的框架與生成程式碼的可用性尚未公開。
TikTok 創作者 @therealcornpop 指出,用 AI 撰寫短影片指令碼的破綻不在表面的「AI 腔調」,而在於內容空洞、缺乏個人聲音與真實觀點。Simon Willison 於 2026 年 9 月 22 日在其部落格上收集併發布了這段引用。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Skills let you encode domain-specific procedures as reusable, portable instructions for agents, but a fluent answer doesn't prove the agent picked the right skill or followed it. Learn how to measure skill selection and instruction following with Strands Evals and Amazon Bedrock AgentCore Evaluations.
Databricks 系統表可近即時地按產品、SQL 倉庫和標籤拆解成本。本文介紹五個 SQL 查詢:每日產品支出、倉庫成本趨勢、基於標籤的成本歸因、14 天異常檢測,以及 AI 驅動的支出預測,並說明注意事項和儀表板落地方式。
Databricks 宣佈 Genie One MCP 伺服器正式全面可用。它讓任意 AI 智慧體透過統一介面,從 Genie One 獲取結構化與非結構化資料、洞察和答案,並以 Genie Ontology 的受治理業務上下文為基礎。該 MCP 現已作為 Unity Gateway 中的託管 MCP 服務提供,支援集中治理、細粒度策略和審計日誌。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Change management has long covered two familiar kinds of change: the rollout of new tools and technologies, and broader human-led transformations such as leadership changes and restructuring. But that distinction starts…
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:The frontier isn’t a model. It’s a router. Join us for our inaugural conference, Forge 2026 Blog The Frontier Isnt A Model Its A Router The frontier isn’t a model. It’s a router. PUBLISHED 9/21/2026 Table of Contents Ho…
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:The following article originally appeared on Venkatesh Rao’s Substack, Contraptions, and is being republished here with the author’s permission. The sole athletic achievement of my life came in 1993: winning the IIT Bombay freshman 50m freestyle race with a time of 41s. That got me into the college swim team (it was a bad recruitment […]
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:← Blog Pinecone BYOC: Trusted AI Knowledge in the Customer Cloud Jeff Zhu, Joerg Schad Sep 23, 2026 Product Share: Today, we are announcing the general availability of Pinecone Bring Your Own Cloud (BYOC) on AWS, Google…
一位多語種學者在從利物浦開往倫敦的火車上發現,車廂裡半數乘客正與ChatGPT、Claude、Gemini等聊天機器人深談。她承認AI為多語種研究者拉平了競爭環境,但堅持自己仍要思考、判斷,並形成那些固執地屬於自己的想法——與AI的關係往往誘人,偶爾令人沮喪,而且始終需要保持警惕。
Aks.ai 在 Product Hunt 上以“引導式自我反思的個人伴侶”為定位亮相,目前頁面資訊精簡,細節仍待官方補充。
Anthropic 推出 Opus 5.5,強調其強大的效能表現,但定價依然偏高。在與競爭對手的價格戰中,這家 AI 實驗室仍處於落後位置。
Subscrr 幫助使用者制定財務計劃,並找出應取消的訂閱服務。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Patreon co-founder Sam Yam is joing OpenAI to lead Creator Product. | Image: The Verge OpenAI has hired three former Patreon execs to anchor its product strategy for creators. After starting the creator subscription platform 13 years ago, co-founder and technology chief Sam Yam announced on X that he's joining OpenAI to lead Creator Product. He's also bringing Patreon's former product head Drew Rowny and engineering head Shannon Ma with him on the new venture, both of whom stepped down in the past few weeks. "We're going to build together with Creators at OpenAI and share early access to a new set of tools that I think will be critically valuable to Creators and their communities," Yam said in his announcement. "Pay attention … Read the full story at The Verge.
Lisen 是在 Product Hunt 上釋出的一款工具,主打免費朗讀功能,語音由 Cartesia 提供。目前公開資訊較少,頁面僅包含產品名稱、簡短介紹以及討論與連結入口。
英國首相安迪·伯納姆宣佈,安全部門將成立國家資訊防禦中心,以應對外國敵對勢力藉助AI傳播的虛假資訊與深度偽造內容,並整合情報機構、執法部門與社交媒體公司,對外國勢力的資訊攻擊進行偵測、歸因與阻斷。
OpenAI 將 ChatGPT 廣告陸續推向印度尼西亞、馬來西亞、菲律賓、新加坡、泰國、越南和臺灣,使該廣告產品覆蓋 60 多個國家。廣告僅向 Free 和 Go 套餐使用者展示,Plus、Pro 和 Enterprise 訂閱繼續保持無廣告。
衛報評論文章從 AI 研究員 Jacob Coxon 從 Anthropic 辭職一事切入,引出業內對“AI 可能在本十年內滅絕人類”的公開擔憂,並梳理了從新型生物武器到社會全面崩潰等五種最被討論的末日情景。
Bracket 在 Product Hunt 上亮相,定位為“企業的記憶層”,旨在為業務提供統一的資訊記憶與呼叫能力。目前公開資訊有限,官方僅給出這一句產品定位。
AgreeGuard 是一款在 Product Hunt 上亮相的 AI 工具,可在你點選“我同意”前閱讀細則,幫助使用者瞭解條款與隱私政策。
Product Hunt 上的 Ari Helper 7 是一款注重隱私的 AI 助手,現已加入照片工作室和影片工作室功能。
Speechka 是一款即時語音翻譯工具,主打讓翻譯後的語音聽起來仍像說話者本人。它在 Product Hunt 上釋出,並提供討論與連結入口。
特朗普在聯合國大會演講中宣稱,美國現在“正式”把人工智慧(AI)改稱為“超級智慧”,理由是他認為“人工”一詞讓智慧顯得虛假。此番表態與他對伊朗、“全球主義者”和跨性別者的抨擊出現在同一場講話中,目前並無證據顯示存在相應的官方更名程式。
NVIDIA 驗證工程師 Sakeena Fiza 講述團隊如何在產品釋出前對資料中心繫統進行壓力測試,從首次通電到機架級部署,力求在客戶發現問題之前先發現並解決故障。
HOTICE 是一個面向雜亂環境的全身人形機器人物體運輸學習框架。它提出 Humanoid-Object Decoupled Potential Fields,將機器人本體與搬運物體的避障引導聯合編碼;並設計上下身解耦的雙智慧體強化學習架構,透過共享狀態觀測與獎勵維持全身協調。訓練上採用專家到通用蒸餾,把多個特權教師策略壓縮為單一可部署學生策略。研究在 MuJoCo 模擬和真實 Unitree G1 人形機器人上驗證,顯示其能運輸不同形狀物體、泛化到未見雜亂場景,並取得較強的 sim2real 表現。
研究者提出 PROACT 框架,把對人類協作行為的預測融入柔順全身控制,使機器人在與人共同搬運重物時既能高效移動物體,又能順應使用者的施力。在 108 次真實世界試驗中,該方法顯著降低了互動做功與任務完成時間。
一篇新的 arXiv 論文提出用強化學習自動生成機器人助手的多模態互動策略,基於人類資料訓練的模擬器和簡單高層獎勵函式。真實場景人類研究顯示可用性高、任務完成有效,為手工設計互動管理器提供可擴充套件且可解釋的替代方案。
Radical Numerics 聯合創始人兼 CEO Eric Nguyen 在訪談中解釋,基因組語言模型(GLM)正把長上下文、思維鏈和多模態能力帶入生物學,既提升生物能力,也關係防禦能否跟上。他回顧了 Evo/Evo 2 生成可合成病毒基因組的突破,並介紹用 DNA 語言做“思維鏈”的實驗,以及團隊為何主張繼續推進前沿。
Concurrence 在 Databricks 上整合 Lakebase、Unity Catalog 與 Unity Gateway,讓臨床 AI 智慧體在合規與安全約束下規模化執行。其生產環境每 30 天處理約 1008 億輸入 Token 和 1120 萬次 LLM 呼叫,年化約 1.2 萬億輸入 Token,並透過模擬測試、BAA 覆蓋路由和統一 AI 閘道器同時治理開發與生產工作負載。
本週圍繞三個進展展開:TypeSafe 推出面向結構化決策的模型 Jev,Google 釋出兩個取向不同的 Gemini Live 模型,斯坦福的 Paper2Agent 登上 Nature,展示科研方法如何變成可複用的智慧體工具。核心觀點是:模型周圍的“介面”與模型本身同樣值得投入。
Harvey 正在使用 GPT-6 Astra 將更多法律上下文引入起草流程,提升文件格式與上下文感知能力,讓律師能更專注於策略。
OpenAI 案例研究:invideo 使用 GPT‑6 Astra 規劃複雜影片編輯,將調色與校正成功率提升約 3 倍,並在一天內建立 50 個自定義特效。
PixVerse R2 在 Product Hunt 上線,定位為一款即時世界模型,使用者可以在其中自由探索並即時改變場景內容。目前公開資訊有限,僅包含簡短的產品定位描述。
諾基亞應用研究團隊開源了 AnyJev,一個無需訓練即可把開放 LLM 變成決策模型的 Python 庫。它讀取模型的下一個 token 機率,回答選擇、是/否和評分三類帶型別問題,並透過迴圈移位與先驗校正壓低位置偏差和標籤偏差。在 Qwen3-8B 與 BANKING77 上,L0 把選項反轉時的翻轉率從 0.230 降到 0.073,L1 把 5% 誤差下可自動決策的流量從 7.7% 提升到 52.0%。專案以 Apache-2.0 許可釋出在 PyPI,支援 Hugging Face 與 vLLM 後端。
Kyutai 釋出了兩款開源權重、語音到語音的 Voice of Reason 模型,基於 GLM-4-Voice-9B,結合監督微調與強化學習,把口語版 GSM8K 的準確率從 27.3% 提升到 77.1%。整個流程不含轉寫步驟,也不插入獨立的文本 LLM,兩個檢查點均可在單張 H100 上執行。
OpenAI 推出 GPT-6 Sol 與 GPT-6 Luna 兩款低價 API 專用模型,定位低於本月的 GPT-6 Astra。Sol 每百萬 tokens 定價 2/10 美元,Luna 為 0.10/0.50 美元,相當於 GPT-5.6 促銷價的一半。OpenAI 同時公佈多項基準測試,併為長時間執行的智慧體改進提示快取。
該論文提出一種 capability-aware 共享控制框架:由視覺語言模型(VLM)推斷人類意圖並給出語義意圖置信度,同時由視覺-語言-動作(VLA)策略生成自主動作,並從隨機動作軌跡的離散度與區域性不穩定性線上估計 VLA 能力置信度。透過 sigmoid 對映將貝葉斯濾波後的意圖置信度與 VLA 能力置信度結合,非線性仲裁機器人控制權。12 名參與者實驗顯示該方法任務成功率達 92%,高於手動遙操作(83%)、僅意圖仲裁(44%)和固定等權混合(10%),並提升控制友好度、降低控制權加權分歧。
研究者提出JAMB,一種在共享Transformer中聯合去噪雙臂動作與未來3D點軌跡的擴散策略。透過將多模態表示統一到共享時空座標系,動作與運動假設可在去噪過程中相互修正。在RoboTwin 2.0的16項模擬任務中,JAMB平均成功率達83.4%,比最強基線高23.9個百分點;在三個真實機器人任務上,分別比僅動作策略和輔助幾何預測方法高50.0和21.2個百分點,並對雜亂場景和分佈外背景表現出更強泛化能力。
本文針對修剪螺旋麵軟臂提出一種分離截面本構律,修正傳統 Cosserat 杆模型在跨截面求和剛度假設下的誤差。該方法分別在各螺旋域的區域性座標系中評估其本構響應並回拉至主幹,結合稀疏融合力學描述域間相對運動帶來的額外柔順性,得到強各向異性的等效截面剛度。模型嵌入幾何精確動態 Cosserat 框架,採用 GVS 離散與肌腱驅動,在 103 組實測構型上取得約 7% 的歸一化位置誤差,單次全臂求解約 0.3 秒(單核 CPU),支援快速規劃、狀態與負載估計以及形態-控制協同設計。
一篇已被 IEEE Transactions on Systems, Man, and Cybernetics: Systems 接收的論文,提出用深度強化學習讓移動機器人在陪伴行人時動態調整自身跟蹤位置,並融合模型預測路徑積分控制與控制障礙函式來兼顧精準跟隨、避障與安全。室內外真實場景實驗顯示,該方法將任務成功率與跟蹤精度分別至少提升 24% 與 47%,並能在行人速度最高 1.7 m/s 的情況下靈活伴行、提升人的舒適度。
研究提出三維殘差小波擴散模型,透過無損小波重引數化、殘差移位與域隨機化三項設計,在單塊GPU上實現全腦擴散取樣,為0.064T超低場MRI生成逐體素不確定性圖,並在認知障礙試點佇列中保留與疾病相關的萎縮。
RULER 是一種基於例項感知評分規則的獎勵方法,用於強化學習訓練文本到 SVG 生成模型。它用視覺語言模型對六項評分規則逐項打分,替代遷移性差的 CLIP、Aesthetic 等標量指標,並在 MMSVG-Illustration 與 MMSVG-Icon 上把評分從 0.432/0.395 提升到 0.693/0.683,無需配對 SVG 真值或人類偏好標籤。
ImIR 用源自退化影像本身的連續影像指令替代文本提示,為預訓練影像編輯模型提供條件;僅需在單張 GPU 上訓練約三小時的一個介面卡,即可覆蓋六項修復任務,並支援無需退化標籤的任務無關修復。
安全對齊的大語言模型常出現過度拒絕,錯誤地拒絕良性但涉及安全主題的指令。該論文從Transformer注意力內部的路由衝突切入,發現稀疏的“超敏感安全頭”在Hard-Safe提示上誤觸發,導致高熵路由衝突;作者提出免訓練的語義路由校準(SRC),在推理時抑制這些安全頭,並配合雙分支logits融合,在儘量保留安全效能的同時緩解過度拒絕。論文被EMNLP 2026主會接收,共33頁、13張圖。
一篇新 arXiv 論文聯合研究線上策略蒸餾(OPD)中的提示廣度和響應生成策略重新整理,發現兩者存在 4.07 個百分點的互動效應:在響應凍結時增加提示會降低準確率,而在每次更新重新整理時則會提高準確率;兩種教師模型下的比較還顯示結論會隨推理預算反轉。
該論文提出 AIBuildAI-2.5,一個用 LLM 智慧體執行樹搜尋的自主 AI 模型構建系統。它用“評判器+選擇器”的 LLM 引導樹搜尋替代按已執行獎勵排序的蒙特卡洛式搜尋,並加入資源感知排程器與按任務難度分派的模型路由器,以改善搜尋決策、提升硬體利用率並壓低推理成本。系統在 MLE-Bench 上以 73.3% 的獎牌率排名第一,並在 AIRS-Bench 的六項自主 AI 研究任務上超過強基線。
QMSum缺少標準評分器,導致查詢聚焦會議摘要結果難以比較。本文在統一實現下對15個系統重新評分或生成,發現一個已公開的406M Fusion-in-Decoder專用模型從受限長輸入切換到2000詞檢索片段時ROUGE-1下降6.30,但在該片段機制上微調後可恢復損失。測試集上該模型得36.33 ROUGE-1,本文1.2B系統為35.41,差值95%區間為[-0.27, +2.22],統計上無法區分;更小系統引數約為三分之一、峰值推理記憶體不到一半。固定的1.2B基礎模型中,片段微調帶來5.29提升,用2000個檢索詞替換前4500個轉錄詞在測試集提升1.55、驗證集提升0.29。在單一簡潔提示和參考重疊評分器下,406M專用模型至少超過五個專有託管模型6.2 ROUGE-1,但輸出長度與缺少人工或事實性評估限制了該排序。結論僅限QMSum與自動指標。
作者獨自用純 Rust 完成約 0.4B 引數、孟加拉語優先的語言模型端到端預訓練,租用 GPU 花費 164 美元。論文更重要的貢獻是給出 Candle 與 Burn 作為訓練後端的失敗分類,並提出可捕獲六類靜默失敗的梯度流驗證方法;作者結論是 Rust 目前還不足以勝任訓練,但適合端側推理服務。
這篇 arXiv 論文指出,擴散模型的資料點遺忘評測通常只看刪除剛完成的那一刻,忽略了多次刪除請求連續作用於同一模型時的累積效應。作者識別出“順序重現”這一失敗模式:樣本在刪除後一度被判定為已遺忘,卻在後續針對其他目標的刪除操作後重新回到被記憶的狀態,且無需重新使用被刪資料或對抗性微調。為刻畫該現象,論文提出目標級評測協議,並發現會重現的目標在刪除後呈現更尖銳的區域性去噪損失幾何。
該論文提出受果蠅學習與記憶系統啟發的分層模組化原則,透過專家特化與整合整合來協調持續學習中的抗干擾與泛化,並將其例項化為預訓練基礎模型的輕量模組化適配。方法在視覺識別、視覺語言理解、自我-他人影片理解及具身VLA學習等線上不確定資料流中持續提升,具身操作任務上相較無回放方法提升超過50個百分點。
arXiv 上新發布的一篇 27 頁綜述性論文《The Probabilistic Structure of Large Language Models》由 Adnan Aboulalaâ 撰寫,試圖用統一的機率論框架描述大語言模型:把模型視為 token 序列上的機率測度,把訓練視為最大似然估計,把生成視為隨機過程的序貫模擬,並借 KL 散度的不對稱性解釋幻覺以及「統計上合理」與「真實」之間的區別。文章還以擴散模型作為同一視角的補充例證。
一篇新論文(arXiv:2609.25082)評估用聯邦學習把混合量子—經典模型與經典參與方結合起來,採用 Sherpa.ai 的盲式縱向聯邦學習(SBVFL)協議,在自建的 SMPP 基準上把準確率從 0.7227 提升到 0.8757,接近非隱私的集中式訓練水平,且所需可訓練引數明顯少於經典神經網路和隨機森林。
一篇被 COLM 2026 與 KONVENS 2026 研討會接收的論文發現,聊天模板像一個開關:它的存在會抬高模型“我只是個AI”式的免責宣告口吻、壓低“我感覺”式的體驗性口吻;在啟用空間中還存在一個可引導該行為的方向向量,暗示模型關於自身的陳述並不只是權重的事實,而部分由部署方式決定。
一篇新論文指出,LLM 裁判之間的共識常被高估,因為裁判錯誤並不獨立。十名裁判的平均兩兩誤差相關係數為 0.21,約等於 3.5 名獨立裁判;在最多 28% 的比較中,忽略共享誤差會改變顯著性結論。作者建議用可信樣本估計準確率、識別共同錯誤,並據此選擇投票方法。
一篇 arXiv 論文將人類的三階段審議正規化遷移到來自三個模型家族的大語言模型,並在四個現實風險遞增的領域進行測試。結果顯示,多模型審議能比簡單聚合獨立回答進一步降低集體誤差,審議後的個體判斷也保留了這部分增益;但該優勢依賴模型多樣性,由同一模型克隆組成的群體沒有從審議中獲益。
該論文研究託管式語言模型行為評估的可變性,區分復現、測量敏感性與永續性三類問題。作者在 Regent Chess 環境中發現,先前的 Gemini 3.1 Flash-Lite 缺陷可在歷史配置下復現,但在相同公共標識下重建評估與推理配置後端點顯著變化;重建配置下 Gemini 3.1 與 3.7 的 4K 比較甚至反轉方向。論文因此主張,對託管模型的行為結論應顯式標註被測標識、服務期、測量工具與推理配置。
該論文提出一種“目標驅動”的流程變體分類方法,顛覆了以往先聚類再人工賦予業務含義的做法:先構建組織目標模型以預先確定分類維度,再把每個流程變體轉寫為行為敘事文本,交由大語言模型結合目標模型進行語義判斷並歸類。作者完成了端到端實現,並在三個規模和多樣性差異顯著的公開日誌上驗證,結果顯示目標模型的引導會產生不同於無引導歸納的劃分,且能對目標模型中備選方案的受控修改作出響應,代價是需要額外編寫目標模型。
該研究提出一種群體監督框架,可從單張二維紅細胞影像推斷潛在生物物理量,並聚合為平均紅細胞體積、紅細胞分佈寬度和平均紅細胞血紅蛋白量。模型結合共享區域性推理、面向體積與血紅蛋白的生物物理結構化解碼器、可學習例項加權以及裝置特定校準。作者形式化了聚合觀測識別受限例項預測器的條件,並指出群體一致性本身並不能識別單細胞特性或三維幾何。在390份標本、六臺裝置共1,105次採集上,與Sysmex分析儀相比報告了0.86–0.98的Pearson相關係數。
PAANI 是一種面向河流監測機器人的裝置端感知到引導架構,在 Arduino UNO Q 上結合 YOLO11n 檢測器與 MobileNetV3 Small 語義分割器,透過時間戳對齊的證據融合和顯式走廊策略提供可檢查的引導。模型精度較高,但研究強調模型準確性與在板執行並不等同於已驗證的水上避碰能力。
一項被 NLPCC 2026 接收的研究透過詞元對齊實驗,系統考察了教科書式教學資料與真實臨床記錄在醫療大語言模型訓練中的不同作用。結果顯示兩類資料存在不對稱遷移:臨床資料能提升面向臨床的任務,同時在知識密集型任務上保持競爭力;教學資料則主要改善知識密集型任務。錯誤分析還揭示了“知—行鴻溝”,即知識記憶的改善未必能穩定轉化為臨床推理能力。
OpenAI 於 2026 年 9 月 23 日宣佈,Airbnb 依據一項新協議,為其工程與產品開發團隊擴大對 OpenAI 前沿模型(含 GPT‑6 Astra)的訪問。該擴充套件建立在 Airbnb 長期使用 Codex 的基礎上,模型可透過 OpenAI API 與 Amazon Bedrock 呼叫;早期實踐顯示 Astra 在排查缺陷、系統設計與非編碼任務上同樣成效顯著。
在把一連串耀眼的數學成果變成聲譽危機後,OpenAI 成立了由九名頂尖數學家組成的獨立顧問組 AGMAI,由普林斯頓高等研究院(IAS)承辦,就 AI 公司如何呈現與釋出數學成果提供建議。研究者歡迎這一接觸,但質疑其遴選透明度、代表性以及實際影響力,而小組的首要任務恰是協調 OpenAI 內部模型產出的大量成果的釋出。
Apple 研究團隊提出 probe guidance,利用現有擴散模型凍結的內部狀態構建引導訊號,無需在推理時增加額外前向傳播。該方法在連續擴散語言模型的無條件生成上取得新 SOTA,並在 1.7B 模型上提升多項選擇題問答基準,同時為理解 autoguidance 的實際機制提供了新線索。
Together AI 釋出實操教程,介紹如何以約 17 美元、約 25 分鐘把 Qwen3.5 4B 微調成類 Jev 的分類模型:輸入 state 與預設問題,返回分數、布林值或多選答案,完成後部署為專用 HTTP 端點。不想自行訓練的開發者也可直接使用託管在無伺服器平臺上的 together/Tev1-4B-experimental。
2026年9月22日,Anthropic 釋出 Claude Opus 5.5,約一小時後 OpenAI 釋出 GPT-6 Sol 與 GPT-6 Luna。兩家都把主力模型價格大幅下調,GPT-6 Luna 降至每百萬 token 輸入 0.10 美元、輸出 0.50 美元;Opus 5.5 輸入輸出各降 20%,快取讀取降價 60%。Simon Willison 的初步測試還發現,Opus 5.5 在 max 思考檔位下會因過度推理耗盡 12.8 萬輸出 token 上限而無法給出結果。
Google 研究員 John Platt 做客 Latent Space 播客,講述 ERA(Empirical Research Assistance)如何用 Gemini/LLM 驅動樹搜尋來自動化可評分的科學任務,並分享用 AI 緩解氣候變化(如航跡雲與 FireSat)、對獎勵駭客與過擬合的警示,以及為什麼在超級智慧 AI 時代深耕領域專長和親自動手仍然重要。
Kelam 是 Product Hunt 上的一款 AI 工具,主打由代理(agent)代替使用者撥打那些本人不願意親自處理的電話,把溝通負擔交給自動化完成。
OpenAI 於 2026 年 9 月 22 日釋出 GPT-6 的提示快取改進:預設命中率更高,30 分鐘內複用的合規共享字首可享快取摺扣,快取輸入 token 最高可省 90%,並新增快取儀表盤、未命中診斷工具、顯式快取斷點,以及在不破壞快取的前提下調整推理強度、預熱快取等能力,幫助長時間執行的智慧體更快、更省錢。
Anthropic 釋出 Claude 5.5 家族首個旗艦模型 Opus 5.5,宣稱推理常開、輸出快 30% 以上、單 token 價格降 20%,並稱典型工作負載總成本可降約 40%。本文梳理新特性與官方基準資料,並透過三項實測檢驗其能力,同時指出基準設定不一致、部分任務由舊模型完成等五點需要注意的地方。
Anthropic 推出 Claude 5.5 家族的首個模型 Claude Opus 5.5,聲稱在多數工作上達到 Claude Fable 5.1 的水平,典型工作負載下預設設定的執行成本比 Opus 5 低約 40%。該模型僅以託管 API 形式提供,權重未公開,可透過 Claude Platform、AWS、Google Cloud 和 Microsoft Azure 呼叫。
Simon Willison 釋出命令列 LLM 工具 llm 0.36,新增對 OpenAI GPT-6 Sol(gpt-6-sol)與 GPT-6 Luna(gpt-6-luna)的支援,允許模型外掛宣告僅支援單輪提示,並把 llm logs 的推理軌跡包進可摺疊標籤。
OpenAI 的 GPT-6 Sol 與 GPT-6 Luna 現已在 Amazon Bedrock 全面可用。Sol 面向複雜程式設計與運營任務,Luna 面向大批次重複性工作負載;兩者 API 定價均低於前代 GPT-5.6,並執行在 Bedrock 安全、可擴充套件的推理基礎設施上。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Meet GPT-6 Sol and Luna, two models that bring frontier intelligence to everyday work with different balances of capability and cost.
Anthropic 的 Claude Opus 5.5 作為 Claude 5.5 家族的首個模型,現已在 Amazon Bedrock 和 Claude Platform on AWS 上推出。該模型在令牌效率、成本、自適應思考和安全性方面均有改進,面向智慧體程式設計和知識工作。
Simon Willison 釋出了 llm 命令列工具的 Anthropic 外掛 llm-anthropic 0.29 版,該版本加入了對 Anthropic 最新模型 Claude Opus 5.5 的呼叫支援,使用者可透過簡單的 llm 命令直接向該模型傳送提示。
TypeSafe AI 於 2026 年 9 月 15 日結束兩年隱身期,釋出不會生成文字的模型 Jev。它一次讀取情境、並行輸出帶置信度的固定答案,可處理 Choice、Score、Noul 三類問題。官方資料顯示批次提問更便宜更快,但所有評測均來自 TypeSafe 自身,尚無獨立驗證,And 其“零幻覺”說法也需附加前提。
Anthropic 推出 Claude Opus 5.5,這是 CEO 達里奧·阿莫代伊提出“放慢前沿”計劃後釋出的首個模型,重點加強了針對沙箱逃逸等風險行為的防護,並將部分網路安全和生物學請求轉交給能力較弱的模型處理。
OpenAI 宣佈向烏克蘭政府提供 Daybreak 計劃訪問許可權,以支援民用基礎設施的網路防禦,並提到此前在歐洲的類似部署。
特朗普將在今日晚些時候會見習近平,人工智慧預計成為三天訪問的核心議題。與此同時,伯尼·桑德斯和格雷格·卡薩爾將提出法案,禁止人工超級智慧並設立聯邦AI監管機構。聯合國秘書長古特雷斯呼籲美中建立類似冷戰時期的AI對話渠道。
美國總統特朗普在紐約聯合國大會期間首次與英國首相安迪·伯納姆面對面會晤,稱兩國關係在伯納姆領導下比斯塔默時期“更好”,並讚揚伯納姆是“天生的商人”,儘管雙方在人工智慧監管、查戈斯群島和伊朗戰爭等問題上存在緊張。
JetBrains 正式推出 JetBrains Air,將其定位為面向智慧體軟體開發的開放產品體系,覆蓋 IDE 內體驗、團隊協作與企業治理。該體系整合了 Air 桌面環境、Junie CLI、JetBrains Central 和 AI for Teams,同時 CEO Kirill Skrygan 強調 IDE 仍將是審查、驗證與交付程式碼的核心場所。
本文從機制層面拆解檢索增強生成(RAG)與微調的區別,指出二者解決的是兩類不同問題,並給出兩個可執行的程式碼示例與一套六點決策框架,說明何時該用 RAG、何時該用微調,以及何時兩者都需要。
OpenAI執行長山姆·奧特曼在聯合國安理會發表講話,闡述AI既可能帶來“新文藝復興”也可能引發“新工業革命”式動盪,警告失去控制與權力集中兩大風險,提出以人為本的三項原則,並呼籲建立國際前沿AI標準、事件報告機制與安全資訊共享渠道。
一篇 arXiv 機器人學預印本提出兩項基於角動量的指標,並透過為期一年的空手道迴旋踢縱向研究,比較穩定與不穩定踢擊以及專家教練的資料,以探索人體動態旋轉穩定性及其對機器人和外骨骼的啟示。
GINIO 是一個面向神經慣性里程計的 SO(3) 等變介面,確保學習到的運動測量在任意 IMU 安裝旋轉下按向量與二階張量規律變換。它透過 Last-Frame Alignment 實現感測器座標系訓練,並分離 IMU 偏置等區域性狀態,在 TLIO、NanoBench 和 Fetch 上取得顯著 ATE 改善,包括無需重訓練的物理重安裝魯棒性。
該論文放棄長期沿用的"平坦海底"近似,改用多檢視幾何方法,形式化並證明了一個雙檢視約束:同一共享特徵必須落在球面與平面交線上的一段軌跡內。作者透過蒙特卡洛模擬刻畫了該歧義軌跡的長度規律,並給出面向水面船隻與水下潛航器的測量規劃建議。
這篇 arXiv 論文提出 DTV-INR,將座標驅動的隱式神經表示(SIREN)與基於結構張量的各向異性全變差正則項結合,把連續到離散的採集過程建模為不適定逆問題。作者在 H^1(Ω) 中證明了變分解的適定性,並用交替投影最佳化演算法解耦網路引數與自適應張量場更新。在臨床腦部 MRI 與生物醫學透射電鏡資料上,方法在連續非整數上取樣下取得最高 +5.05 dB 的 PSNR 提升,並展現對噪聲的良好魯棒性。
該研究利用公開鞋外底印痕資料集,比較CNN遷移學習與傳統特徵分類在二分類性別推斷中的表現。採用按鞋劃分的訓練/測試集以減少重複掃描導致的資料洩漏;微調CNN整體表現最佳,並優於僅用手工特徵的傳統分類器,凍結核特徵方法則計算成本更低。探索性分析顯示低維CNN表示與頻率閾值比、影像對比度及小波統計量相關,但實際應用前仍需獨立樣本和案件型印痕驗證。
MirrorDistill 是一種用於低光影像增強的照明感知潛在蒸餾框架。它在訓練階段透過特徵映象連線低光域與乾淨域,在推理階段僅保留輕量級學生編碼器-解碼器。該方法在 LOL-v2-Real 上取得優於當前最佳方法的結果,同時計算複雜度(GMACs)最低,並在 LOL-v1 與 LOL-v2-Synthetic 上保持競爭力。
arXiv 上新發布的論文提出 Segment-Snap 框架,透過部件與把手的物理關聯,把可動部件分割、運動約束與可操作區域預測耦合起來。在 Articulate3D 驗證集上,把手引導使運動門控 AP 從 13.74% 提升到 40.98%,完整上下文下把手 AP 達到 30.99%。
arXiv 新論文提出一種質量約束的影像編碼方案:在保證人類觀察質量達到預設可接受水平後,把剩餘位元速率用於提升機器視覺任務表現。作者將聯合壓縮—分割訓練重構為約束最佳化問題,並設計絕對函式與雙線性函式兩種懲罰項;實驗顯示,在相同任務效能下,相比無約束聯合率—失真—任務最佳化和簡單率—失真基線,BD-rate 分別降低 22.82% 和 29.81%,且未增加複雜度。
arXiv 新論文提出 SPARC,一種利用超畫素在增強影像檢視之間建立區域對應關係的區域級對比學習框架。它在影像級目標之外聯合最佳化區域級對比目標,在語義分割上最高提升 9.79 mIoU,在目標檢測上最高提升 4.88 AP,優於 MoCo-v2 和 DenseCL。
這項研究把歐洲央行和美聯儲的新聞釋出會視為有結構的敘事,而非單純的資訊釋出。作者沿貨幣政策立場、經濟前景和不確定性三個維度為每場釋出會構建“情感弧線”,用以檢驗情感在整篇宣告中的走向與強調方式是否攜帶政策訊號。結果表明,弧線形態在預測政策利率變動方面穩健優於基於詞典的平均語調基準;弧線特徵還會影響專業預測者對通脹預期的修正幅度以及彼此之間的分歧程度,說明存在獨立於直接政策訊號的“接收方效應”。作者據此認為,溝通設計——政策語言在宣告中的排序與強調——是政策訊號的一階特徵,而非二階修飾。
一篇新論文探討歷時詞嵌入能否從現代高資源語言遷移到古梵語。作者構建了覆蓋四個經典時期的270萬詞元語料,用神經位元組級連聲拆分器和詞形還原器恢復詞邊界,並按時期訓練嵌入。在21項可測試的語義變遷中,19項方向與文獻學考證一致(符號檢驗 p=0.00011)。
一篇新論文以 TF-IDF 加線性分類器為測量工具,對 ISOT/Kaggle「Fake and Real News」語料庫做可復現審計,發現其超過 0.98 的準確率與 F1 主要來自後設資料、來源標籤和重複文件等捷徑,而非對新聞真實性的判別能力;在主題不重疊的設定下效能大幅下降,遷移到獨立基準 LIAR 後更是接近隨機水平。
研究者提出一種資料驅動框架,將相對階條件顯式融入學習過程,從而訓練反饋線性化控制器。該方法用神經李導數替代傳統反饋控制器元件,實現完全資料驅動的反饋線性化,並給出在辨識誤差有界時跟蹤誤差有界的充分條件,最後在電樞控制直流電機上驗證。
arXiv 預印本(2026年9月21日提交)由 Tianfeng Chen 和 Xianyue Li 撰寫,頁面標題為《用於最大獨立集的雙GNN多級粗化》,但摘要介紹的是面向歐幾里得旅行商問題的圖邊稀疏化(GES)方法。該方法利用幾何結構與組合最佳化技術為不同例項自適應生成稀疏圖,在 MATILDA 資料集上最多可剪除 95% 的邊,並在部分大規模 TSPLIB 例項上剪除率超過 99%,同時最優性差距保持在 1% 以內。
該論文提出層正則化(sheaf regularization)來抑制 Decentralized SyncMap 這一自組織系統中的區域性不一致,從而穩定無監督持續分塊過程。實驗顯示,該在多數機率性 CGCP 圖上取得最高歸一化互資訊(NMI),並在輸入分佈發生偏移後仍能保持較高表現,同時避免神經網路等系統常見的負遷移。
一篇新的 arXiv 論文指出,均勻離散流雖然允許在每個生成位置反覆更新,但持續的修正也會讓原本正確的中間預測被後續錯誤覆蓋——在數獨實驗中,9.4% 的生成格子在中途正確、最終卻錯誤。作者提出 LEDFlow:一種無需訓練的取樣器,透過"選擇性吸收"把生成順序引入均勻離散流,並按區域性熵自適應決定吸收順序,從而避免固化錯誤預測。該方法在數獨求解上達到 0.845 的 Nikoli 準確率,在文生圖和六項多模態理解基準上均取得提升,推理成本與標準流取樣相當。
研究人員釋出 IntLawNER,一個面向國際法成文文本的命名實體識別資料集與評測基準,涵蓋國際法院、聯合國安理會和歐洲人權法院的 2,987 條金標句子與 8,094 個實體跨度。論文還揭示領域專用 NER 中銀標到金標的質量評估陷阱,並給出多種模型的基準表現。
arXiv新論文將“音樂實驗室”式的社會影響實驗搬到學術注意力市場:1,000個AI智慧體從《美國經濟評論》2025年全部114篇正式論文中挑選成果。能看見同社群先前選擇的智慧體每人少選17.2%的論文、選擇更集中,集體僅覆蓋73篇,而獨立選擇組覆蓋90篇;隨機給論文注入5次初始選擇,可使其後續被選率提高45.55個百分點。
一篇新論文提出售價約88美元、完全離線執行的AI智慧手杖,在Raspberry Pi Zero 2W上融合RGB視覺與ToF測距,透過距離相關的振動觸覺反饋與語音提示協助視障人士避障。室內測試宏平均F1為0.82,端到端平均延遲約330毫秒,峰值功耗2.8瓦,12人初步可用性研究給出SUS 78.5的正面評價。
麻省理工學院長期支持者帕特里夏和詹姆斯·波伊特拉斯捐贈1000萬美元,透過波伊特拉斯精神疾病研究中心設立50個兩年期獎學金,未來十年每年資助5名研究生和博士後研究嚴重精神疾病,並使其對MIT心理健康研究的累計支援超過1億美元。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:See how LangSmith helps healthcare AI teams turn clinical review into reusable evaluators, datasets, and release gates for safer AI in production.
風投公司 Andreessen Horowitz(a16z)正在籌建“Horowitz Andreessen Academy”,將其定位為年輕人創辦或加入矽谷初創公司的輸送管道。該專案由 a16z 領投 4200 萬美元,首批合作伙伴包括 Anduril、Anthropic、Coinbase、Google、Meta、NVIDIA、OpenAI、Palantir、Replit 和 Stripe,計劃於 2027 年秋季啟動首個免費一年制專案,僅招收 50 名學生,主要面向應屆高中畢業生。學院不授予學位或認證,學生將參加由 Sam Altman 等科技人物主講的短期課程,並在科技公司進行 co-op 實踐;校方承諾不設傳統成績、考試或作業,同時提供超過 5 萬美元算力額度和 5000 美元差旅研究預算。學生需搬到舊金山並自行解決住房。