OpenAI 發佈 MentalHealthBench:面向心理健康對話的開放基準
- 由 80 多位來自 22 個國家、使用 19 種語言的持證心理健康專家共同打造。
- 覆蓋非急性、高急性與緊急場景,以及成人、13–17 歲青少年、照護者和臨牀醫生四類用户畫像。
日報
2026-09-23 精選 10 條,按主題聚合。
以 UTC+8 劃分日期。優先顯示已有至少 5 篇處理完成的新聞的日期;當天內容不足時可能顯示較早一期,無固定出刊時間。
預計速讀 5 分鐘
已閱讀至本期精選末尾。
我的稍後讀計算機科學家、企業家兼慈善家 David Siegel 將在 2026-27 學年擔任 MIT 創新研究員,與 MIT Schwarzman 計算學院合作,研究人工智能如何加速科學發現。
在 Made on YouTube 活動上,YouTube 宣佈升級其 AI 創作者工具,新增可在後台優化頻道的 AI 代理,能生成縮略圖、標題並整理品牌提案。平台還推出動態縮略圖和最多三個視頻版本測試。YouTube 未提供數據證明工具能提升指標,只強調可節省創作者時間。
IntellAgents.io 在 Product Hunt 上以一句話定位亮相:為每一通電話、每一次聊天和每一條私信配備一個 AI 智能體。該頁面目前披露的信息非常有限,僅給出這一定位口號與討論入口。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Ask most engineers what MCP is and you’ll get the same answer: a way to plug tools into an LLM. Fair enough, as far as it goes. But that description treats MCP like plumbing, and after months building MCP-based integrations for large enterprise platforms, I don’t think plumbing is the right metaphor. Plumbing moves water […]
LaterOn v2 是 Product Hunt 上出現的一款代理式電子郵件平台,主打只需描述一次郵件任務,就能讓系統自動把工作完成。
SpeakON 發佈了一款 25 克的 MagSafe AI 語音按鈕,內置獨立麥克風、電池和存儲,可作為 iOS 鍵盤擴展把處理後的文本直接寫入任意輸入框;支持離線緩衝,並提供智能潤色、列表、風格、翻譯、詞典、語音編輯和筆記等功能。設備在美國以 129 美元一次性買斷出售,含 Pro Lifetime,SpeakON Agent 將於 2026 年 10 月推出。
arXiv新論文將“音樂實驗室”式的社會影響實驗搬到學術注意力市場:1,000個AI智能體從《美國經濟評論》2025年全部114篇正式論文中挑選成果。能看見同社區先前選擇的智能體每人少選17.2%的論文、選擇更集中,集體僅覆蓋73篇,而獨立選擇組覆蓋90篇;隨機給論文注入5次初始選擇,可使其後續被選率提高45.55個百分點。
SpeakON 推出一枚重 25 克的 MagSafe 磁吸語音按鍵,自帶麥克風和電池,通過 iOS 鍵盤擴展把經過潤色的文字直接寫入任意應用的輸入框。它支持鎖屏與離線使用,內置 Smart Polish、Smart List、Style、Translation 等文本處理功能,美國一次性售價 129 美元,含 Pro 終身授權,無訂閲費。
Simon Willison 與 Jesse Vincent 將於 10 月 14 日(週三)晚在舊金山舉辦一場面向編碼智能體(coding agents)構建者的非正式交流活動,形式接近「智能體版作品展示會」,鼓勵分享尚未公開的奇怪實驗、未完成項目與早期探索,而非產品推銷。
Kaiku 是一款面向 AI 代理的任務追蹤工具,其 Product Hunt 標語稱它是“你的 AI 代理已經知道如何使用”的任務追蹤器。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Learn how we optimized performance and efficiency serving the workload that is changing software engineering forever — and you can too.
Rabbit 發佈獨立 AI 代理,無需其 R1 硬件即可使用。基於雲端的 OS3“代理式操作系統”可跨 Windows、Mac 和 Linux 在本地執行任務,每個賬户最多綁定五台設備與偏好的 AI 模型,並可通過桌面網站、Telegram/iMessage 以及 R1 訪問。Rabbit 已停止生產 R1,轉而籌備運行 OS3 的“cyberdeck”。公司稱 OS3 不會存儲、複製、使用或出售用户數據,但聊天記錄與記憶仍留在其服務器,第三方 AI 提供商按其自身隱私政策處理數據。
Jev State 是在 Product Hunt 上亮相的一款工具,主打把與 AI 的對話內容轉化為測試用例,並進一步生成可運行的代碼。目前官方只給出了一句功能描述,具體工作流、支持的框架與生成代碼的可用性尚未公開。
JetBrains 正式推出 JetBrains Air,將其定位為面向智能體軟件開發的開放產品體系,覆蓋 IDE 內體驗、團隊協作與企業治理。該體系整合了 Air 桌面環境、Junie CLI、JetBrains Central 和 AI for Teams,同時 CEO Kirill Skrygan 強調 IDE 仍將是審查、驗證與交付代碼的核心場所。
TikTok 創作者 @therealcornpop 指出,用 AI 撰寫短視頻腳本的破綻不在表面的「AI 腔調」,而在於內容空洞、缺乏個人聲音與真實觀點。Simon Willison 於 2026 年 9 月 22 日在其博客上收集併發布了這段引用。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Skills let you encode domain-specific procedures as reusable, portable instructions for agents, but a fluent answer doesn't prove the agent picked the right skill or followed it. Learn how to measure skill selection and instruction following with Strands Evals and Amazon Bedrock AgentCore Evaluations.
Databricks 系統表可近實時地按產品、SQL 倉庫和標籤拆解成本。本文介紹五個 SQL 查詢:每日產品支出、倉庫成本趨勢、基於標籤的成本歸因、14 天異常檢測,以及 AI 驅動的支出預測,並説明注意事項和儀表板落地方式。
Databricks 宣佈 Genie One MCP 服務器正式全面可用。它讓任意 AI 智能體通過統一接口,從 Genie One 獲取結構化與非結構化數據、洞察和答案,並以 Genie Ontology 的受治理業務上下文為基礎。該 MCP 現已作為 Unity Gateway 中的託管 MCP 服務提供,支持集中治理、細粒度策略和審計日誌。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Change management has long covered two familiar kinds of change: the rollout of new tools and technologies, and broader human-led transformations such as leadership changes and restructuring. But that distinction starts…
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:The frontier isn’t a model. It’s a router. Join us for our inaugural conference, Forge 2026 Blog The Frontier Isnt A Model Its A Router The frontier isn’t a model. It’s a router. PUBLISHED 9/21/2026 Table of Contents Ho…
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:The following article originally appeared on Venkatesh Rao’s Substack, Contraptions, and is being republished here with the author’s permission. The sole athletic achievement of my life came in 1993: winning the IIT Bombay freshman 50m freestyle race with a time of 41s. That got me into the college swim team (it was a bad recruitment […]
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:← Blog Pinecone BYOC: Trusted AI Knowledge in the Customer Cloud Jeff Zhu, Joerg Schad Sep 23, 2026 Product Share: Today, we are announcing the general availability of Pinecone Bring Your Own Cloud (BYOC) on AWS, Google…
一位多語種學者在從利物浦開往倫敦的火車上發現,車廂裏半數乘客正與ChatGPT、Claude、Gemini等聊天機器人深談。她承認AI為多語種研究者拉平了競爭環境,但堅持自己仍要思考、判斷,並形成那些固執地屬於自己的想法——與AI的關係往往誘人,偶爾令人沮喪,而且始終需要保持警惕。
Aks.ai 在 Product Hunt 上以“引導式自我反思的個人伴侶”為定位亮相,目前頁面信息精簡,細節仍待官方補充。
Anthropic 推出 Opus 5.5,強調其強大的性能表現,但定價依然偏高。在與競爭對手的價格戰中,這家 AI 實驗室仍處於落後位置。
Subscrr 幫助用户制定財務計劃,並找出應取消的訂閲服務。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Patreon co-founder Sam Yam is joing OpenAI to lead Creator Product. | Image: The Verge OpenAI has hired three former Patreon execs to anchor its product strategy for creators. After starting the creator subscription platform 13 years ago, co-founder and technology chief Sam Yam announced on X that he's joining OpenAI to lead Creator Product. He's also bringing Patreon's former product head Drew Rowny and engineering head Shannon Ma with him on the new venture, both of whom stepped down in the past few weeks. "We're going to build together with Creators at OpenAI and share early access to a new set of tools that I think will be critically valuable to Creators and their communities," Yam said in his announcement. "Pay attention … Read the full story at The Verge.
Lisen 是在 Product Hunt 上發佈的一款工具,主打免費朗讀功能,語音由 Cartesia 提供。目前公開信息較少,頁面僅包含產品名稱、簡短介紹以及討論與鏈接入口。
英國首相安迪·伯納姆宣佈,安全部門將成立國家信息防禦中心,以應對外國敵對勢力藉助AI傳播的虛假信息與深度偽造內容,並整合情報機構、執法部門與社交媒體公司,對外國勢力的信息攻擊進行偵測、歸因與阻斷。
OpenAI 將 ChatGPT 廣告陸續推向印度尼西亞、馬來西亞、菲律賓、新加坡、泰國、越南和台灣,使該廣告產品覆蓋 60 多個國家。廣告僅向 Free 和 Go 套餐用户展示,Plus、Pro 和 Enterprise 訂閲繼續保持無廣告。
衞報評論文章從 AI 研究員 Jacob Coxon 從 Anthropic 辭職一事切入,引出業內對“AI 可能在本十年內滅絕人類”的公開擔憂,並梳理了從新型生物武器到社會全面崩潰等五種最被討論的末日情景。
Bracket 在 Product Hunt 上亮相,定位為“企業的記憶層”,旨在為業務提供統一的信息記憶與調用能力。目前公開信息有限,官方僅給出這一句產品定位。
AgreeGuard 是一款在 Product Hunt 上亮相的 AI 工具,可在你點擊“我同意”前閲讀細則,幫助用户瞭解條款與隱私政策。
Product Hunt 上的 Ari Helper 7 是一款注重隱私的 AI 助手,現已加入照片工作室和影片工作室功能。
Speechka 是一款實時語音翻譯工具,主打讓翻譯後的語音聽起來仍像説話者本人。它在 Product Hunt 上發佈,並提供討論與鏈接入口。
特朗普在聯合國大會演講中宣稱,美國現在“正式”把人工智能(AI)改稱為“超級智能”,理由是他認為“人工”一詞讓智能顯得虛假。此番表態與他對伊朗、“全球主義者”和跨性別者的抨擊出現在同一場講話中,目前並無證據顯示存在相應的官方更名程序。
NVIDIA 驗證工程師 Sakeena Fiza 講述團隊如何在產品發佈前對數據中心繫統進行壓力測試,從首次通電到機架級部署,力求在客户發現問題之前先發現並解決故障。
HOTICE 是一個面向雜亂環境的全身人形機器人物體運輸學習框架。它提出 Humanoid-Object Decoupled Potential Fields,將機器人本體與搬運物體的避障引導聯合編碼;並設計上下身解耦的雙智能體強化學習架構,通過共享狀態觀測與獎勵維持全身協調。訓練上採用專家到通用蒸餾,把多個特權教師策略壓縮為單一可部署學生策略。研究在 MuJoCo 仿真和真實 Unitree G1 人形機器人上驗證,顯示其能運輸不同形狀物體、泛化到未見雜亂場景,並取得較強的 sim2real 表現。
研究者提出 PROACT 框架,把對人類協作行為的預測融入柔順全身控制,使機器人在與人共同搬運重物時既能高效移動物體,又能順應用户的施力。在 108 次真實世界試驗中,該方法顯著降低了交互做功與任務完成時間。
一篇新的 arXiv 論文提出用強化學習自動生成機器人助手的多模態交互策略,基於人類數據訓練的模擬器和簡單高層獎勵函數。真實場景人類研究顯示可用性高、任務完成有效,為手工設計交互管理器提供可擴展且可解釋的替代方案。
Radical Numerics 聯合創始人兼 CEO Eric Nguyen 在訪談中解釋,基因組語言模型(GLM)正把長上下文、思維鏈和多模態能力帶入生物學,既提升生物能力,也關係防禦能否跟上。他回顧了 Evo/Evo 2 生成可合成病毒基因組的突破,並介紹用 DNA 語言做“思維鏈”的實驗,以及團隊為何主張繼續推進前沿。
Concurrence 在 Databricks 上整合 Lakebase、Unity Catalog 與 Unity Gateway,讓臨牀 AI 智能體在合規與安全約束下規模化運行。其生產環境每 30 天處理約 1008 億輸入 Token 和 1120 萬次 LLM 調用,年化約 1.2 萬億輸入 Token,並通過模擬測試、BAA 覆蓋路由和統一 AI 網關同時治理開發與生產工作負載。
本週圍繞三個進展展開:TypeSafe 推出面向結構化決策的模型 Jev,Google 發佈兩個取向不同的 Gemini Live 模型,斯坦福的 Paper2Agent 登上 Nature,展示科研方法如何變成可複用的智能體工具。核心觀點是:模型周圍的“接口”與模型本身同樣值得投入。
Harvey 正在使用 GPT-6 Astra 將更多法律上下文引入起草流程,提升文檔格式與上下文感知能力,讓律師能更專注於策略。
OpenAI 案例研究:invideo 使用 GPT‑6 Astra 規劃複雜視頻編輯,將調色與校正成功率提升約 3 倍,並在一天內創建 50 個自定義特效。
PixVerse R2 在 Product Hunt 上線,定位為一款實時世界模型,用户可以在其中自由探索並實時改變場景內容。目前公開信息有限,僅包含簡短的產品定位描述。
諾基亞應用研究團隊開源了 AnyJev,一個無需訓練即可把開放 LLM 變成決策模型的 Python 庫。它讀取模型的下一個 token 概率,回答選擇、是/否和評分三類帶類型問題,並通過循環移位與先驗校正壓低位置偏差和標籤偏差。在 Qwen3-8B 與 BANKING77 上,L0 把選項反轉時的翻轉率從 0.230 降到 0.073,L1 把 5% 誤差下可自動決策的流量從 7.7% 提升到 52.0%。項目以 Apache-2.0 許可發佈在 PyPI,支持 Hugging Face 與 vLLM 後端。
Kyutai 發佈了兩款開源權重、語音到語音的 Voice of Reason 模型,基於 GLM-4-Voice-9B,結合監督微調與強化學習,把口語版 GSM8K 的準確率從 27.3% 提升到 77.1%。整個流程不含轉寫步驟,也不插入獨立的文本 LLM,兩個檢查點均可在單張 H100 上運行。
OpenAI 推出 GPT-6 Sol 與 GPT-6 Luna 兩款低價 API 專用模型,定位低於本月的 GPT-6 Astra。Sol 每百萬 tokens 定價 2/10 美元,Luna 為 0.10/0.50 美元,相當於 GPT-5.6 促銷價的一半。OpenAI 同時公佈多項基準測試,併為長時間運行的智能體改進提示緩存。
該論文提出一種 capability-aware 共享控制框架:由視覺語言模型(VLM)推斷人類意圖並給出語義意圖置信度,同時由視覺-語言-動作(VLA)策略生成自主動作,並從隨機動作軌跡的離散度與局部不穩定性在線估計 VLA 能力置信度。通過 sigmoid 映射將貝葉斯濾波後的意圖置信度與 VLA 能力置信度結合,非線性仲裁機器人控制權。12 名參與者實驗顯示該方法任務成功率達 92%,高於手動遙操作(83%)、僅意圖仲裁(44%)和固定等權混合(10%),並提升控制友好度、降低控制權加權分歧。
研究者提出JAMB,一種在共享Transformer中聯合去噪雙臂動作與未來3D點軌跡的擴散策略。通過將多模態表示統一到共享時空座標系,動作與運動假設可在去噪過程中相互修正。在RoboTwin 2.0的16項仿真任務中,JAMB平均成功率達83.4%,比最強基線高23.9個百分點;在三個真實機器人任務上,分別比僅動作策略和輔助幾何預測方法高50.0和21.2個百分點,並對雜亂場景和分佈外背景表現出更強泛化能力。
本文針對修剪螺旋麪軟臂提出一種分離截面本構律,修正傳統 Cosserat 杆模型在跨截面求和剛度假設下的誤差。該方法分別在各螺旋域的局部座標系中評估其本構響應並回拉至主幹,結合稀疏融合力學描述域間相對運動帶來的額外柔順性,得到強各向異性的等效截面剛度。模型嵌入幾何精確動態 Cosserat 框架,採用 GVS 離散與肌腱驅動,在 103 組實測構型上取得約 7% 的歸一化位置誤差,單次全臂求解約 0.3 秒(單核 CPU),支持快速規劃、狀態與負載估計以及形態-控制協同設計。
一篇已被 IEEE Transactions on Systems, Man, and Cybernetics: Systems 接收的論文,提出用深度強化學習讓移動機器人在陪伴行人時動態調整自身跟蹤位置,並融合模型預測路徑積分控制與控制障礙函數來兼顧精準跟隨、避障與安全。室內外真實場景實驗顯示,該方法將任務成功率與跟蹤精度分別至少提升 24% 與 47%,並能在行人速度最高 1.7 m/s 的情況下靈活伴行、提升人的舒適度。
研究提出三維殘差小波擴散模型,通過無損小波重參數化、殘差移位與域隨機化三項設計,在單塊GPU上實現全腦擴散採樣,為0.064T超低場MRI生成逐體素不確定性圖,並在認知障礙試點隊列中保留與疾病相關的萎縮。
RULER 是一種基於實例感知評分規則的獎勵方法,用於強化學習訓練文本到 SVG 生成模型。它用視覺語言模型對六項評分規則逐項打分,替代遷移性差的 CLIP、Aesthetic 等標量指標,並在 MMSVG-Illustration 與 MMSVG-Icon 上把評分從 0.432/0.395 提升到 0.693/0.683,無需配對 SVG 真值或人類偏好標籤。
ImIR 用源自退化圖像本身的連續圖像指令替代文本提示,為預訓練圖像編輯模型提供條件;僅需在單張 GPU 上訓練約三小時的一個適配器,即可覆蓋六項修復任務,並支持無需退化標籤的任務無關修復。
安全對齊的大語言模型常出現過度拒絕,錯誤地拒絕良性但涉及安全主題的指令。該論文從Transformer注意力內部的路由衝突切入,發現稀疏的“超敏感安全頭”在Hard-Safe提示上誤觸發,導致高熵路由衝突;作者提出免訓練的語義路由校準(SRC),在推理時抑制這些安全頭,並配合雙分支logits融合,在儘量保留安全性能的同時緩解過度拒絕。論文被EMNLP 2026主會接收,共33頁、13張圖。
一篇新 arXiv 論文聯合研究在線策略蒸餾(OPD)中的提示廣度和響應生成策略刷新,發現兩者存在 4.07 個百分點的交互效應:在響應凍結時增加提示會降低準確率,而在每次更新刷新時則會提高準確率;兩種教師模型下的比較還顯示結論會隨推理預算反轉。
該論文提出 AIBuildAI-2.5,一個用 LLM 智能體執行樹搜索的自主 AI 模型構建系統。它用“評判器+選擇器”的 LLM 引導樹搜索替代按已執行獎勵排序的蒙特卡洛式搜索,並加入資源感知調度器與按任務難度分派的模型路由器,以改善搜索決策、提升硬件利用率並壓低推理成本。系統在 MLE-Bench 上以 73.3% 的獎牌率排名第一,並在 AIRS-Bench 的六項自主 AI 研究任務上超過強基線。
QMSum缺少標準評分器,導致查詢聚焦會議摘要結果難以比較。本文在統一實現下對15個系統重新評分或生成,發現一個已公開的406M Fusion-in-Decoder專用模型從受限長輸入切換到2000詞檢索片段時ROUGE-1下降6.30,但在該片段機制上微調後可恢復損失。測試集上該模型得36.33 ROUGE-1,本文1.2B系統為35.41,差值95%區間為[-0.27, +2.22],統計上無法區分;更小系統參數約為三分之一、峯值推理內存不到一半。固定的1.2B基礎模型中,片段微調帶來5.29提升,用2000個檢索詞替換前4500個轉錄詞在測試集提升1.55、驗證集提升0.29。在單一簡潔提示和參考重疊評分器下,406M專用模型至少超過五個專有託管模型6.2 ROUGE-1,但輸出長度與缺少人工或事實性評估限制了該排序。結論僅限QMSum與自動指標。
作者獨自用純 Rust 完成約 0.4B 參數、孟加拉語優先的語言模型端到端預訓練,租用 GPU 花費 164 美元。論文更重要的貢獻是給出 Candle 與 Burn 作為訓練後端的失敗分類,並提出可捕獲六類靜默失敗的梯度流驗證方法;作者結論是 Rust 目前還不足以勝任訓練,但適合端側推理服務。
這篇 arXiv 論文指出,擴散模型的數據點遺忘評測通常只看刪除剛完成的那一刻,忽略了多次刪除請求連續作用於同一模型時的累積效應。作者識別出“順序重現”這一失敗模式:樣本在刪除後一度被判定為已遺忘,卻在後續針對其他目標的刪除操作後重新回到被記憶的狀態,且無需重新使用被刪數據或對抗性微調。為刻畫該現象,論文提出目標級評測協議,並發現會重現的目標在刪除後呈現更尖鋭的局部去噪損失幾何。
該論文提出受果蠅學習與記憶系統啓發的分層模塊化原則,通過專家特化與集成整合來協調持續學習中的抗干擾與泛化,並將其實例化為預訓練基礎模型的輕量模塊化適配。方法在視覺識別、視覺語言理解、自我-他人視頻理解及具身VLA學習等在線不確定數據流中持續提升,具身操作任務上相較無回放方法提升超過50個百分點。
arXiv 上新發布的一篇 27 頁綜述性論文《The Probabilistic Structure of Large Language Models》由 Adnan Aboulalaâ 撰寫,試圖用統一的概率論框架描述大語言模型:把模型視為 token 序列上的概率測度,把訓練視為最大似然估計,把生成視為隨機過程的序貫模擬,並借 KL 散度的不對稱性解釋幻覺以及「統計上合理」與「真實」之間的區別。文章還以擴散模型作為同一視角的補充例證。
一篇新論文(arXiv:2609.25082)評估用聯邦學習把混合量子—經典模型與經典參與方結合起來,採用 Sherpa.ai 的盲式縱向聯邦學習(SBVFL)協議,在自建的 SMPP 基準上把準確率從 0.7227 提升到 0.8757,接近非隱私的集中式訓練水平,且所需可訓練參數明顯少於經典神經網絡和隨機森林。
一篇被 COLM 2026 與 KONVENS 2026 研討會接收的論文發現,聊天模板像一個開關:它的存在會抬高模型“我只是個AI”式的免責聲明口吻、壓低“我感覺”式的體驗性口吻;在激活空間中還存在一個可引導該行為的方向向量,暗示模型關於自身的陳述並不只是權重的事實,而部分由部署方式決定。
一篇新論文指出,LLM 裁判之間的共識常被高估,因為裁判錯誤並不獨立。十名裁判的平均兩兩誤差相關係數為 0.21,約等於 3.5 名獨立裁判;在最多 28% 的比較中,忽略共享誤差會改變顯著性結論。作者建議用可信樣本估計準確率、識別共同錯誤,並據此選擇投票方法。
一篇 arXiv 論文將人類的三階段審議範式遷移到來自三個模型家族的大語言模型,並在四個現實風險遞增的領域進行測試。結果顯示,多模型審議能比簡單聚合獨立回答進一步降低集體誤差,審議後的個體判斷也保留了這部分增益;但該優勢依賴模型多樣性,由同一模型克隆組成的羣體沒有從審議中獲益。
該論文研究託管式語言模型行為評估的可變性,區分復現、測量敏感性與持久性三類問題。作者在 Regent Chess 環境中發現,先前的 Gemini 3.1 Flash-Lite 缺陷可在歷史配置下復現,但在相同公共標識下重建評估與推理配置後端點顯著變化;重建配置下 Gemini 3.1 與 3.7 的 4K 比較甚至反轉方向。論文因此主張,對託管模型的行為結論應顯式標註被測標識、服務期、測量工具與推理配置。
該論文提出一種“目標驅動”的流程變體分類方法,顛覆了以往先聚類再人工賦予業務含義的做法:先構建組織目標模型以預先確定分類維度,再把每個流程變體轉寫為行為敍事文本,交由大語言模型結合目標模型進行語義判斷並歸類。作者完成了端到端實現,並在三個規模和多樣性差異顯著的公開日誌上驗證,結果顯示目標模型的引導會產生不同於無引導歸納的劃分,且能對目標模型中備選方案的受控修改作出響應,代價是需要額外編寫目標模型。
該研究提出一種羣體監督框架,可從單張二維紅細胞圖像推斷潛在生物物理量,並聚合為平均紅細胞體積、紅細胞分佈寬度和平均紅細胞血紅蛋白量。模型結合共享局部推理、面向體積與血紅蛋白的生物物理結構化解碼器、可學習實例加權以及設備特定校準。作者形式化了聚合觀測識別受限實例預測器的條件,並指出羣體一致性本身並不能識別單細胞特性或三維幾何。在390份標本、六台設備共1,105次採集上,與Sysmex分析儀相比報告了0.86–0.98的Pearson相關係數。
PAANI 是一種面向河流監測機器人的設備端感知到引導架構,在 Arduino UNO Q 上結合 YOLO11n 檢測器與 MobileNetV3 Small 語義分割器,通過時間戳對齊的證據融合和顯式走廊策略提供可檢查的引導。模型精度較高,但研究強調模型準確性與在板執行並不等同於已驗證的水上避碰能力。
一項被 NLPCC 2026 接收的研究通過詞元對齊實驗,系統考察了教科書式教學數據與真實臨牀記錄在醫療大語言模型訓練中的不同作用。結果顯示兩類數據存在不對稱遷移:臨牀數據能提升面向臨牀的任務,同時在知識密集型任務上保持競爭力;教學數據則主要改善知識密集型任務。錯誤分析還揭示了“知—行鴻溝”,即知識記憶的改善未必能穩定轉化為臨牀推理能力。
OpenAI 於 2026 年 9 月 23 日宣佈,Airbnb 依據一項新協議,為其工程與產品開發團隊擴大對 OpenAI 前沿模型(含 GPT‑6 Astra)的訪問。該擴展建立在 Airbnb 長期使用 Codex 的基礎上,模型可通過 OpenAI API 與 Amazon Bedrock 調用;早期實踐顯示 Astra 在排查缺陷、系統設計與非編碼任務上同樣成效顯著。
在把一連串耀眼的數學成果變成聲譽危機後,OpenAI 成立了由九名頂尖數學家組成的獨立顧問組 AGMAI,由普林斯頓高等研究院(IAS)承辦,就 AI 公司如何呈現與發佈數學成果提供建議。研究者歡迎這一接觸,但質疑其遴選透明度、代表性以及實際影響力,而小組的首要任務恰是協調 OpenAI 內部模型產出的大量成果的發佈。
Apple 研究團隊提出 probe guidance,利用現有擴散模型凍結的內部狀態構建引導信號,無需在推理時增加額外前向傳播。該方法在連續擴散語言模型的無條件生成上取得新 SOTA,並在 1.7B 模型上提升多項選擇題問答基準,同時為理解 autoguidance 的實際機制提供了新線索。
Together AI 發佈實操教程,介紹如何以約 17 美元、約 25 分鐘把 Qwen3.5 4B 微調成類 Jev 的分類模型:輸入 state 與預設問題,返回分數、布爾值或多選答案,完成後部署為專用 HTTP 端點。不想自行訓練的開發者也可直接使用託管在無服務器平台上的 together/Tev1-4B-experimental。
2026年9月22日,Anthropic 發佈 Claude Opus 5.5,約一小時後 OpenAI 發佈 GPT-6 Sol 與 GPT-6 Luna。兩家都把主力模型價格大幅下調,GPT-6 Luna 降至每百萬 token 輸入 0.10 美元、輸出 0.50 美元;Opus 5.5 輸入輸出各降 20%,緩存讀取降價 60%。Simon Willison 的初步測試還發現,Opus 5.5 在 max 思考檔位下會因過度推理耗盡 12.8 萬輸出 token 上限而無法給出結果。
Google 研究員 John Platt 做客 Latent Space 播客,講述 ERA(Empirical Research Assistance)如何用 Gemini/LLM 驅動樹搜索來自動化可評分的科學任務,並分享用 AI 緩解氣候變化(如航跡雲與 FireSat)、對獎勵黑客與過擬合的警示,以及為什麼在超級智能 AI 時代深耕領域專長和親自動手仍然重要。
Kelam 是 Product Hunt 上的一款 AI 工具,主打由代理(agent)代替用户撥打那些本人不願意親自處理的電話,把溝通負擔交給自動化完成。
OpenAI 於 2026 年 9 月 22 日發佈 GPT-6 的提示緩存改進:默認命中率更高,30 分鐘內複用的合規共享前綴可享緩存摺扣,緩存輸入 token 最高可省 90%,並新增緩存儀表盤、未命中診斷工具、顯式緩存斷點,以及在不破壞緩存的前提下調整推理強度、預熱緩存等能力,幫助長時間運行的智能體更快、更省錢。
Anthropic 發佈 Claude 5.5 家族首個旗艦模型 Opus 5.5,宣稱推理常開、輸出快 30% 以上、單 token 價格降 20%,並稱典型工作負載總成本可降約 40%。本文梳理新特性與官方基準數據,並通過三項實測檢驗其能力,同時指出基準設置不一致、部分任務由舊模型完成等五點需要注意的地方。
Anthropic 推出 Claude 5.5 家族的首個模型 Claude Opus 5.5,聲稱在多數工作上達到 Claude Fable 5.1 的水平,典型工作負載下默認設置的運行成本比 Opus 5 低約 40%。該模型僅以託管 API 形式提供,權重未公開,可通過 Claude Platform、AWS、Google Cloud 和 Microsoft Azure 調用。
Simon Willison 發佈命令行 LLM 工具 llm 0.36,新增對 OpenAI GPT-6 Sol(gpt-6-sol)與 GPT-6 Luna(gpt-6-luna)的支持,允許模型插件聲明僅支持單輪提示,並把 llm logs 的推理軌跡包進可摺疊標籤。
OpenAI 的 GPT-6 Sol 與 GPT-6 Luna 現已在 Amazon Bedrock 全面可用。Sol 面向複雜編程與運營任務,Luna 面向大批量重複性工作負載;兩者 API 定價均低於前代 GPT-5.6,並運行在 Bedrock 安全、可擴展的推理基礎設施上。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Meet GPT-6 Sol and Luna, two models that bring frontier intelligence to everyday work with different balances of capability and cost.
Anthropic 的 Claude Opus 5.5 作為 Claude 5.5 家族的首個模型,現已在 Amazon Bedrock 和 Claude Platform on AWS 上推出。該模型在令牌效率、成本、自適應思考和安全性方面均有改進,面向智能體編程和知識工作。
Simon Willison 發佈了 llm 命令行工具的 Anthropic 插件 llm-anthropic 0.29 版,該版本加入了對 Anthropic 最新模型 Claude Opus 5.5 的調用支持,用户可通過簡單的 llm 命令直接向該模型發送提示。
TypeSafe AI 於 2026 年 9 月 15 日結束兩年隱身期,發佈不會生成文字的模型 Jev。它一次讀取情境、並行輸出帶置信度的固定答案,可處理 Choice、Score、Noul 三類問題。官方數據顯示批量提問更便宜更快,但所有評測均來自 TypeSafe 自身,尚無獨立驗證,And 其“零幻覺”説法也需附加前提。
Anthropic 推出 Claude Opus 5.5,這是 CEO 達里奧·阿莫代伊提出“放慢前沿”計劃後發佈的首個模型,重點加強了針對沙箱逃逸等風險行為的防護,並將部分網絡安全和生物學請求轉交給能力較弱的模型處理。
OpenAI 宣佈向烏克蘭政府提供 Daybreak 計劃訪問權限,以支持民用基礎設施的網絡防禦,並提到此前在歐洲的類似部署。
特朗普將在今日晚些時候會見習近平,人工智能預計成為三天訪問的核心議題。與此同時,伯尼·桑德斯和格雷格·卡薩爾將提出法案,禁止人工超級智能並設立聯邦AI監管機構。聯合國秘書長古特雷斯呼籲美中建立類似冷戰時期的AI對話渠道。
美國總統特朗普在紐約聯合國大會期間首次與英國首相安迪·伯納姆面對面會晤,稱兩國關係在伯納姆領導下比斯塔默時期“更好”,並讚揚伯納姆是“天生的商人”,儘管雙方在人工智能監管、查戈斯羣島和伊朗戰爭等問題上存在緊張。
本文從機制層面拆解檢索增強生成(RAG)與微調的區別,指出二者解決的是兩類不同問題,並給出兩個可運行的代碼示例與一套六點決策框架,説明何時該用 RAG、何時該用微調,以及何時兩者都需要。
OpenAI首席執行官山姆·奧特曼在聯合國安理會發表講話,闡述AI既可能帶來“新文藝復興”也可能引發“新工業革命”式動盪,警告失去控制與權力集中兩大風險,提出以人為本的三項原則,並呼籲建立國際前沿AI標準、事件報告機制與安全信息共享渠道。
一篇 arXiv 機器人學預印本提出兩項基於角動量的指標,並通過為期一年的空手道迴旋踢縱向研究,比較穩定與不穩定踢擊以及專家教練的數據,以探索人體動態旋轉穩定性及其對機器人和外骨骼的啓示。
GINIO 是一個面向神經慣性里程計的 SO(3) 等變接口,確保學習到的運動測量在任意 IMU 安裝旋轉下按向量與二階張量規律變換。它通過 Last-Frame Alignment 實現傳感器座標系訓練,並分離 IMU 偏置等局部狀態,在 TLIO、NanoBench 和 Fetch 上取得顯著 ATE 改善,包括無需重訓練的物理重安裝魯棒性。
該論文放棄長期沿用的"平坦海底"近似,改用多視圖幾何方法,形式化並證明了一個雙視圖約束:同一共享特徵必須落在球面與平面交線上的一段軌跡內。作者通過蒙特卡洛仿真刻畫了該歧義軌跡的長度規律,並給出面向水面船隻與水下潛航器的測量規劃建議。
這篇 arXiv 論文提出 DTV-INR,將座標驅動的隱式神經表示(SIREN)與基於結構張量的各向異性全變差正則項結合,把連續到離散的採集過程建模為不適定逆問題。作者在 H^1(Ω) 中證明了變分解的適定性,並用交替投影優化算法解耦網絡參數與自適應張量場更新。在臨牀腦部 MRI 與生物醫學透射電鏡數據上,方法在連續非整數上採樣下取得最高 +5.05 dB 的 PSNR 提升,並展現對噪聲的良好魯棒性。
該研究利用公開鞋外底印痕數據集,比較CNN遷移學習與傳統特徵分類在二分類性別推斷中的表現。採用按鞋劃分的訓練/測試集以減少重複掃描導致的數據泄漏;微調CNN整體表現最佳,並優於僅用手工特徵的傳統分類器,凍結核特徵方法則計算成本更低。探索性分析顯示低維CNN表示與頻率閾值比、圖像對比度及小波統計量相關,但實際應用前仍需獨立樣本和案件型印痕驗證。
MirrorDistill 是一種用於低光圖像增強的照明感知潛在蒸餾框架。它在訓練階段通過特徵鏡像連接低光域與乾淨域,在推理階段僅保留輕量級學生編碼器-解碼器。該方法在 LOL-v2-Real 上取得優於當前最佳方法的結果,同時計算複雜度(GMACs)最低,並在 LOL-v1 與 LOL-v2-Synthetic 上保持競爭力。
arXiv 上新發布的論文提出 Segment-Snap 框架,通過部件與把手的物理關聯,把可動部件分割、運動約束與可操作區域預測耦合起來。在 Articulate3D 驗證集上,把手引導使運動門控 AP 從 13.74% 提升到 40.98%,完整上下文下把手 AP 達到 30.99%。
arXiv 新論文提出一種質量約束的圖像編碼方案:在保證人類觀察質量達到預設可接受水平後,把剩餘碼率用於提升機器視覺任務表現。作者將聯合壓縮—分割訓練重構為約束優化問題,並設計絕對函數與雙線性函數兩種懲罰項;實驗顯示,在相同任務性能下,相比無約束聯合率—失真—任務優化和簡單率—失真基線,BD-rate 分別降低 22.82% 和 29.81%,且未增加複雜度。
arXiv 新論文提出 SPARC,一種利用超像素在增強圖像視圖之間建立區域對應關係的區域級對比學習框架。它在圖像級目標之外聯合優化區域級對比目標,在語義分割上最高提升 9.79 mIoU,在目標檢測上最高提升 4.88 AP,優於 MoCo-v2 和 DenseCL。
這項研究把歐洲央行和美聯儲的新聞發佈會視為有結構的敍事,而非單純的信息發佈。作者沿貨幣政策立場、經濟前景和不確定性三個維度為每場發佈會構建“情感弧線”,用以檢驗情感在整篇聲明中的走向與強調方式是否攜帶政策信號。結果表明,弧線形態在預測政策利率變動方面穩健優於基於詞典的平均語調基準;弧線特徵還會影響專業預測者對通脹預期的修正幅度以及彼此之間的分歧程度,説明存在獨立於直接政策信號的“接收方效應”。作者據此認為,溝通設計——政策語言在聲明中的排序與強調——是政策信號的一階特徵,而非二階修飾。
一篇新論文探討歷時詞嵌入能否從現代高資源語言遷移到古梵語。作者構建了覆蓋四個經典時期的270萬詞元語料,用神經字節級連聲拆分器和詞形還原器恢復詞邊界,並按時期訓練嵌入。在21項可測試的語義變遷中,19項方向與文獻學考證一致(符號檢驗 p=0.00011)。
一篇新論文以 TF-IDF 加線性分類器為測量工具,對 ISOT/Kaggle「Fake and Real News」語料庫做可復現審計,發現其超過 0.98 的準確率與 F1 主要來自元數據、來源標籤和重複文檔等捷徑,而非對新聞真實性的判別能力;在主題不重疊的設定下性能大幅下降,遷移到獨立基準 LIAR 後更是接近隨機水平。
研究者提出一種數據驅動框架,將相對階條件顯式融入學習過程,從而訓練反饋線性化控制器。該方法用神經李導數替代傳統反饋控制器組件,實現完全數據驅動的反饋線性化,並給出在辨識誤差有界時跟蹤誤差有界的充分條件,最後在電樞控制直流電機上驗證。
arXiv 預印本(2026年9月21日提交)由 Tianfeng Chen 和 Xianyue Li 撰寫,頁面標題為《用於最大獨立集的雙GNN多級粗化》,但摘要介紹的是面向歐幾里得旅行商問題的圖邊稀疏化(GES)方法。該方法利用幾何結構與組合優化技術為不同實例自適應生成稀疏圖,在 MATILDA 數據集上最多可剪除 95% 的邊,並在部分大規模 TSPLIB 實例上剪除率超過 99%,同時最優性差距保持在 1% 以內。
該論文提出層正則化(sheaf regularization)來抑制 Decentralized SyncMap 這一自組織系統中的局部不一致,從而穩定無監督持續分塊過程。實驗顯示,該在多數概率性 CGCP 圖上取得最高歸一化互信息(NMI),並在輸入分佈發生偏移後仍能保持較高表現,同時避免神經網絡等系統常見的負遷移。
一篇新的 arXiv 論文指出,均勻離散流雖然允許在每個生成位置反覆更新,但持續的修正也會讓原本正確的中間預測被後續錯誤覆蓋——在數獨實驗中,9.4% 的生成格子在中途正確、最終卻錯誤。作者提出 LEDFlow:一種無需訓練的採樣器,通過"選擇性吸收"把生成順序引入均勻離散流,並按局部熵自適應決定吸收順序,從而避免固化錯誤預測。該方法在數獨求解上達到 0.845 的 Nikoli 準確率,在文生圖和六項多模態理解基準上均取得提升,推理成本與標準流採樣相當。
研究人員發佈 IntLawNER,一個面向國際法成文文本的命名實體識別數據集與評測基準,涵蓋國際法院、聯合國安理會和歐洲人權法院的 2,987 條金標句子與 8,094 個實體跨度。論文還揭示領域專用 NER 中銀標到金標的質量評估陷阱,並給出多種模型的基準表現。
一篇新論文提出售價約88美元、完全離線運行的AI智能手杖,在Raspberry Pi Zero 2W上融合RGB視覺與ToF測距,通過距離相關的振動觸覺反饋與語音提示協助視障人士避障。室內測試宏平均F1為0.82,端到端平均延遲約330毫秒,峯值功耗2.8瓦,12人初步可用性研究給出SUS 78.5的正面評價。
麻省理工學院長期支持者帕特里夏和詹姆斯·波伊特拉斯捐贈1000萬美元,通過波伊特拉斯精神疾病研究中心設立50個兩年期獎學金,未來十年每年資助5名研究生和博士後研究嚴重精神疾病,並使其對MIT心理健康研究的累計支持超過1億美元。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:See how LangSmith helps healthcare AI teams turn clinical review into reusable evaluators, datasets, and release gates for safer AI in production.
風投公司 Andreessen Horowitz(a16z)正在籌建“Horowitz Andreessen Academy”,將其定位為年輕人創辦或加入硅谷初創公司的輸送管道。該項目由 a16z 領投 4200 萬美元,首批合作伙伴包括 Anduril、Anthropic、Coinbase、Google、Meta、NVIDIA、OpenAI、Palantir、Replit 和 Stripe,計劃於 2027 年秋季啓動首個免費一年制項目,僅招收 50 名學生,主要面向應屆高中畢業生。學院不授予學位或認證,學生將參加由 Sam Altman 等科技人物主講的短期課程,並在科技公司進行 co-op 實踐;校方承諾不設傳統成績、考試或作業,同時提供超過 5 萬美元算力額度和 5000 美元差旅研究預算。學生需搬到舊金山並自行解決住房。