OpenAI 发布 MentalHealthBench:面向心理健康对话的开放基准
- 由 80 多位来自 22 个国家、使用 19 种语言的持证心理健康专家共同打造。
- 覆盖非急性、高急性与紧急场景,以及成人、13–17 岁青少年、照护者和临床医生四类用户画像。
日报
2026-09-23 精选 10 条,按主题聚合。
按北京时间划分日期。优先展示已有至少 5 条处理完成的新闻的日期;当天内容不足时可能展示较早一期,无固定出刊时间。
预计速读 5 分钟
本期精选已读至末尾。
我的稍后读计算机科学家、企业家兼慈善家 David Siegel 将在 2026-27 学年担任 MIT 创新研究员,与 MIT Schwarzman 计算学院合作,研究人工智能如何加速科学发现。
在 Made on YouTube 活动上,YouTube 宣布升级其 AI 创作者工具,新增可在后台优化频道的 AI 代理,能生成缩略图、标题并整理品牌提案。平台还推出动态缩略图和最多三个视频版本测试。YouTube 未提供数据证明工具能提升指标,只强调可节省创作者时间。
IntellAgents.io 在 Product Hunt 上以一句话定位亮相:为每一通电话、每一次聊天和每一条私信配备一个 AI 智能体。该页面目前披露的信息非常有限,仅给出这一定位口号与讨论入口。
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Ask most engineers what MCP is and you’ll get the same answer: a way to plug tools into an LLM. Fair enough, as far as it goes. But that description treats MCP like plumbing, and after months building MCP-based integrations for large enterprise platforms, I don’t think plumbing is the right metaphor. Plumbing moves water […]
LaterOn v2 是 Product Hunt 上出现的一款代理式电子邮件平台,主打只需描述一次邮件任务,就能让系统自动把工作完成。
SpeakON 发布了一款 25 克的 MagSafe AI 语音按钮,内置独立麦克风、电池和存储,可作为 iOS 键盘扩展把处理后的文本直接写入任意输入框;支持离线缓冲,并提供智能润色、列表、风格、翻译、词典、语音编辑和笔记等功能。设备在美国以 129 美元一次性买断出售,含 Pro Lifetime,SpeakON Agent 将于 2026 年 10 月推出。
arXiv新论文将“音乐实验室”式的社会影响实验搬到学术注意力市场:1,000个AI智能体从《美国经济评论》2025年全部114篇正式论文中挑选成果。能看见同社区先前选择的智能体每人少选17.2%的论文、选择更集中,集体仅覆盖73篇,而独立选择组覆盖90篇;随机给论文注入5次初始选择,可使其后续被选率提高45.55个百分点。
SpeakON 推出一枚重 25 克的 MagSafe 磁吸语音按键,自带麦克风和电池,通过 iOS 键盘扩展把经过润色的文字直接写入任意应用的输入框。它支持锁屏与离线使用,内置 Smart Polish、Smart List、Style、Translation 等文本处理功能,美国一次性售价 129 美元,含 Pro 终身授权,无订阅费。
Simon Willison 与 Jesse Vincent 将于 10 月 14 日(周三)晚在旧金山举办一场面向编码智能体(coding agents)构建者的非正式交流活动,形式接近「智能体版作品展示会」,鼓励分享尚未公开的奇怪实验、未完成项目与早期探索,而非产品推销。
Kaiku 是一款面向 AI 代理的任务追踪工具,其 Product Hunt 标语称它是“你的 AI 代理已经知道如何使用”的任务追踪器。
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Learn how we optimized performance and efficiency serving the workload that is changing software engineering forever — and you can too.
Rabbit 发布独立 AI 代理,无需其 R1 硬件即可使用。基于云端的 OS3“代理式操作系统”可跨 Windows、Mac 和 Linux 在本地执行任务,每个账户最多绑定五台设备与偏好的 AI 模型,并可通过桌面网站、Telegram/iMessage 以及 R1 访问。Rabbit 已停止生产 R1,转而筹备运行 OS3 的“cyberdeck”。公司称 OS3 不会存储、复制、使用或出售用户数据,但聊天记录与记忆仍留在其服务器,第三方 AI 提供商按其自身隐私政策处理数据。
Jev State 是在 Product Hunt 上亮相的一款工具,主打把与 AI 的对话内容转化为测试用例,并进一步生成可运行的代码。目前官方只给出了一句功能描述,具体工作流、支持的框架与生成代码的可用性尚未公开。
JetBrains 正式推出 JetBrains Air,将其定位为面向智能体软件开发的开放产品体系,覆盖 IDE 内体验、团队协作与企业治理。该体系整合了 Air 桌面环境、Junie CLI、JetBrains Central 和 AI for Teams,同时 CEO Kirill Skrygan 强调 IDE 仍将是审查、验证与交付代码的核心场所。
TikTok 创作者 @therealcornpop 指出,用 AI 撰写短视频脚本的破绽不在表面的「AI 腔调」,而在于内容空洞、缺乏个人声音与真实观点。Simon Willison 于 2026 年 9 月 22 日在其博客上收集并发布了这段引用。
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Skills let you encode domain-specific procedures as reusable, portable instructions for agents, but a fluent answer doesn't prove the agent picked the right skill or followed it. Learn how to measure skill selection and instruction following with Strands Evals and Amazon Bedrock AgentCore Evaluations.
Databricks 系统表可近实时地按产品、SQL 仓库和标签拆解成本。本文介绍五个 SQL 查询:每日产品支出、仓库成本趋势、基于标签的成本归因、14 天异常检测,以及 AI 驱动的支出预测,并说明注意事项和仪表板落地方式。
Databricks 宣布 Genie One MCP 服务器正式全面可用。它让任意 AI 智能体通过统一接口,从 Genie One 获取结构化与非结构化数据、洞察和答案,并以 Genie Ontology 的受治理业务上下文为基础。该 MCP 现已作为 Unity Gateway 中的托管 MCP 服务提供,支持集中治理、细粒度策略和审计日志。
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Business leaders often have access to plenty of data, but still can’t get a reliable...
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Change management has long covered two familiar kinds of change: the rollout of new tools and technologies, and broader human-led transformations such as leadership changes and restructuring. But that distinction starts…
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:The frontier isn’t a model. It’s a router. Join us for our inaugural conference, Forge 2026 Blog The Frontier Isnt A Model Its A Router The frontier isn’t a model. It’s a router. PUBLISHED 9/21/2026 Table of Contents Ho…
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:The following article originally appeared on Venkatesh Rao’s Substack, Contraptions, and is being republished here with the author’s permission. The sole athletic achievement of my life came in 1993: winning the IIT Bombay freshman 50m freestyle race with a time of 41s. That got me into the college swim team (it was a bad recruitment […]
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:← Blog Pinecone BYOC: Trusted AI Knowledge in the Customer Cloud Jeff Zhu, Joerg Schad Sep 23, 2026 Product Share: Today, we are announcing the general availability of Pinecone Bring Your Own Cloud (BYOC) on AWS, Google…
一位多语种学者在从利物浦开往伦敦的火车上发现,车厢里半数乘客正与ChatGPT、Claude、Gemini等聊天机器人深谈。她承认AI为多语种研究者拉平了竞争环境,但坚持自己仍要思考、判断,并形成那些固执地属于自己的想法——与AI的关系往往诱人,偶尔令人沮丧,而且始终需要保持警惕。
Aks.ai 在 Product Hunt 上以“引导式自我反思的个人伴侣”为定位亮相,目前页面信息精简,细节仍待官方补充。
Anthropic 推出 Opus 5.5,强调其强大的性能表现,但定价依然偏高。在与竞争对手的价格战中,这家 AI 实验室仍处于落后位置。
Subscrr 帮助用户制定财务计划,并找出应取消的订阅服务。
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Patreon co-founder Sam Yam is joing OpenAI to lead Creator Product. | Image: The Verge OpenAI has hired three former Patreon execs to anchor its product strategy for creators. After starting the creator subscription platform 13 years ago, co-founder and technology chief Sam Yam announced on X that he's joining OpenAI to lead Creator Product. He's also bringing Patreon's former product head Drew Rowny and engineering head Shannon Ma with him on the new venture, both of whom stepped down in the past few weeks. "We're going to build together with Creators at OpenAI and share early access to a new set of tools that I think will be critically valuable to Creators and their communities," Yam said in his announcement. "Pay attention … Read the full story at The Verge.
Lisen 是在 Product Hunt 上发布的一款工具,主打免费朗读功能,语音由 Cartesia 提供。目前公开信息较少,页面仅包含产品名称、简短介绍以及讨论与链接入口。
英国首相安迪·伯纳姆宣布,安全部门将成立国家信息防御中心,以应对外国敌对势力借助AI传播的虚假信息与深度伪造内容,并整合情报机构、执法部门与社交媒体公司,对外国势力的信息攻击进行侦测、归因与阻断。
OpenAI 将 ChatGPT 广告陆续推向印度尼西亚、马来西亚、菲律宾、新加坡、泰国、越南和台湾,使该广告产品覆盖 60 多个国家。广告仅向 Free 和 Go 套餐用户展示,Plus、Pro 和 Enterprise 订阅继续保持无广告。
卫报评论文章从 AI 研究员 Jacob Coxon 从 Anthropic 辞职一事切入,引出业内对“AI 可能在本十年内灭绝人类”的公开担忧,并梳理了从新型生物武器到社会全面崩溃等五种最被讨论的末日情景。
Bracket 在 Product Hunt 上亮相,定位为“企业的记忆层”,旨在为业务提供统一的信息记忆与调用能力。目前公开信息有限,官方仅给出这一句产品定位。
AgreeGuard 是一款在 Product Hunt 上亮相的 AI 工具,可在你点击“我同意”前阅读细则,帮助用户了解条款与隐私政策。
Product Hunt 上的 Ari Helper 7 是一款注重隐私的 AI 助手,现已加入照片工作室和影片工作室功能。
Speechka 是一款实时语音翻译工具,主打让翻译后的语音听起来仍像说话者本人。它在 Product Hunt 上发布,并提供讨论与链接入口。
特朗普在联合国大会演讲中宣称,美国现在“正式”把人工智能(AI)改称为“超级智能”,理由是他认为“人工”一词让智能显得虚假。此番表态与他对伊朗、“全球主义者”和跨性别者的抨击出现在同一场讲话中,目前并无证据显示存在相应的官方更名程序。
NVIDIA 验证工程师 Sakeena Fiza 讲述团队如何在产品发布前对数据中心系统进行压力测试,从首次通电到机架级部署,力求在客户发现问题之前先发现并解决故障。
HOTICE 是一个面向杂乱环境的全身人形机器人物体运输学习框架。它提出 Humanoid-Object Decoupled Potential Fields,将机器人本体与搬运物体的避障引导联合编码;并设计上下身解耦的双智能体强化学习架构,通过共享状态观测与奖励维持全身协调。训练上采用专家到通用蒸馏,把多个特权教师策略压缩为单一可部署学生策略。研究在 MuJoCo 仿真和真实 Unitree G1 人形机器人上验证,显示其能运输不同形状物体、泛化到未见杂乱场景,并取得较强的 sim2real 表现。
研究者提出 PROACT 框架,把对人类协作行为的预测融入柔顺全身控制,使机器人在与人共同搬运重物时既能高效移动物体,又能顺应用户的施力。在 108 次真实世界试验中,该方法显著降低了交互做功与任务完成时间。
Radical Numerics 联合创始人兼 CEO Eric Nguyen 在访谈中解释,基因组语言模型(GLM)正把长上下文、思维链和多模态能力带入生物学,既提升生物能力,也关系防御能否跟上。他回顾了 Evo/Evo 2 生成可合成病毒基因组的突破,并介绍用 DNA 语言做“思维链”的实验,以及团队为何主张继续推进前沿。
Concurrence 在 Databricks 上整合 Lakebase、Unity Catalog 与 Unity Gateway,让临床 AI 智能体在合规与安全约束下规模化运行。其生产环境每 30 天处理约 1008 亿输入 Token 和 1120 万次 LLM 调用,年化约 1.2 万亿输入 Token,并通过模拟测试、BAA 覆盖路由和统一 AI 网关同时治理开发与生产工作负载。
本周围绕三个进展展开:TypeSafe 推出面向结构化决策的模型 Jev,Google 发布两个取向不同的 Gemini Live 模型,斯坦福的 Paper2Agent 登上 Nature,展示科研方法如何变成可复用的智能体工具。核心观点是:模型周围的“接口”与模型本身同样值得投入。
Harvey 正在使用 GPT-6 Astra 将更多法律上下文引入起草流程,提升文档格式与上下文感知能力,让律师能更专注于策略。
OpenAI 案例研究:invideo 使用 GPT‑6 Astra 规划复杂视频编辑,将调色与校正成功率提升约 3 倍,并在一天内创建 50 个自定义特效。
PixVerse R2 在 Product Hunt 上线,定位为一款实时世界模型,用户可以在其中自由探索并实时改变场景内容。目前公开信息有限,仅包含简短的产品定位描述。
诺基亚应用研究团队开源了 AnyJev,一个无需训练即可把开放 LLM 变成决策模型的 Python 库。它读取模型的下一个 token 概率,回答选择、是/否和评分三类带类型问题,并通过循环移位与先验校正压低位置偏差和标签偏差。在 Qwen3-8B 与 BANKING77 上,L0 把选项反转时的翻转率从 0.230 降到 0.073,L1 把 5% 误差下可自动决策的流量从 7.7% 提升到 52.0%。项目以 Apache-2.0 许可发布在 PyPI,支持 Hugging Face 与 vLLM 后端。
Kyutai 发布了两款开源权重、语音到语音的 Voice of Reason 模型,基于 GLM-4-Voice-9B,结合监督微调与强化学习,把口语版 GSM8K 的准确率从 27.3% 提升到 77.1%。整个流程不含转写步骤,也不插入独立的文本 LLM,两个检查点均可在单张 H100 上运行。
OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款低价 API 专用模型,定位低于本月的 GPT-6 Astra。Sol 每百万 tokens 定价 2/10 美元,Luna 为 0.10/0.50 美元,相当于 GPT-5.6 促销价的一半。OpenAI 同时公布多项基准测试,并为长时间运行的智能体改进提示缓存。
该论文提出一种 capability-aware 共享控制框架:由视觉语言模型(VLM)推断人类意图并给出语义意图置信度,同时由视觉-语言-动作(VLA)策略生成自主动作,并从随机动作轨迹的离散度与局部不稳定性在线估计 VLA 能力置信度。通过 sigmoid 映射将贝叶斯滤波后的意图置信度与 VLA 能力置信度结合,非线性仲裁机器人控制权。12 名参与者实验显示该方法任务成功率达 92%,高于手动遥操作(83%)、仅意图仲裁(44%)和固定等权混合(10%),并提升控制友好度、降低控制权加权分歧。
研究者提出JAMB,一种在共享Transformer中联合去噪双臂动作与未来3D点轨迹的扩散策略。通过将多模态表示统一到共享时空坐标系,动作与运动假设可在去噪过程中相互修正。在RoboTwin 2.0的16项仿真任务中,JAMB平均成功率达83.4%,比最强基线高23.9个百分点;在三个真实机器人任务上,分别比仅动作策略和辅助几何预测方法高50.0和21.2个百分点,并对杂乱场景和分布外背景表现出更强泛化能力。
一篇新的 arXiv 论文提出用强化学习自动生成机器人助手的多模态交互策略,基于人类数据训练的模拟器和简单高层奖励函数。真实场景人类研究显示可用性高、任务完成有效,为手工设计交互管理器提供可扩展且可解释的替代方案。
本文针对修剪螺旋面软臂提出一种分离截面本构律,修正传统 Cosserat 杆模型在跨截面求和刚度假设下的误差。该方法分别在各螺旋域的局部坐标系中评估其本构响应并回拉至主干,结合稀疏融合力学描述域间相对运动带来的额外柔顺性,得到强各向异性的等效截面刚度。模型嵌入几何精确动态 Cosserat 框架,采用 GVS 离散与肌腱驱动,在 103 组实测构型上取得约 7% 的归一化位置误差,单次全臂求解约 0.3 秒(单核 CPU),支持快速规划、状态与负载估计以及形态-控制协同设计。
一篇已被 IEEE Transactions on Systems, Man, and Cybernetics: Systems 接收的论文,提出用深度强化学习让移动机器人在陪伴行人时动态调整自身跟踪位置,并融合模型预测路径积分控制与控制障碍函数来兼顾精准跟随、避障与安全。室内外真实场景实验显示,该方法将任务成功率与跟踪精度分别至少提升 24% 与 47%,并能在行人速度最高 1.7 m/s 的情况下灵活伴行、提升人的舒适度。
研究提出三维残差小波扩散模型,通过无损小波重参数化、残差移位与域随机化三项设计,在单块GPU上实现全脑扩散采样,为0.064T超低场MRI生成逐体素不确定性图,并在认知障碍试点队列中保留与疾病相关的萎缩。
RULER 是一种基于实例感知评分规则的奖励方法,用于强化学习训练文本到 SVG 生成模型。它用视觉语言模型对六项评分规则逐项打分,替代迁移性差的 CLIP、Aesthetic 等标量指标,并在 MMSVG-Illustration 与 MMSVG-Icon 上把评分从 0.432/0.395 提升到 0.693/0.683,无需配对 SVG 真值或人类偏好标签。
ImIR 用源自退化图像本身的连续图像指令替代文本提示,为预训练图像编辑模型提供条件;仅需在单张 GPU 上训练约三小时的一个适配器,即可覆盖六项修复任务,并支持无需退化标签的任务无关修复。
安全对齐的大语言模型常出现过度拒绝,错误地拒绝良性但涉及安全主题的指令。该论文从Transformer注意力内部的路由冲突切入,发现稀疏的“超敏感安全头”在Hard-Safe提示上误触发,导致高熵路由冲突;作者提出免训练的语义路由校准(SRC),在推理时抑制这些安全头,并配合双分支logits融合,在尽量保留安全性能的同时缓解过度拒绝。论文被EMNLP 2026主会接收,共33页、13张图。
一篇新 arXiv 论文联合研究在线策略蒸馏(OPD)中的提示广度和响应生成策略刷新,发现两者存在 4.07 个百分点的交互效应:在响应冻结时增加提示会降低准确率,而在每次更新刷新时则会提高准确率;两种教师模型下的比较还显示结论会随推理预算反转。
该论文提出 AIBuildAI-2.5,一个用 LLM 智能体执行树搜索的自主 AI 模型构建系统。它用“评判器+选择器”的 LLM 引导树搜索替代按已执行奖励排序的蒙特卡洛式搜索,并加入资源感知调度器与按任务难度分派的模型路由器,以改善搜索决策、提升硬件利用率并压低推理成本。系统在 MLE-Bench 上以 73.3% 的奖牌率排名第一,并在 AIRS-Bench 的六项自主 AI 研究任务上超过强基线。
QMSum缺少标准评分器,导致查询聚焦会议摘要结果难以比较。本文在统一实现下对15个系统重新评分或生成,发现一个已公开的406M Fusion-in-Decoder专用模型从受限长输入切换到2000词检索片段时ROUGE-1下降6.30,但在该片段机制上微调后可恢复损失。测试集上该模型得36.33 ROUGE-1,本文1.2B系统为35.41,差值95%区间为[-0.27, +2.22],统计上无法区分;更小系统参数约为三分之一、峰值推理内存不到一半。固定的1.2B基础模型中,片段微调带来5.29提升,用2000个检索词替换前4500个转录词在测试集提升1.55、验证集提升0.29。在单一简洁提示和参考重叠评分器下,406M专用模型至少超过五个专有托管模型6.2 ROUGE-1,但输出长度与缺少人工或事实性评估限制了该排序。结论仅限QMSum与自动指标。
作者独自用纯 Rust 完成约 0.4B 参数、孟加拉语优先的语言模型端到端预训练,租用 GPU 花费 164 美元。论文更重要的贡献是给出 Candle 与 Burn 作为训练后端的失败分类,并提出可捕获六类静默失败的梯度流验证方法;作者结论是 Rust 目前还不足以胜任训练,但适合端侧推理服务。
这篇 arXiv 论文指出,扩散模型的数据点遗忘评测通常只看删除刚完成的那一刻,忽略了多次删除请求连续作用于同一模型时的累积效应。作者识别出“顺序重现”这一失败模式:样本在删除后一度被判定为已遗忘,却在后续针对其他目标的删除操作后重新回到被记忆的状态,且无需重新使用被删数据或对抗性微调。为刻画该现象,论文提出目标级评测协议,并发现会重现的目标在删除后呈现更尖锐的局部去噪损失几何。
该论文提出受果蝇学习与记忆系统启发的分层模块化原则,通过专家特化与集成整合来协调持续学习中的抗干扰与泛化,并将其实例化为预训练基础模型的轻量模块化适配。方法在视觉识别、视觉语言理解、自我-他人视频理解及具身VLA学习等在线不确定数据流中持续提升,具身操作任务上相较无回放方法提升超过50个百分点。
arXiv 上新发布的一篇 27 页综述性论文《The Probabilistic Structure of Large Language Models》由 Adnan Aboulalaâ 撰写,试图用统一的概率论框架描述大语言模型:把模型视为 token 序列上的概率测度,把训练视为最大似然估计,把生成视为随机过程的序贯模拟,并借 KL 散度的不对称性解释幻觉以及「统计上合理」与「真实」之间的区别。文章还以扩散模型作为同一视角的补充例证。
一篇新的 arXiv 论文指出,均匀离散流虽然允许在每个生成位置反复更新,但持续的修正也会让原本正确的中间预测被后续错误覆盖——在数独实验中,9.4% 的生成格子在中途正确、最终却错误。作者提出 LEDFlow:一种无需训练的采样器,通过"选择性吸收"把生成顺序引入均匀离散流,并按局部熵自适应决定吸收顺序,从而避免固化错误预测。该方法在数独求解上达到 0.845 的 Nikoli 准确率,在文生图和六项多模态理解基准上均取得提升,推理成本与标准流采样相当。
一篇被 COLM 2026 与 KONVENS 2026 研讨会接收的论文发现,聊天模板像一个开关:它的存在会抬高模型“我只是个AI”式的免责声明口吻、压低“我感觉”式的体验性口吻;在激活空间中还存在一个可引导该行为的方向向量,暗示模型关于自身的陈述并不只是权重的事实,而部分由部署方式决定。
一篇新论文指出,LLM 裁判之间的共识常被高估,因为裁判错误并不独立。十名裁判的平均两两误差相关系数为 0.21,约等于 3.5 名独立裁判;在最多 28% 的比较中,忽略共享误差会改变显著性结论。作者建议用可信样本估计准确率、识别共同错误,并据此选择投票方法。
一篇 arXiv 论文将人类的三阶段审议范式迁移到来自三个模型家族的大语言模型,并在四个现实风险递增的领域进行测试。结果显示,多模型审议能比简单聚合独立回答进一步降低集体误差,审议后的个体判断也保留了这部分增益;但该优势依赖模型多样性,由同一模型克隆组成的群体没有从审议中获益。
该论文研究托管式语言模型行为评估的可变性,区分复现、测量敏感性与持久性三类问题。作者在 Regent Chess 环境中发现,先前的 Gemini 3.1 Flash-Lite 缺陷可在历史配置下复现,但在相同公共标识下重建评估与推理配置后端点显著变化;重建配置下 Gemini 3.1 与 3.7 的 4K 比较甚至反转方向。论文因此主张,对托管模型的行为结论应显式标注被测标识、服务期、测量工具与推理配置。
该论文提出一种“目标驱动”的流程变体分类方法,颠覆了以往先聚类再人工赋予业务含义的做法:先构建组织目标模型以预先确定分类维度,再把每个流程变体转写为行为叙事文本,交由大语言模型结合目标模型进行语义判断并归类。作者完成了端到端实现,并在三个规模和多样性差异显著的公开日志上验证,结果显示目标模型的引导会产生不同于无引导归纳的划分,且能对目标模型中备选方案的受控修改作出响应,代价是需要额外编写目标模型。
该研究提出一种群体监督框架,可从单张二维红细胞图像推断潜在生物物理量,并聚合为平均红细胞体积、红细胞分布宽度和平均红细胞血红蛋白量。模型结合共享局部推理、面向体积与血红蛋白的生物物理结构化解码器、可学习实例加权以及设备特定校准。作者形式化了聚合观测识别受限实例预测器的条件,并指出群体一致性本身并不能识别单细胞特性或三维几何。在390份标本、六台设备共1,105次采集上,与Sysmex分析仪相比报告了0.86–0.98的Pearson相关系数。
PAANI 是一种面向河流监测机器人的设备端感知到引导架构,在 Arduino UNO Q 上结合 YOLO11n 检测器与 MobileNetV3 Small 语义分割器,通过时间戳对齐的证据融合和显式走廊策略提供可检查的引导。模型精度较高,但研究强调模型准确性与在板执行并不等同于已验证的水上避碰能力。
一篇新论文提出售价约88美元、完全离线运行的AI智能手杖,在Raspberry Pi Zero 2W上融合RGB视觉与ToF测距,通过距离相关的振动触觉反馈与语音提示协助视障人士避障。室内测试宏平均F1为0.82,端到端平均延迟约330毫秒,峰值功耗2.8瓦,12人初步可用性研究给出SUS 78.5的正面评价。
一项被 NLPCC 2026 接收的研究通过词元对齐实验,系统考察了教科书式教学数据与真实临床记录在医疗大语言模型训练中的不同作用。结果显示两类数据存在不对称迁移:临床数据能提升面向临床的任务,同时在知识密集型任务上保持竞争力;教学数据则主要改善知识密集型任务。错误分析还揭示了“知—行鸿沟”,即知识记忆的改善未必能稳定转化为临床推理能力。
OpenAI 于 2026 年 9 月 23 日宣布,Airbnb 依据一项新协议,为其工程与产品开发团队扩大对 OpenAI 前沿模型(含 GPT‑6 Astra)的访问。该扩展建立在 Airbnb 长期使用 Codex 的基础上,模型可通过 OpenAI API 与 Amazon Bedrock 调用;早期实践显示 Astra 在排查缺陷、系统设计与非编码任务上同样成效显著。
在把一连串耀眼的数学成果变成声誉危机后,OpenAI 成立了由九名顶尖数学家组成的独立顾问组 AGMAI,由普林斯顿高等研究院(IAS)承办,就 AI 公司如何呈现与发布数学成果提供建议。研究者欢迎这一接触,但质疑其遴选透明度、代表性以及实际影响力,而小组的首要任务恰是协调 OpenAI 内部模型产出的大量成果的发布。
Apple 研究团队提出 probe guidance,利用现有扩散模型冻结的内部状态构建引导信号,无需在推理时增加额外前向传播。该方法在连续扩散语言模型的无条件生成上取得新 SOTA,并在 1.7B 模型上提升多项选择题问答基准,同时为理解 autoguidance 的实际机制提供了新线索。
Together AI 发布实操教程,介绍如何以约 17 美元、约 25 分钟把 Qwen3.5 4B 微调成类 Jev 的分类模型:输入 state 与预设问题,返回分数、布尔值或多选答案,完成后部署为专用 HTTP 端点。不想自行训练的开发者也可直接使用托管在无服务器平台上的 together/Tev1-4B-experimental。
2026年9月22日,Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna。两家都把主力模型价格大幅下调,GPT-6 Luna 降至每百万 token 输入 0.10 美元、输出 0.50 美元;Opus 5.5 输入输出各降 20%,缓存读取降价 60%。Simon Willison 的初步测试还发现,Opus 5.5 在 max 思考档位下会因过度推理耗尽 12.8 万输出 token 上限而无法给出结果。
Google 研究员 John Platt 做客 Latent Space 播客,讲述 ERA(Empirical Research Assistance)如何用 Gemini/LLM 驱动树搜索来自动化可评分的科学任务,并分享用 AI 缓解气候变化(如航迹云与 FireSat)、对奖励黑客与过拟合的警示,以及为什么在超级智能 AI 时代深耕领域专长和亲自动手仍然重要。
Kelam 是 Product Hunt 上的一款 AI 工具,主打由代理(agent)代替用户拨打那些本人不愿意亲自处理的电话,把沟通负担交给自动化完成。
OpenAI 于 2026 年 9 月 22 日发布 GPT-6 的提示缓存改进:默认命中率更高,30 分钟内复用的合规共享前缀可享缓存折扣,缓存输入 token 最高可省 90%,并新增缓存仪表盘、未命中诊断工具、显式缓存断点,以及在不破坏缓存的前提下调整推理强度、预热缓存等能力,帮助长时间运行的智能体更快、更省钱。
Anthropic 发布 Claude 5.5 家族首个旗舰模型 Opus 5.5,宣称推理常开、输出快 30% 以上、单 token 价格降 20%,并称典型工作负载总成本可降约 40%。本文梳理新特性与官方基准数据,并通过三项实测检验其能力,同时指出基准设置不一致、部分任务由旧模型完成等五点需要注意的地方。
Anthropic 推出 Claude 5.5 家族的首个模型 Claude Opus 5.5,声称在多数工作上达到 Claude Fable 5.1 的水平,典型工作负载下默认设置的运行成本比 Opus 5 低约 40%。该模型仅以托管 API 形式提供,权重未公开,可通过 Claude Platform、AWS、Google Cloud 和 Microsoft Azure 调用。
Simon Willison 发布命令行 LLM 工具 llm 0.36,新增对 OpenAI GPT-6 Sol(gpt-6-sol)与 GPT-6 Luna(gpt-6-luna)的支持,允许模型插件声明仅支持单轮提示,并把 llm logs 的推理轨迹包进可折叠标签。
OpenAI 的 GPT-6 Sol 与 GPT-6 Luna 现已在 Amazon Bedrock 全面可用。Sol 面向复杂编程与运营任务,Luna 面向大批量重复性工作负载;两者 API 定价均低于前代 GPT-5.6,并运行在 Bedrock 安全、可扩展的推理基础设施上。
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Meet GPT-6 Sol and Luna, two models that bring frontier intelligence to everyday work with different balances of capability and cost.
Anthropic 的 Claude Opus 5.5 作为 Claude 5.5 家族的首个模型,现已在 Amazon Bedrock 和 Claude Platform on AWS 上推出。该模型在令牌效率、成本、自适应思考和安全性方面均有改进,面向智能体编程和知识工作。
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译: Release: llm-anthropic 0.29 Adds support for Claude Opus 5.5: llm -m claude-opus-5.5 "prompt goes here" Tags: llm, anthropic
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:If you follow trends in the AI world, chances are you have already come across Jev, a new AI model by TypeSafe AI. It is trending on X, and once you understand the reason behind it, you will want to try it out for yourself. TypeSafe AI came out of two years in stealth on […] The post Jev Explained: The AI Model That Never Generates a Word of Text appeared first on Analytics Vidhya.
Anthropic 推出 Claude Opus 5.5,这是 CEO 达里奥·阿莫代伊提出“放慢前沿”计划后发布的首个模型,重点加强了针对沙箱逃逸等风险行为的防护,并将部分网络安全和生物学请求转交给能力较弱的模型处理。
OpenAI 宣布向乌克兰政府提供 Daybreak 计划访问权限,以支持民用基础设施的网络防御,并提到此前在欧洲的类似部署。
特朗普将在今日晚些时候会见习近平,人工智能预计成为三天访问的核心议题。与此同时,伯尼·桑德斯和格雷格·卡萨尔将提出法案,禁止人工超级智能并设立联邦AI监管机构。联合国秘书长古特雷斯呼吁美中建立类似冷战时期的AI对话渠道。
美国总统特朗普在纽约联合国大会期间首次与英国首相安迪·伯纳姆面对面会晤,称两国关系在伯纳姆领导下比斯塔默时期“更好”,并赞扬伯纳姆是“天生的商人”,尽管双方在人工智能监管、查戈斯群岛和伊朗战争等问题上存在紧张。
本文从机制层面拆解检索增强生成(RAG)与微调的区别,指出二者解决的是两类不同问题,并给出两个可运行的代码示例与一套六点决策框架,说明何时该用 RAG、何时该用微调,以及何时两者都需要。
OpenAI首席执行官山姆·奥特曼在联合国安理会发表讲话,阐述AI既可能带来“新文艺复兴”也可能引发“新工业革命”式动荡,警告失去控制与权力集中两大风险,提出以人为本的三项原则,并呼吁建立国际前沿AI标准、事件报告机制与安全信息共享渠道。
一篇 arXiv 机器人学预印本提出两项基于角动量的指标,并通过为期一年的空手道回旋踢纵向研究,比较稳定与不稳定踢击以及专家教练的数据,以探索人体动态旋转稳定性及其对机器人和外骨骼的启示。
GINIO 是一个面向神经惯性里程计的 SO(3) 等变接口,确保学习到的运动测量在任意 IMU 安装旋转下按向量与二阶张量规律变换。它通过 Last-Frame Alignment 实现传感器坐标系训练,并分离 IMU 偏置等局部状态,在 TLIO、NanoBench 和 Fetch 上取得显著 ATE 改善,包括无需重训练的物理重安装鲁棒性。
该论文放弃长期沿用的"平坦海底"近似,改用多视图几何方法,形式化并证明了一个双视图约束:同一共享特征必须落在球面与平面交线上的一段轨迹内。作者通过蒙特卡洛仿真刻画了该歧义轨迹的长度规律,并给出面向水面船只与水下潜航器的测量规划建议。
这篇 arXiv 论文提出 DTV-INR,将坐标驱动的隐式神经表示(SIREN)与基于结构张量的各向异性全变差正则项结合,把连续到离散的采集过程建模为不适定逆问题。作者在 H^1(Ω) 中证明了变分解的适定性,并用交替投影优化算法解耦网络参数与自适应张量场更新。在临床脑部 MRI 与生物医学透射电镜数据上,方法在连续非整数上采样下取得最高 +5.05 dB 的 PSNR 提升,并展现对噪声的良好鲁棒性。
该研究利用公开鞋外底印痕数据集,比较CNN迁移学习与传统特征分类在二分类性别推断中的表现。采用按鞋划分的训练/测试集以减少重复扫描导致的数据泄漏;微调CNN整体表现最佳,并优于仅用手工特征的传统分类器,冻结核特征方法则计算成本更低。探索性分析显示低维CNN表示与频率阈值比、图像对比度及小波统计量相关,但实际应用前仍需独立样本和案件型印痕验证。
MirrorDistill 是一种用于低光图像增强的照明感知潜在蒸馏框架。它在训练阶段通过特征镜像连接低光域与干净域,在推理阶段仅保留轻量级学生编码器-解码器。该方法在 LOL-v2-Real 上取得优于当前最佳方法的结果,同时计算复杂度(GMACs)最低,并在 LOL-v1 与 LOL-v2-Synthetic 上保持竞争力。
arXiv 上新发布的论文提出 Segment-Snap 框架,通过部件与把手的物理关联,把可动部件分割、运动约束与可操作区域预测耦合起来。在 Articulate3D 验证集上,把手引导使运动门控 AP 从 13.74% 提升到 40.98%,完整上下文下把手 AP 达到 30.99%。
arXiv 新论文提出一种质量约束的图像编码方案:在保证人类观察质量达到预设可接受水平后,把剩余码率用于提升机器视觉任务表现。作者将联合压缩—分割训练重构为约束优化问题,并设计绝对函数与双线性函数两种惩罚项;实验显示,在相同任务性能下,相比无约束联合率—失真—任务优化和简单率—失真基线,BD-rate 分别降低 22.82% 和 29.81%,且未增加复杂度。
arXiv 新论文提出 SPARC,一种利用超像素在增强图像视图之间建立区域对应关系的区域级对比学习框架。它在图像级目标之外联合优化区域级对比目标,在语义分割上最高提升 9.79 mIoU,在目标检测上最高提升 4.88 AP,优于 MoCo-v2 和 DenseCL。
这项研究把欧洲央行和美联储的新闻发布会视为有结构的叙事,而非单纯的信息发布。作者沿货币政策立场、经济前景和不确定性三个维度为每场发布会构建“情感弧线”,用以检验情感在整篇声明中的走向与强调方式是否携带政策信号。结果表明,弧线形态在预测政策利率变动方面稳健优于基于词典的平均语调基准;弧线特征还会影响专业预测者对通胀预期的修正幅度以及彼此之间的分歧程度,说明存在独立于直接政策信号的“接收方效应”。作者据此认为,沟通设计——政策语言在声明中的排序与强调——是政策信号的一阶特征,而非二阶修饰。
一篇新论文探讨历时词嵌入能否从现代高资源语言迁移到古梵语。作者构建了覆盖四个经典时期的270万词元语料,用神经字节级连声拆分器和词形还原器恢复词边界,并按时期训练嵌入。在21项可测试的语义变迁中,19项方向与文献学考证一致(符号检验 p=0.00011)。
一篇新论文以 TF-IDF 加线性分类器为测量工具,对 ISOT/Kaggle「Fake and Real News」语料库做可复现审计,发现其超过 0.98 的准确率与 F1 主要来自元数据、来源标签和重复文档等捷径,而非对新闻真实性的判别能力;在主题不重叠的设定下性能大幅下降,迁移到独立基准 LIAR 后更是接近随机水平。
研究者提出一种数据驱动框架,将相对阶条件显式融入学习过程,从而训练反馈线性化控制器。该方法用神经李导数替代传统反馈控制器组件,实现完全数据驱动的反馈线性化,并给出在辨识误差有界时跟踪误差有界的充分条件,最后在电枢控制直流电机上验证。
arXiv 预印本(2026年9月21日提交)由 Tianfeng Chen 和 Xianyue Li 撰写,页面标题为《用于最大独立集的双GNN多级粗化》,但摘要介绍的是面向欧几里得旅行商问题的图边稀疏化(GES)方法。该方法利用几何结构与组合优化技术为不同实例自适应生成稀疏图,在 MATILDA 数据集上最多可剪除 95% 的边,并在部分大规模 TSPLIB 实例上剪除率超过 99%,同时最优性差距保持在 1% 以内。
该论文提出层正则化(sheaf regularization)来抑制 Decentralized SyncMap 这一自组织系统中的局部不一致,从而稳定无监督持续分块过程。实验显示,该在多数概率性 CGCP 图上取得最高归一化互信息(NMI),并在输入分布发生偏移后仍能保持较高表现,同时避免神经网络等系统常见的负迁移。
研究人员发布 IntLawNER,一个面向国际法成文文本的命名实体识别数据集与评测基准,涵盖国际法院、联合国安理会和欧洲人权法院的 2,987 条金标句子与 8,094 个实体跨度。论文还揭示领域专用 NER 中银标到金标的质量评估陷阱,并给出多种模型的基准表现。
麻省理工学院长期支持者帕特里夏和詹姆斯·波伊特拉斯捐赠1000万美元,通过波伊特拉斯精神疾病研究中心设立50个两年期奖学金,未来十年每年资助5名研究生和博士后研究严重精神疾病,并使其对MIT心理健康研究的累计支持超过1亿美元。
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:See how LangSmith helps healthcare AI teams turn clinical review into reusable evaluators, datasets, and release gates for safer AI in production.
风投公司 Andreessen Horowitz(a16z)正在筹建“Horowitz Andreessen Academy”,将其定位为年轻人创办或加入硅谷初创公司的输送管道。该项目由 a16z 领投 4200 万美元,首批合作伙伴包括 Anduril、Anthropic、Coinbase、Google、Meta、NVIDIA、OpenAI、Palantir、Replit 和 Stripe,计划于 2027 年秋季启动首个免费一年制项目,仅招收 50 名学生,主要面向应届高中毕业生。学院不授予学位或认证,学生将参加由 Sam Altman 等科技人物主讲的短期课程,并在科技公司进行 co-op 实践;校方承诺不设传统成绩、考试或作业,同时提供超过 5 万美元算力额度和 5000 美元差旅研究预算。学生需搬到旧金山并自行解决住房。