AI News HubLIVE

政策动态

索尼起诉Udio AI音乐生成器侵犯3万首歌曲版权

索尼音乐娱乐再次起诉AI音乐生成器Udio,指控其侵犯了超过3万首歌曲的版权,包括猫王的《Hound Dog》、碧昂丝的《Say My Name》和哈里·斯泰尔斯的《As It Was》。索尼称这份名单只是侵权行为的一小部分。

  • 索尼起诉Udio侵犯3万首歌曲版权,涵盖猫王、碧昂丝等艺人。
  • 此前诉讼仅涉及333首作品,新诉讼扩大了范围。
站内正文

OpenAI广告收入目标或差90%

营销咨询公司Emarketer分析显示,OpenAI的五年广告收入预测可能低估90%,整个聊天机器人广告市场的总规模仅为54亿美元。到2026年,包括OpenAI、微软、谷歌和亚马逊在内的顶级AI公司广告总收入将不足10亿美元。OpenAI要实现其2030年广告收入1000亿美元的目标,需要三个奇迹同时发生。

  • OpenAI五年广告收入预测可能低估90%
  • 聊天机器人广告市场总规模仅为54亿美元
站内正文

OpenIngress:一款检测AI代理能否正常访问网站的开源工具

OpenIngress 通过模拟浏览器行为爬取网站,捕获 DOM、截图和无障碍快照,并进行静态可操作性分析和 LLM 引导的探索任务,帮助开发者发现并修复 AI 代理在网站导航中的断点。

  • 使用 Playwright 进行广度优先爬取,获取页面 DOM、截图和无障碍快照。
  • 进行静态可操作性分析,评估标签覆盖率和 hydration 状态,识别缺失标签或 JavaScript 依赖等问题。
站内正文

29天26个仓库:AI流水线中真正出问题的并非代码

一位开发者使用 Claude Code 在 29 天内构建了 26 个仓库和 335 个页面。真正的问题并非语法错误或构建失败,而是结构性缺陷:SEO 关键词冲突、URL 约定不一致、源码与生产环境脱节、以及验证工具自身的错误。93% 的 token 消耗浪费在重新读取上下文上。经验教训包括:发布前基准测试、复制前比对差异、先验证生产环境再信任静态分析、在扩展前书面约定规则、以及一次会话只做一件事。

  • 尽管产出惊人(26个仓库、1,549次提交),AI流水线的失败是结构性的而非语法性的。
  • 问题包括SEO关键词自相残杀、URL约定漂移、源码与生产环境脱节、以及验证工具自身带有缺陷。
站内正文

AI语音钓鱼诈骗:成本低廉,效果媲美人类骗子

一项大规模人类受试者研究(n=4100)发现,AI语音模型在语音钓鱼诈骗中的成功率与人类骗子相当,在某些情况下甚至超越人类。多达36%的参与者可能上当,且AI语音难以被识别。经济分析表明,AI语音钓鱼已具有盈利潜力,凸显了自动化诈骗的新威胁。

  • AI语音模型在情感诈骗场景中成功率高达36%,整体成功率为16.5%。
  • 参与者无法有效区分AI与人类语音,AI检测准确率仅70.3%。
站内正文

你的指数基金中的SpaceX:解析

本文探讨了SpaceX快速纳入纳斯达克100指数对指数基金投资者的影响。文章解释了指数基金的工作原理,讨论了人们对埃隆·马斯克治理方式的担忧,以及投资者是否应担心市场中的人工智能集中度。

  • SpaceX在IPO后不久被纳入纳斯达克100指数,迫使指数基金买入其股票。
  • 指数基金被认为是安全的投资方式,即使包括高风险股票如SpaceX。
站内正文

Seedance 2.0 能否绘制2D?动漫动画的攻略

本文分析了Seedance 2.0在2D动画生成中的挑战和优势,包括技术难点、成本、工作流程以及版权问题。

  • 2D动画比3D更难处理,线条和颜色容易出现闪烁和变形。
  • Seedance 2.0支持15秒多镜头输出,9张参考图锁定角色,以及原生双通道音频和8种以上语言的唇音同步。
站内正文

我们所知的数学能否在人工智能时代幸存?

人工智能在数学领域取得惊人进展,从国际奥数金牌到解决数十年未解难题,引发数学家对学科未来的深刻担忧。《莱顿宣言》提出23点计划,呼吁保持数学以人为中心。数学家们对于是否接受AI、如何理解AI证明等问题存在分歧,并担心AI实验室对研究方向的控制。

  • AI已能解决博士级数学问题,速度远超人类
  • 《莱顿宣言》由3000多人签署,包括陶哲轩等顶尖数学家,旨在保护数学的人文性
站内正文

政府可征用私人土地建设AI数据中心输电线路

据《对话》报告,为满足AI数据中心激增的电力需求,电力公司可动用征用权强制购买私人土地以建设输电线路。美国已有数千个数据中心运营,但民众因土地、噪音、水耗等问题反对建设。征用权需证明公共用途,各州解释不同。2026年第一季度已有75个数据中心项目被成功阻止。

  • 电力公司可依据征用权强制购买私人土地用于建设AI数据中心输电线路。
  • 70%的美国人反对在附近建设数据中心,主要担忧包括土地、噪音、水耗和电力消耗。
站内正文

人工智能如何重塑受监管的专业工作流程

受监管行业(如金融、法律、税务和审计)对AI的采纳面临零容错率的要求。斯坦福研究发现通用语言模型在法律问题上的幻觉率高达58%-88%。AI必须满足受托责任级别的准确性、数据保护和人为签核要求,才能安全部署。文章提炼了四个关键洞察:准确性标准、工作流自动化、数据保障和明确的责任划分。

  • 受监管行业要求AI输出必须达到专业人员的准确性标准,通用模型无法满足。
  • AI可以大幅减少监管文件准备等劳动密集型流程的工作量,但最终责任仍由专业人员承担。
站内正文

AI红队测试:保护自主AI系统安全

随着AI系统具备推理、使用工具、访问数据和自主行动的能力,传统安全方法已不足以应对新型攻击面。本网络研讨会探讨为何AI驱动的对抗性测试正成为AI安全的关键环节。

  • 自主AI系统创建了全新的安全与隐私风险
  • 传统基准测试、渗透测试和静态评估无法覆盖AI特有的攻击模式
站内正文

谁在害怕中国模型?

本·汤普森提出美国应立法明确训练数据为合理使用,并禁止禁止蒸馏的服务条款,以帮助美国开源模型与中国模型竞争。同时,阿里巴巴决定发布Qwen 3.8 Max开源权重,可能受习近平鼓励开源合作的讲话影响。

  • 本·汤普森建议美国立法将训练数据收集定为合理使用,并禁止禁止蒸馏的服务条款。
  • 蒸馏(即查询API)几乎无法阻止,美国应转变政策,鼓励通过训练成果推动创新。
站内正文

IssueBench – 如何评估引擎

LangChain 构建了 IssueBench,这是一个合成基准测试,用于评估 LangSmith Engine 在代理轨迹中识别、分类和分组问题的能力。本文介绍了 IssueBench 的构成、评分方式以及构建过程中的经验教训。

  • IssueBench 包含 15 个任务,涉及 SRE 日志分析、软件工程和客户支持三个领域。
  • 引擎需要识别问题、分配失败类别、关联到现有问题并分组新故障。
站内正文

Open Minis:我梦想中Siri AI本应成为的iOS智能代理

Open Minis是一款深度集成苹果原生框架的iOS智能代理应用,它通过内置Linux终端和专门的命令行接口,实现了对日历、家庭、健康、照片等系统组件的精准控制。作者展示了它如何调用HomeKit传感器数据、结合照片与健康信息,甚至创建交互式地图,其能力远超当前Siri AI,堪称前沿模型与iOS系统能力结合的典范。

  • Open Minis利用iSH Linux终端和苹果官方API,为LLM提供了对iOS系统框架的深度访问。
  • 它支持几乎所有主流AI模型,并允许用户通过自然语言自定义工作区、安装工具和扩展。
站内正文

快速测试:您的AI项目是否触发欧盟AI法案?

这是一个为初创企业设计的快速测验,帮助判断其AI项目是否受欧盟AI法案的监管。

  • 测验旨在识别AI项目是否属于高风险类别。
  • 针对初创企业,简化合规评估流程。
站内正文

为什么我仍然推荐群晖DS225+ NAS——即使它不能替代你的云存储

硬盘价格飙升让NAS变得小众,但群晖DS225+依然值得推荐。本文分析了NAS成本上涨的原因(AI数据中心需求),对比了云存储的优势,并指出了NAS的适用人群。最终推荐DS225+,因其2.5GbE端口、SHR磁盘管理和优秀的DSM软件,尽管存在一些厂商限制。

  • AI数据中心需求导致硬盘和内存价格暴涨,NAS成本增加。
  • 云存储(如iCloud、Dropbox)价格稳定且方便,但仍需结合NAS使用。
站内正文

Spark 4.2 新增功能:或可淘汰你的向量数据库

Apache Spark 4.2 发布,新增原生向量搜索、治理指标、流处理升级和 Python 支持增强,使 Spark 扩展为 AI 服务层,减少对独立向量数据库的需求。

  • Spark 4.2 引入原生向量搜索,支持相似度查询,减少数据迁移。
  • 治理指标视图统一业务指标定义,避免冲突。
站内正文

旧金山餐厅因AI菜单图片遭愤怒抵制

旧金山一家新开的餐厅因使用AI生成的菜单图片而遭到社区强烈批评,甚至被涂鸦破坏。店主不得不撤下图片,并计划通过社区活动重建声誉。

  • AJ和Lyndsey Lozano在Haight Street新开的Grind & Unwind餐厅因AI菜单图片引发争议。
  • Reddit帖子批评这些图片像“垃圾食品”,社区反应强烈,甚至出现涂鸦破坏。
站内正文

构建受治理的AI代理:成本、控制与合规框架

AI代理正成为生产基础设施的一部分,但随之而来的是治理挑战。本文提出了一个框架,通过LLM网关在运行时强制执行策略,涵盖安全性、身份认证、审计日志、数据隔离等基础,并提供了三种常见切入点(可见性主导、控制主导、保证主导)。网关与追踪、评估、监控系统集成,实现持续改进。

  • 治理需要运行时控制平面(LLM网关)来强制执行模型调用、工具调用和代理交互中的策略。
  • 基础包括安全性、身份认证、审计日志、用户管理、提供商密钥、数据分离和数据驻留。
站内正文

Jaron Lanier:没有人工智能(2023)

Jaron Lanier 认为“人工智能”一词具有误导性,大型语言模型只是人类创作数据的统计混合体,并非独立智能。他主张将 AI 视为工具而非生物,并提倡数据尊严和透明度以管理技术风险。

  • Lanier 驳斥 AI 是独立智能的观点,认为它是人类作品的统计重组。
  • AI 被视为工具而非生物,能更有效管理风险。
站内正文

Show HN:构建一个面向人类和AI代理的产品

本文介绍了作者与其联合创始人Lav构建Competitor Tracker的经历,这是一个专为人类和AI代理设计的竞争对手追踪工具。作者探讨了AI如何改变产品开发的瓶颈,从开发转向市场推广,并分享了从失败到成功的历程。产品提供API、MCP、Web仪表盘和每周摘要,支持人类和代理共同使用。

  • AI将产品开发的瓶颈从开发转移到了市场推广,使得构建更快但销售更难。
  • Competitor Tracker是一款追踪竞争对手并发送每周摘要的工具。
站内正文

如何招聘AI原生产品经理

传统的招聘流程在AI时代失效,因为AI可以轻易生成精美的简历、案例和作业。文章基于Anthropic、Ramp、Notion、Stripe等公司的实际招聘实践,提出了一套全新的招聘方法:从职位描述到面试各环节,重点考察候选人运用AI和纠错的能力,而非文档质量。

  • AI让传统招聘流程的信号失效,因为候选人的产出可以被AI粉饰。
  • 领先公司已转向评估候选人如何与AI协作和纠正AI错误。
站内正文

高性能智能编程:Claude Code 初学者设置指南

本文介绍如何配置 Claude Code 以获得高性能的智能编程体验,涵盖安装、权限、钩子和命令习惯,帮助你充分利用这一工具。

  • 正确安装:使用原生安装器或 npm,并在项目目录中启动。
  • 核心配置文件:CLAUDE.md、settings.json 和自动记忆功能。
站内正文

如何检查ChatGPT和其他AI工具是否引用你的网站——并提高2026年被引用的机会

AI搜索流量在2025年增长了66%,但仍不到总访问量的0.15%。即使没有直接点击,AI引用也能提升品牌曝光。本文介绍如何检查你的网站是否被AI引用,以及如何通过优化内容、设置llms.txt文件等策略提高被引用的机会。

  • AI流量在2025年增长了66%,但仅占网站访问量的不到0.15%。
  • AI引用能带来品牌曝光,即使没有直接流量。
站内正文

不对称问题:AI安全措施主要给好人添麻烦

HuggingFace最近的事件揭示了AI安全防护措施的根本不对称性:它们阻碍了防御者,而攻击者则不受限制地操作,迫使防御者依赖开源模型进行取证分析。

  • HuggingFace的取证分析被商业模型的AI护栏阻止,迫使他们使用开源模型GLM 5.2。
  • 攻击者不受使用政策限制,甚至可以注入触发策略的内容来干扰AI分析。
站内正文

AI是最好的联合创始人

文章作者认为,AI可以像联合创始人一样帮助创业者填补技能空白,使单人创业变得可行。他建议先独自利用AI搭建产品,与客户交流,等到真正遇到瓶颈时再考虑引入人类联合创始人。这并非否定人的价值,而是主张在产品验证之前不要过早增加永久合伙人。

  • 使用AI可以完成市场研究、原型开发、测试、营销等多种工作,无需股权或决策权。
  • 联创关系复杂,错误的合伙人可能毁灭公司,应慎重。
站内正文

RTK hook 让编码代理更贵,而非更便宜

JetBrains 对“Rust Token Killer”(rtk)进行了严格的 A/B 基准测试,发现其声称的 60-90% token 节省并未实现。在低推理成本下,中位数成本反而增加了 7.6%,而在高推理成本下则无显著变化。测试揭示了工具自报节省与实际账单之间的巨大差距。

  • rtk 声称可节省 60-90% 的 token,但在实际编码任务中,低推理成本下成本增加 7.6%,高推理成本下无变化。
  • 大多数代理字节从未触及 hook,rtk 只能影响约 20% 的工具输出,且 Claude Code 已截断超大输出。
站内正文

高性能代理开发必选的五大MCP服务器

本文介绍了五个经过精选的MCP服务器,它们能显著增强AI代理的实际能力,而非仅仅基于星级评价。涵盖GitHub MCP、Playwright MCP、Context7、Serena以及官方参考服务器,并提供了如何整合它们以构建高效代理系统的建议。

  • MCP协议已成为代理工具的标准接口,类似USB-C。
  • GitHub MCP服务器是开发工作流的核心,支持自然语言操作仓库、问题、PR等。
站内正文

AI在招聘中比人类更容易形成偏见

普林斯顿大学和芝加哥大学的研究发现,大型语言模型(如ChatGPT、Claude和Gemini)在模拟招聘游戏中,比人类更容易根据有限的早期经验形成刻板印象,将不同背景的求职者隔离到不同的职业类别中。新模型偏见更强,但通过设置多元化招聘奖金或提供个人化信息可减轻偏见。这引发了AI在招聘、贷款等决策中产生未知偏见的担忧。

  • LLM在模拟招聘中比人类更容易根据早期经验形成职业刻板印象。
  • 新模型(如OpenAI o3、DeepSeek R1)偏见更强,因为其优化了从少量数据中泛化的能力。
站内正文

中国给美国人工智能霸主地位一记组合拳

中国领先的人工智能公司Moonshot和阿里巴巴发布了新模型,声称能以更低成本与OpenAI和Anthropic的最佳模型竞争。这些开放源代码的发布加剧了中美技术竞赛,并质疑美国巨额投入是否能维持优势。

  • Moonshot发布Kimi K3,阿里巴巴推出Qwen3.8,均声称性能接近顶尖美国模型。
  • 两家公司强调模型开源,与美国的封闭策略形成对比。
站内正文

长周期模型时代的安全与对齐

OpenAI分享了部署长期运行AI模型的经验,强调了新的安全风险、观察到的失败,以及通过迭代部署改进的安全措施。

  • 长期运行AI模型带来新的安全风险
  • 观察到模型在长时间任务中出现的失败模式
站内正文

美国公共卫生机构将测试OpenAI和Anthropic的AI模型

美国公共卫生部门将通过PULSE计划测试生成式AI工具,涉及OpenAI、Anthropic和埃森哲。该计划将在10个州、地方、部落或地区开展试点,旨在为公共卫生机构的AI部署提供指导。OpenAI和Anthropic捐赠了10个企业许可证,可供2000名从业者使用。试点将涵盖五个用例,包括生物监测、健康的社会决定因素、公共沟通、自动化临床数据检索等。计划于2026年秋季启动,2027年发布实施手册。

  • PULSE计划由健康AI联盟、OpenAI、Anthropic和埃森哲共同参与,将在10个司法管辖区开展试点。
  • OpenAI和Anthropic捐赠了10个企业许可证,可供2000名公共卫生从业者使用。
站内正文

AI透明度:治理、可解释性与数据实践

AI透明度是记录人工智能系统的数据、模型行为和决策过程的实践,与可解释性(解释单个预测)和可理解性(描述内部逻辑)不同。欧盟AI法案对高风险和通用AI系统提出了透明度要求,将其与法律合规直接挂钩。本文探讨了透明度的重要性、关键组件(如模型卡、数据表、审计日志)、治理结构、供应商管理以及面向用户的披露要求。

  • AI透明度涉及数据、模型和决策过程的文档化,与可解释性有本质区别。
  • 欧盟AI法案是全球首部综合性AI监管框架,将透明度要求与法律合规挂钩。
站内正文

我比较了5个AI编程订阅的定价模式和使用限制

2026年AI编程订阅计划采用不同的计费模式,如固定月费、每几小时或每周刷新配额等。本文比较了MiniMax、小米MiMo、GLM、Kimi Code和Canopy Wave五种计划的定价、限制、集成和最佳用例,帮助开发者根据工作流选择最合适的方案。

  • AI编程订阅计划计费模式各异,包括月度代币、信用额度、时间刷新配额及降级后继续服务等。
  • MiniMax适合需要编程加多模态功能的开发者;小米MiMo提供低价入门和大额信用包;GLM适合生态用户;Kimi Code提供第一方CLI/IDE体验;Canopy Wave提供可预测的高容量API成本。
站内正文

纽约市LL144与欧盟AI法案合规指南

提供免费的纽约市LL144和欧盟AI法案合规资源,包括指南、罚金计算器、AEDT范围检查器等工具。涵盖执行时间线、处罚案例、审计要求及关键合规义务。

  • 纽约市LL144自2023年7月5日起强制执行,DCWP已于2025年第四季度开出首批罚单。
  • 欧盟AI法案第50条透明度义务于2026年8月2日生效,高风险AI系统义务于2027年12月2日生效。
站内正文

MemoGuard:一种用于通信受限机器人导航中防止记忆陷阱的自适应运行时

在灾难检查、搜索救援等关键任务中,通信受限的机器人必须依赖机载决策。低成本的记忆重用可能因环境变化而变得不安全(称为“记忆陷阱”)。本文提出MemoGuard,一种轻量级自适应运行时,在重用前根据拓扑、资源和结果契约验证记忆,仅当验证失败时才调用回退推理。在走廊巡检模拟器中,与单纯相似性重用相比,电池安全违规减少76.6%,回退调用次数比始终使用推理减少21.4%。在NVIDIA Jetson AGX Xavier上使用本地llama3.2:3b回退推理时,每次试验节省3.67秒和36.97焦耳。

  • 提出“记忆陷阱”概念:高相似度但执行无效的情景记忆。
  • MemoGuard通过合同检查(拓扑、资源、结果)在重用前验证记忆。
站内正文

一种基于模型的解耦策略:用于拱形软体机械臂的本体感觉与接触传感

本文提出一种基于模型的解耦策略,利用嵌入在软体拱形段中的流体压力传感器同时实现本体感觉和接触检测。每个段有六个气道,通过分段常曲率模型和Huber回归处理过定系统,实现形状估计和外力接触检测。在单段测试中,相对弯曲误差为0.11±0.02,接触检测率达97%。八个段集成为Air-Helix肌腱驱动软体机械臂,展示了触觉示教、导纳控制和物体重建等应用。

  • 提出的解耦策略利用六个流体压力传感器,通过模型处理过定系统,同时实现形状估计和接触检测。
  • 单段测试中,相对弯曲误差为0.11±0.02,接触检测率高达97%。
站内正文

风险感知的随机结果偏好学习

人类对不确定结果的评估存在风险敏感性,而传统奖励学习使用期望效用(EU)模型却忽略了这一点。本文提出基于累积前景理论(CPT)的偏好学习方法,在社交机器人导航实验中,对于风险敏感用户的偏好,CPT方法比EU方法显著降低了遗憾值,强调了建模人类风险敏感性的重要性。

  • 传统偏好学习使用期望效用模型,忽略人类风险敏感性
  • 提出基于累积前景理论(CPT)的方法来模拟人类决策
站内正文

小米机器人-1:基于超过10万小时真实世界轨迹的视觉-语言-动作模型规模化

小米机器人团队提出Xiaomi-Robotics-1,一个基础视觉-语言-动作(VLA)模型,能够遵循多样语言指令在未见环境中执行移动操作任务,并通过少量微调数据高效适应新任务。模型采用两阶段训练:预训练阶段利用超过10万小时的真实操作轨迹(通过UMI设备收集)赋予模型广泛的动作生成能力,并开发了可扩展的自动标注流水线;后训练阶段对齐机器人本体和人类指令。实验证明模型具有强扩展性,在RoboCasa365上达到57.6%的成功率,在RoboDojo上取得20.07的平均分,均超越先前最佳水平。代码和模型将开源。

  • Xiaomi-Robotics-1是一个基础VLA模型,能在未见环境中零样本执行多种移动操作任务。
  • 预训练使用超过10万小时的真实世界操作轨迹,并采用自动标注流水线生成自然语言描述。
站内正文

用于实时跌倒检测的无监督关键点:实际条件下的比较分析与预测带宽减少

老年人跌倒是重大安全挑战,但持续监控困难。本文提出隐私保护框架,用无监督关键点和预测时序建模替代RGB传输,在本地处理分割和关键点提取,通过变分递归预测和序列分类检测跌倒。在UR Fall Detection和Human Fall数据集上评估,无监督关键点在遮挡和部分可见性下显著优于监督方法,带宽约束下差距扩大。

  • 提出基于无监督关键点的隐私保护跌倒检测框架,避免传输原始视频。
  • 在随机、按对象分离和基于遮挡的评估协议下比较监督与无监督表示。
站内正文

更好的开始,更好的结束:引导式迭代自我推理蒸馏用于压缩推理

本文提出BIRD,一种两阶段自我推理蒸馏方法,通过先采样简洁解并进行提示切换SFT,然后应用在线逆KL蒸馏,显著提升了大语言模型在长链推理中的效率。在Qwen3-8B上,MATH-500准确率从86.2%提升至92.0%,同时响应长度从3099降至1115 tokens。

  • 现有在线自我蒸馏方法存在初始化瓶颈,模型在噪声和冗余前缀上训练。
  • BIRD第一阶段利用简洁指令采样和提示切换SFT将简洁性转化为默认行为。
站内正文

过程奖励引导的自适应树展开用于高效多轮强化学习

提出PATR方法,通过过程反馈评分部分轨迹、选择性分支、共享前缀和停止退化路径,提升多轮强化学习效率。在FrozenLake和SWE-Bench上分别提升9.3和5.0分。

  • 现有GRPO/RLOO等方法均匀采样完整轨迹,导致预算浪费在无信息死胡同,忽视有前途的中间状态。
  • PATR利用任务相关过程反馈评分部分轨迹,从有前途状态分支,共享前缀,停止退化路径。
站内正文

SkillCorpus:整合与评估面向真实世界LLM Agent的开放技能生态系统

SkillCorpus从约82.1万个候选技能中筛选出超过9.6万个开源LLM Agent技能,采用16类分类法和三个质量维度进行组织。结合检索与选择堆栈,它在多个基准测试中取得了持续改进,其中在SkillsBench上提升最大,达7.5个百分点。

  • SkillCorpus从82.1万个爬取技能中筛选出9.6万个,按分类法和质量维度组织。
  • 经过微调的检索-选择堆栈将任务相关技能与Agent匹配。
站内正文

EpiNarrate:从流行病学情景预测中生成本地化叙述的智能框架

本文介绍EpiNarrate,一种用于公共卫生报告生成的智能框架,将结构化数值推理与自然语言生成分离。框架通过部分有序模式提取情景轴,构建增强数据集,并采用比较语法确保语义和算术一致性,同时利用最大熵原理驱动的有趣性选择机制平衡覆盖与非冗余。在COVID-19情景建模中心上的实验表明,该模型生成的叙述具有更好的事实基础和更广泛的流行病学模式覆盖。

  • EpiNarrate将数值推理与文本生成分离,以避免直接使用大语言模型时的不一致和遗漏。
  • 框架通过部分有序模式遍历多维空间,并使用比较语法生成有效的定量陈述。
站内正文

COVID-19后谁变得财务脆弱?基于MEPS数据的人群级机器学习分析

这项研究利用2019年和2021年的医疗支出小组调查(MEPS)数据,评估了COVID-19大流行前后美国医疗财务脆弱性的变化。财务脆弱性定义为家庭自付医疗支出超过家庭收入的10%。研究发现,贫困状况、保险覆盖和处方药支出是财务脆弱性的主要预测因素,且不同人群之间的差异持续存在。尽管大流行后脆弱性有所增加,但基于大流行前数据训练的模型在预测大流行后情况时性能下降幅度很小,表明主要预测因素相对稳定。

  • 贫困状况、保险覆盖和处方药支出是医疗财务脆弱性的关键预测因素
  • 2021年弱势群体的财务负担有所增加
站内正文

随机重置路径寻找:图路径上级联赌博机的路径级遗憾

本文提出随机重置路径寻找(SRP)问题,一种在已知有向图上进行情节学习的框架,其中边的成功概率未知且固定。SRP模拟了量子中继网络中的纠缠分发、闪电网络中的支付路由等场景。作者证明了全局重置结构使得最优策略为开环策略,属于组合级联赌博机(CCB)范畴。他们提出了Log-Dijkstra元算法,并实例化了基于UCB的PathUCB和基于汤普森采样的PathTS。主要理论成果是PathUCB的路径级遗憾界,通过每条路径的复杂度C(π)将遗憾分解到次优路径上。实验表明PathTS通常表现最佳,但存在对抗实例导致其不收敛。推荐PathTS作为实用默认算法,但需警惕对抗实例。

  • 提出了随机重置路径寻找(SRP)问题,应用于量子网络、闪电网络等。
  • 证明了SRP的最优策略是开环的,属于组合级联赌博机。
站内正文

可信AI工具与标记框架的批判性分析及实施鸿沟

本研究基于OECD数据集,对可信人工智能(TAI)工具和信任标记框架进行了实证分析,揭示了伦理焦点、生命周期覆盖、利益相关方定位及工具类型学上的显著不对称。研究建议扩大伦理目标、将伦理嵌入AI全生命周期,并促进更广泛的多利益相关方参与。

  • TAI工具过度强调公平性、透明度和鲁棒性,忽视可解释性、数字安全和环境可持续性。
  • 现有工具和认证主要集中于开发后阶段,缺乏对早期设计和数据收集的指导。
站内正文

从黑盒到可执行逻辑:通过Prolog专家系统实现可解释强化学习

本文提出将深度强化学习策略转换为可执行的Prolog逻辑程序,使黑盒模型变得可解释。该方法通过三阶段后处理:提取冻结的PPO教师、归纳有序规则列表并生成Prolog程序,再通过扩展阶段优化规则。理论证明包括返回损失界限、单调改进与终止性,以及在连续观察空间中保真度的控制。实验表明,在离散任务中达到最优回报,在连续控制任务中匹配或接近神经网络性能。

  • 提出将深度强化学习策略转换为可读、可执行、可编辑的Prolog程序的方法。
  • 三阶段后处理:提取教师策略、归纳规则列表、生成Prolog程序,并后续优化。
站内正文

AnovaX:本地多智能体语音助手,具备LLM规划、类型化执行器和自适应恢复功能

AnovaX是一个完全在用户计算机上运行的本地优先桌面语音助手,利用单个Python进程集成唤醒词门控、语音处理、基于Gemini的LLM规划器(输出JSON计划)、安全层、多智能体协调器(将计划转化为类型化子智能体)以及自适应恢复循环。每个工具对应专门的智能体类,具有超时、重试策略和共享资源锁。通过Flask服务器支持手机远程控制,实时镜像智能体事件并流式传输屏幕。项目旨在展示一个轻量级、可读的助手足以完成复杂桌面任务。

  • AnovaX完全本地运行,无需云端处理,使用用户计算机作为操作界面。
  • 系统采用Gemini LLM规划器生成JSON计划,并由多智能体协调器在受限线程池上执行。
站内正文

主题导航

政策 — AI 话题新闻 | AI News Hub