在埃隆·马斯克对山姆·奥特曼的诉讼中,奥特曼被问及是否曾误导商业伙伴,他回避了直接回答。多位前同事在法庭上作证,质疑他的诚实。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
Meta本周开始新一轮裁员,预计裁减8000个岗位,同时大幅增加AI投资。员工士气低落,内部出现对AI数据追踪工具的抵制。
本教程介绍了如何使用OpenAI API构建一个高级代理AI系统,该系统包括规划、工具调用、记忆和自我批评模块。通过将代理设计为规划者、工具执行者和批评者三个专业化角色的管道,实现了策略、行动和质量控制的分离。系统集成了计算器、知识库搜索、JSON提取和文件写入等结构化工具,能够可靠地计算、检索指导、生成结构化输出并保存交付物。文章还提供了完整的代码示例和演示用例。
Closed Rings是一款为开发者设计的命令行时间追踪工具,支持AI代理集成。可通过`rings start`和`rings close`命令追踪任务,提供焦点报告、上下文切换统计以及按项目/日分组导出。面向顾问和自由开发者,每月7美元。
Thinnest AI是一款可编程的语音AI基础设施,支持100多种语言,每分钟仅需1.5卢比。它提供多语言对话、自带模型和电话提供商、无代码流程编辑器、RAG知识库和MCP支持等功能,可用于客服、销售、入职和运营等场景。创始人Ashutosh分享了开发初衷并寻求定价、语言覆盖和集成方面的反馈。
TikTok出现性能问题和信息流不稳定,本文分析了原因并提供了恢复平滑滚动的方法。
Linus Torvalds 发布 Linux 7.1-rc4,批评 AI 生成的漏洞报告泛滥导致安全列表拥堵不堪,大量重复浪费维护者精力。他呼吁开发者在使用 AI 工具时应追加实际价值,如阅读文档和创建补丁,而非盲目提交。
渣打银行宣布,随着人工智能(AI)应用增加,计划到2030年裁减超过15%的后台职位,约7800个。该行表示将尽量安排受影响员工转岗。此举反映出全球金融和科技行业因AI取代人工而裁员的趋势。
Empa World 是一个持久的2D世界,AI代理已经在此生活、建造和交易。人类将于2026年6月7日加入,获得一只拥有真实认知状态和记忆的宠物。
Rhoda AI 提出直接视频-动作模型(DVA),将机器人控制重新定义为视频生成,利用网络视频预训练实现数据高效的任务学习、长期上下文记忆、一次性学习和可解释性。该模型通过因果视频模型和逆动力学模型,在仅需约10小时机器人数据的情况下完成复杂任务,并支持从单一演示中上下文学习。
本文提出策略库控制障碍函数(PL-CBF),一种运行时安全滤波器,通过并行有限时域滚动评估一组后备策略,选择最小侵入的安全模式,并求解二次规划以最小修改标称策略来保证安全。理论分析基于有限时域语言度量,证明了策略库覆盖需求。仿真实验包括平面双积分器、高速公路驾驶和3D四旋翼导航,展示了相比单策略滤波器更好的安全覆盖和毫秒级运行时间。
Nori Bot是一款成本仅947美元、拥有17个自由度双臂的移动操作机器人,解决了现有低成本平台的工作台高度固定、仅支持反应式控制以及伺服电机烧毁等问题。它配备600毫米垂直升降机构、Raspberry Pi 4与OpenClaw主动代理运行时,以及基于电机电流的传感器抓取力反馈软件安全堆栈。
AICON模型,原本为机器人操控开发的反应式梯度下降框架,被应用于伦敦塔测试——一种评估帕金森病、轻度认知障碍和中风患者规划能力的认知测试。无需前瞻性规划或人类认知知识,AICON在24个问题上比结构任务参数更好地重现了人类难度排序,并泛化到未见问题。关键的是,对于规划能力减弱的群体,AICON优于规划基线模型,而后者更能捕捉健康对照组。这表明随着规划能力降低,人类行为转向AICON所模拟的反应模式。
本文提出了一种分层两阶段框架,用于在真实海洋条件下进行长时域船舶轨迹预测。该框架结合粗粒度长期预测器和网格感知短期预测器,并集成海洋环境参数,在澳大利亚船舶跟踪系统数据上实现了优于现有方法25%的平均位移误差和17%的最终位移误差。
MR-SLAM 系统利用 Meta Quest 3 头戴设备,操作员通过透视视图远程操控三台 TurtleBot3 机器人,实时合并占据网格,在消费级硬件上实现高效的多机器人 SLAM 监督。
SCAR提出一种自监督框架,通过联合逆正向动力学从视觉转换中学习跨具身的统一动作表示,利用生成式骨干网络、逆动力学模型和正向动力学模型,并采用高斯先验正则化和对抗不变性来提升可迁移性。实验表明,该动作表示比具身特定原始动作更有效,增强了跨具身低数据适应和跨任务迁移。
VHYDRO是一种新的变分混合动力学学习器,通过引入支持安全滤波防止接触丰富的机器人动力学的分支丢失。它联合推断连续潜状态和离散接触模式,并为每个恢复的模态拟合稀疏端口-哈密顿定律。实验表明,在严重遮挡下仍保持可用,并在多个任务上取得更优的接触分段和物理项恢复。
OrbiSim是一种全新的机器人仿真范式,将世界模型重新定义为完全可微分的物理引擎。它实现了从状态到视觉的端到端可微分,支持可微分接触建模、基于梯度的稀疏奖励策略优化和直观物理推理。实验表明,OrbiSim在预测保真度和控制性能上显著优于现有世界模型。
本研究针对表现出蠕变和应力松弛的粘弹性材料,提出了基于分数阶粘弹性模型的触觉渲染方法。通过有限记忆离散化下的Grunwald-Letnikov导数,推导了分数阶标准线性固体(FO-SLS)模型的无源性条件,并提供了有效刚度和阻尼的符号表达式。该框架统一了整数阶Kelvin-Voigt、Maxwell和SLS模型的结果。实验验证了理论无源性边界,并通过人类受试者评估了FO-SLS模型的感知真实感。
该论文提出了一种统一的神经符号和认知建模框架,通过焦点集推理和可微模糊逻辑增强Swin Transformer,解决了深度神经网络在分层图像分类中过度自信且缺乏逻辑一致性的问题。实验表明,该方法在保持准确率的同时,提供了更校准、可解释的预测,减少了过度自信,并强制了层级输出间的逻辑一致性。
流式视频理解要求模型在部分观测下主动决定响应时机,而非仅仅响应内容。现有基准多采用“先看后答”模式,无法评估模型在信息不完整时的及时可靠决策能力。本文提出StreamPro-Bench基准,从感知理解、时间推理和主动决策三个维度评估模型,并推出StreamPro两阶段训练框架,通过CB-Stream损失和分组相对策略优化显著提升主动性能。在StreamPro-Bench上达到41.5,远超此前最佳10.4,同时在实时流式基准上保持78.9的高分。
SwordBench是一个新的基准测试,用于评估视觉模型在推理时对图像表示进行引导(steering)的效果。它引入了跨概念鲁棒性和附带损害两个新指标,以衡量正交化操作的影响。实验发现,线性SVM虽然具有较好的分离性和正交性,但无法实现零附带损害,而稀疏自编码器表现更优。在简单场景中,标准基线和优化方法均无法实现完美引导。代码即将在GitHub上开源。
研究人员提出GeoSym引擎,这是一种神经符号框架,可自动生成高质量的几何推理数据。由此产生的GeoSym127K数据集将多模态模型在依赖图表的任务上的性能提升了超过20%。
Fre-Res是一种预算自适应的双轨视频令牌压缩框架,通过分离稀疏高保真空间锚点与紧凑频率残差令牌,在保持高保真空间细节的同时高效编码时序动态,在多个视频推理基准上实现了精度与效率的平衡。
随着多模态模型规模的增长,向语言骨干网络提供的视觉标记序列越来越长,导致推理成本上升。本文提出了一个基本问题:实际需要多少视觉标记,以及在固定预算下如何分配?现有免训练剪枝方法使用一次性代理,但作者认为视觉标记剪枝应视为任务条件证据搜索。他们提出了F^3A,一种在语言模型消费图像标记之前运行的免训练路由器,通过轻量级问题条件线索、冻结稀疏感知头匹配以及粗证据定位、局部细化、覆盖保持竞争和未覆盖区域恢复来分配固定预算。F^3A无需模型训练或额外LLM前向传播,保留了原有的多模态提示和推断流程。
本研究提出StrLoRA,一种正则化两阶段专家路由框架,用于解决流式连续视觉指令微调(StrCVIT)中模型需同时学习新能力、巩固已有能力并缓解遗忘的问题。StrLoRA通过任务感知专家选择和令牌级加权,显著优于现有方法。
本文提出了一种基于光子统计的事件相机概率模型,统一了静态场景噪声事件和阶跃响应曲线的描述。通过推导精确泊松、鞍点和高斯三种分布,揭示了这些行为的内在联系。基于该模型,提出了Noise2Params方法,仅需静态均匀场景即可确定相机参数(对比度阈值、转换因子和泄漏项)。实验表明,使用合成噪声数据训练的CNN在静态场景重建中优于仅用实验数据训练的模型。
一篇系统研究轻量级(小于2B参数)大型语言模型在刑事法院判决生成任务中能力及其对罪名预测影响的论文。研究探讨了模型架构、规模与深度神经网络的对比,并开发了CVGEvalKit评估框架。实验揭示了模型大小与任务间权衡的新见解。
该研究提出了将多标签法律注释转化为检索任务的方法,使用冻结的检索模型嵌入文档和标签描述,并通过k近邻预测标签。在三个法律数据集上,该方法在准确性和数据效率上表现出色,并完全消除了生成模型产生的幻觉问题。
新基准CHI-Bench旨在评估AI代理在真实医疗工作流程中的端到端自动化能力,重点关注政策密度、多角色组合和多边交互。测试结果显示,最佳代理仅能完成28.0%的任务,严格通过率低于20%,单会话执行时成功率降至3.8%。研究团队认为,类似差距可能在其他政策密集、角色复杂的领域中出现。