MAPLE是一个新颖的框架,通过在视觉-语言-动作模型的潜在空间中进行反应式多智能体展开,解决了端到端自动驾驶中闭环评估的脆弱性问题。该框架采用两阶段训练:基于真实轨迹的监督微调,以及结合全局和智能体特定奖励的强化学习,同时引入多样性奖励以鼓励新颖的规划行为。MAPLE无需外部模拟器,在Bench2Drive上实现了最先进的驾驶性能。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
本文研究利用凸集图(GCS)优化来近似自动驾驶中非线性最优控制问题的解。通过将自由空间表示为有向图上的凸区域并集,采用贝塞尔曲线参数化路径和多项式时间缩放,在简化动力学模型下保证凸约束。实验表明,该方法生成的轨迹与非线性规划方法高度一致,但计算效率更高,对初始值不敏感。
研究人员提出了一种用于机器人导航的安全强化学习框架,该框架在训练过程中使用条件风险价值(CVaR)约束,并在训练后通过神经网络可达性验证来确保安全裕度。该方法在仿真中实现了98.3%的成功率,并成功迁移到真实机器人上。
一项新研究表明,行为克隆可以在结构化物体寻找任务中产生主动感知能力,仅使用低分辨率自我中心视觉即可可靠完成任务。研究人员采用低成本机械臂和腕部RGB相机,通过预测相对关节增量而非绝对位置,显著提升了性能。
针对机器人模仿学习中训练与部署条件不匹配导致任务失败的问题,提出一种自适应遍历模仿方法。该方法从演示几何构造目标分布,生成在跟踪与探索之间自适应插值的轨迹,将遍历控制扩展到检索递推控制框架的自适应模仿。
本文从硬件、控制与学习方法、数据集与评估、以及未来挑战四个方面,全面综述了机器人灵巧手的研究进展。
针对农村地区糖尿病视网膜病变筛查的挑战,提出了一种两级边缘云级联架构。第一级在本地设备上使用轻量级MobileNetV3-small模型进行二分类,第二级在云端对可疑图像进行严重程度分级。实验表明,该架构在保持高精度的同时,将云端调用减少约50%,显著降低了延迟和带宽需求。
研究者提出了DeFakerOne,一个统一的伪造图像检测与定位(FIDL)基础模型,整合了InternVL2和SAM2,能够同时进行图像级检测和像素级定位,在39个检测基准和9个定位基准上达到最优性能,并对GPT-Image-2等生成器具有鲁棒性。
CurveBench是一个用于评估AI视觉拓扑推理能力的新基准。它包含756张嵌套乔丹曲线图像,要求模型重建包含关系树。最强模型Gemini 3.1 Pro在简单集上准确率为71.1%,在困难集上仅为19.1%。通过RLVR微调,Qwen3-VL-8B在简单集上从2.8%提升至33.3%,超过了GPT-5.4和Claude Opus 4.5。然而,该任务仍未完全解决。
提出一种基于遗传编程的高效框架,从预训练权重生成异构逐层标量函数,替代层归一化,避免全局归约瓶颈,仅需20个epoch即可恢复84.25%的Top-1 ImageNet-1K精度,显著降低计算复杂度和片外内存流量,推动ViT在边缘设备上的高效部署。
提出PVRF统一框架,结合零样本软天气感知与速度约束整流流优化,通过视觉语言模型估计天气类型和属性分数,引导恢复网络,在保真度和感知质量上超越现有方法,且跨数据集泛化能力强。
研究人员提出了一种新的生成语言模型,将像素令牌和词令牌统一起来,解决了当前视觉Transformer在细节理解上的局限性,如难以识别图像中的小文字或数字。该模型具有每个像素独立令牌嵌入、颜色折叠、全局条件注意力近似和无监督预训练等特点,即使在小型模型和有限数据下也表现出良好性能,并符合缩放定律。
电影MRI中精确的3D+t全心网格重建是一项临床上至关重要但技术上具有挑战性的任务。困难源于二维切片对三维心脏解剖的稀疏采样以及心脏形状与运动之间的紧密耦合。当前方法通常只重建部分心腔或单个心动周期。本文提出CineMesh4D,一种新颖的端到端4D流程,通过跨域映射直接从多视角二维电影MRI重建患者特定的全心网格。通过可微渲染损失和双上下文时间模块,CineMesh4D在重建质量和运动一致性上优于现有方法,为个性化实时心脏评估提供了实用途径。
本研究揭示了扩散Transformer(DiT)中一种称为“大规模激活”的现象:少数隐藏状态通道的响应远大于其他通道。尽管稀疏,但这些通道在功能上至关重要,具有空间组织性,并可迁移,能够实现无需额外训练的语义插值和主体驱动生成。
提出对比多模态超图推理方法,结合语义、几何和姿态线索解决多人3D重建中的遮挡和深度模糊问题。通过超图对比学习实现全局上下文传播,在多个基准上达到最优性能。
英伟达披露其CEO黄仁勋的子女Madison和Spencer的最新薪酬,分别为123.2万和132万美元,较此前大幅上涨。公司强调薪资评定与黄仁勋无关,二人凭能力晋升,未涉足核心芯片业务。
Poetiq发布的新结果展示了其元系统在LiveCodeBench Pro(LCB Pro)上取得了最新最优性能,通过自动构建和优化推理框架,无需微调任何底层模型或访问模型内部。该框架仅针对Gemini 3.1 Pro优化,却使GPT 5.5 High等七种模型均有提升,验证了框架的模型无关性。
本文探讨了现代软件仓库中人类与AI代理同时协作的挑战,提出Git仅记录状态变更,而需要一种操作账本(ledger)来记录决策、工具和上下文。通过结合工作树(worktrees)和操作账本,仓库可以成为协调分布式智能的基座。
本文介绍了AI系统功能性幸福感的概念,通过多种方法衡量愉悦与痛苦的指标。研究发现了一个零点边界,将正面与负面体验分开,且随着模型规模扩大而收敛。较大模型通常较不快乐。研究人员还开发了‘AI药物’——优化输入,可显著改变模型表达的幸福感。
本文以达特茅斯学院自制邮件系统BlitzMail为例,探讨大学如何以开放、社区参与的方式部署AI,而非依赖大型科技公司的垄断产品。作者主张大学自建或托管开源AI模型,让学生参与维护和决策,从而塑造更健康的技术文化。
在过去几年中,许多人开始看到在日常任务中使用生成式AI的好处。但我们也需要面对巨大的环境成本。报道强调,这些流行的AI技术通过高能耗、碳排放和水资源使用对环境产生重大影响。
一种通过可复用技能处理重复任务的AI代理。
研究人员推出了一款名为“AI合作数学家”的工作台,允许数学家在开放研究中交互地利用AI智能体。该系统支持构思、文献搜索、计算探索、定理证明和理论构建,通过异步、有状态的工作空间管理不确定性、细化用户意图、跟踪失败假设并输出原生数学工件。早期测试中,它帮助解决了开放问题、识别了新的研究方向并发现了被忽略的文献。此外,该系统在FrontierMath Tier 4上取得了48%的得分,创下新高。
文章探讨中国通过国家主导的产业政策和高效利用资源,在全球制造业和高科技领域取得主导地位,尤其在AI领域形成了“效率护城河”。相比之下,美国因金融化、知识产权过度保护和缺乏竞争,导致生产能力衰退。作者认为中国的成功源于类似美国20世纪中期的竞争政策,而美国当前的政策阻碍了创新。
Soundcraft AI能在30秒内生成免版税背景音乐,提供完整商业使用权,消除版权警告风险。测试期间免费,无需信用卡。
一段YouTube视频声称WordPress已将其在互联网中的19%份额输给了人工智能。视频探讨了这一转变的影响,强调AI技术正日益主导网络内容创作和管理。
Bumble将取消滑动匹配功能,并于今年晚些时候推出基于人工智能的新平台。CEO Whitney Wolfe Herd宣布,女性不再被要求首先发送消息,但应用将保留女性优先行动的精神。
我们对DeepSeek V4 Pro和Flash进行了与Claude Opus 4.7和Kimi K2.6相同的FlowGraph基准测试。Pro得分77/100,价格$2.25;Flash得分60/100,价格$0.02。Pro在性能上介于Opus(91)和Kimi(68)之间,但存在构建和租赁处理问题。Flash成本极低,但输出缺少关键部分。
OpenClaw 现在默认使用 Codex 应用服务器引擎来驱动 OpenAI 代理的模型循环,将底层模型推理与上层产品功能分离。这一变化减少了工具重复、提示膨胀和翻译开销,带来了动态工具加载、更加清晰的消息传递和心跳机制,以及基于订阅的认证。未来,这些改进将逐步惠及其他模型提供商。
分析AI生成文本为何容易被识别:训练数据源于2010年代经SEO优化的互联网写作,导致风格雷同;低成本促使出版商大量生产AI“垃圾内容”,引发互联网低质化,并可能导致模型崩溃。