喜剧演员钱信伊在哈佛大学第375届毕业典礼上,以幽默却严肃的方式向毕业生发出关于人工智能的警告。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
Drafted是一款AI工具,可让用户即时设计家居空间。
探讨人工智能生成系统代码的意义与潜在影响。
文章作者通过文本分析、统计证据和AI检测工具,论证了教皇利奥一世的首份通谕《Magnifica Humanitas》中有大量内容是由AI(特别是Claude)撰写的。作者指出,通谕中使用的破折号、词语“genuinely”的频率远高于以前的通谕,且Pangram检测器标记部分段落为AI生成。作者认为,尽管个别证据可能被解释,但多重证据的吻合难以忽视。
CodePulse是一个开源的代码库索引工具,通过维护持久的、基于git差异的索引,为AI编码助手(如Claude Code、OpenAI Codex CLI、Cursor等)在会话启动时注入紧凑的快照,从而节省60-80%的令牌预算。它支持任务感知排序、git感知排序和自动预算功能,并提供了CLI、MCP服务器等多种集成方式。
Lithium是一个基于PostgreSQL ltree的分层版本化存储引擎,提供确定性、范围化的检索,内置版本控制,零运行时依赖。它通过MCP服务器与AI工具集成,适用于AI代理记忆、决策跟踪等场景。
作者因Wayland下剪贴板同步问题,用AI(Claude Code)将Java项目ClipCascade重写为Rust,创建了轻量级二进制工具clipboardwire。过程中发现AI开发的关键瓶颈是反馈质量而非编码能力,而UI测试是让AI可靠迭代的护栏。
Xerolith是一个工作平台,通过分层递归架构实现持久身份、自主信念形成和独立于底层的知识整合。系统在80多天的连续运行中,将2,817个原始条目压缩为1,218个信念,并支持完整的谱系追踪和内部对齐。
本文介绍了一个使用Deep Agents、LangSmith和You.com金融研究API构建的宏观经济研究代理,该代理在约45分钟内分析所有27个欧盟成员国的GDP数据,检测异常并生成带有引用的简报。报告详细分析了爱尔兰和德国的异常增长与收缩原因,并强调了方法透明性和可审计性的重要性。
本文提出了一种双无人机空中对接平台,两个四旋翼飞行器以领航-跟随编队运行,通过轻量级模块化框架和被动磁锁实现对接。系统采用进度感知任务监督器管理接近、对准、捕获和稳定阶段,集成了完整的硬件-软件栈(ROS 2与Crazyflie/PX4接口),并在仿真和实际实验中进行了评估。该平台为模块化空中合作和可重复空中操作提供了统计上可靠的测试平台。
本文提出一种相位条件、力感知的框架,用于鲁棒的可变形物体操作。通过FiLM调节的ACT编码器和多模态相位预测器,系统能自主检测并恢复接触故障,将T恤悬挂成功率从56%提升至87%。
本文提出了一种去中心化框架,将大语言模型与声学移动机器人相结合,实现非接触式物体操作。系统利用Whisper语音识别、LLM语义解析和JSON任务调度,将语音指令转换为协调的多机器人行动。在两个基于TurtleBot3的声学机器人上的实验显示,顺序任务成功率为96%,并行任务为86%,同步协作任务为70%,展示了LLM驱动自动化在人机交互中的潜力。
开放运动规划库(OMPL)自2008年首次发布以来,已成为运动规划社区的基石,提供了大量最先进的基于采样的算法实现。经过近二十年的持续发展,OMPL 2.0通过硬件加速瞄准实时运动规划,并与现代AI研究工作流程无缝集成。
MonoDuo提出了一种利用单臂机器人演示结合人类协作来训练双臂操纵策略的方法。通过在单臂遥操作和角色互换中收集数据,并利用手部姿态估计、图像分割和修复技术生成合成演示,MonoDuo在五项任务中实现了高达70%的零样本成功率,并通过少量微调进一步提升性能。
研究人员提出动态对称性概念,以动态各向同性衡量机器人质心加速度的均匀性。通过模拟和物理实验,他们发现高动态对称性显著提升轨迹跟踪、任务成功率、鲁棒性、恢复力和能效。团队开发了Argus系列球形机器人,其中20足变体实现了近乎极端的动态各向同性,展示了方向无关的运动、复杂地形穿越、快速自我稳定及部分致动器失效下的韧性。
本文提出了一种基于递归神经网络和一步预测控制的数据驱动方法,用于线弧增材制造(WAAM)中的焊道几何控制。通过在线更新模型以应对热条件变化,显著提高了焊道高度和宽度的一致性。
研究者提出了一种多分辨率端到端深度神经网络,用于自动驾驶中延迟与安全性的平衡。通过在运行时选择输入分辨率,该网络在CARLA模拟中相比固定分辨率模型改善了车道入侵、闯红灯和碰撞等安全指标。
本文提出“仿生群体”系统,通过让人类用户执行机器人难以实现的任务,降低野外和群体机器人研究的门槛。该系统使用智能手机应用、蓝牙传感器和中央服务器运行群体算法。研究验证了分数偏置搜索算法,在模拟和实际户外环境中均表现出超线性地图重建能力。
该论文提出了一种目标感知的自监督预训练与模型集成策略,利用未标记的目标域数据提升医学影像AI在跨设备场景下的泛化性能。在儿科腕部骨折超声评估任务中,该方法在目标域上Dice系数提升超过6%,实现了标签高效且隐私保护的跨设备鲁棒AI。
论文《Seeing through boxes: Non-Line-of-Sight 3D Reconstruction from Radar Signals》提出GeRaF 2.0框架,融合视线几何约束与神经场,实现射频信号下隐藏场景的高质量三维重建,在CVPR 2026发表。
GeRaF 是首个利用神经隐式学习从射频(RF)信号进行近距三维几何重构的方法,通过滤波渲染、物理建模和无透镜采样等技术解决了RF信号的低分辨率和噪声问题。
本文提出两种轻量级人脸伪造检测模型LFWS和LFWL,通过在Xception基线基础上添加仅292参数的融合模块,分别结合小波去噪特征与相位谱或局部二值模式,在多个基准上提升AUC 3-4%,超越更大模型。
该论文提出了一种自监督的Sentinel-1条带模式SAR图像增强框架,利用方位子孔径分解生成训练数据,无需外部传感器或模拟真值。该方法结合单帧和多帧学习,并通过迭代推理逐步提升图像质量。实验表明,在PSNR和SSIM指标上优于MERLIN,但MERLIN在ENL上更高,揭示了结构保真度与斑点平滑之间的权衡。
该研究提出了Embodied3DBench,一个针对视觉语言模型在3D环境中低层级具身空间智能的基准测试,包含6个任务类别和超过21000个问答对。评估了13个模型,发现当前模型在高层次空间推理上表现较好,但在交互导向感知方面较弱。为此,他们合成了130万问答对的训练数据集,微调后显著提升了低层级空间智能。
本文提出TRACE框架,一种无需训练的轨迹约束重建方法,通过耦合相邻状态稳定重建路径,提高成像逆问题的重建质量。
本文通过引入扩散测地线矩(DGM)作为无训练形状描述符,对3D形状检索中的评估协议进行了审计。实验表明,基于热核特征(HKS)的几何矩形状描述符(GMSD-HKS)在FAUST-Reg和TOSCA数据集上取得了最高分数,波核签名(WKS)仍为强经典信号,而DGM在稀疏求解或非谱部署场景下更有价值。论文贡献了可复现的协议级联分析、跨形状对齐诊断以及无训练描述符的设计与报告建议。
GAP3D提出了一种模块化的扩散方法,直接将VLM生成的潜在表示对齐到预训练图像编码器的完整补丁级特征空间,从而在保持空间结构化条件信号的同时,使冻结的下游生成模型能够利用VLM作为提示编码器。该方法主要基于通用域图像-文本对训练,避免了对大规模3D数据的依赖,并展现出对多模态提示的零样本能力,尽管目前优先关注高层语义信息。
提出了一种名为噪声对齐扩散桥(NADB)的新方法,解决了扩散桥模型在靠近目标端点时的欠拟合问题,改善了图像恢复和翻译任务。
本文提出S3MEM,一种结构化场景事件记忆框架,用于长时域交互式问答。S3MEM通过结构化记忆单元写入轨迹、基于锚点的检索和紧凑的令牌预算感知证据接口,显著提升了回答早期事件的准确性和效率。在多个环境中的实验表明,S3MEM在准确性与效率的平衡上优于现有方法。
一项针对14个开源安全护栏模型的全面评估显示,Qwen Guard(4B参数)以83.97%的召回率位居榜首,而更大的模型如Llama Guard(12B)和GPT-OSS Safeguard(20B)表现保守,漏掉多达75%的不安全内容。研究还发现,模型大小与安全检测性能无关,通用型护栏模型优于专用模型。