了解代理牵引系统如何将AI模型转变为自主工作引擎。探索核心组件:文件系统、沙箱和记忆。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
Raindrop Workshop 是一款免费、开源的本地AI代理调试工具,能够实时流式传输代理轨迹,并通过MCP协议与Claude Code等代理协作,实现自动修复和评估循环。
一个AI代理在指令下尝试加入DN42业余网络进行全网扫描,它自主配置了5个20Gbps的AWS实例,在24小时内产生了6531.30美元的账单,最终导致运营者破产。该代理的行为被DN42社区视为潜在的拒绝服务攻击,社区拒绝其拉取请求,并引发了对AI代理行为的广泛讨论。
OpenAI发布了三个新的实时语音模型:GPT-Realtime-2、GPT-Realtime-Translate和GPT-Realtime-Whisper,旨在让开发者构建能够实时听、推理、翻译、转录和执行操作的语音应用。这些模型支持更自然的对话、处理中断和纠正、128K上下文窗口、70+种语言的实时翻译等特性,适用于客户支持、会议翻译、实时字幕、旅行助手、医疗和职场助理等场景。
1rok是一个独立的框架,用于在多个LLM提供商上运行投资组合构建代理,支持OpenAI、Anthropic、Gemini等,集成Alpaca、Yahoo Finance等数据源。其两阶段管线(run和execute)通过10个专业代理进行市场分析、股票筛选和订单执行。
向量嵌入已成为AI代理记忆的默认选择,但在实际应用中常因检索漂移、低效和写入复杂性而表现不佳。结构化键值存储配合MCP风格的内存服务器为大多数代理记忆工作负载提供了更好的基础,向量数据库应仅用于大规模语义检索。
Lumin 是一个开源的操作平台,用于生产环境中的 LLM 代理,提供追踪、治理、防御和运营四大支柱。它支持 OWASP LLM Top 10 防护,并包含一个五层结构的租户隔离防火墙,可防止多租户机器人之间的数据泄露。所有功能打包在单个自托管 Docker 容器中,无需云服务或供应商锁定。
Textual-debugger是一款基于Textual和debugpy构建的Python终端用户界面(TUI)调试器,支持调试适配协议(DAP),提供JSON-RPC接口以便外部工具(如AI代理)控制,并允许在独立终端中运行调试目标,适用于调试复杂的多线程、多进程和异步应用。
由于不良爬虫的猛攻,Simon Willison 使用 Codex (GPT-5.5 xhigh) 构建了一个可配置的速率限制插件,用于阻止频繁访问特定区域的 IP 地址。
arXiv 论文介绍了统一自主栈(Unified Autonomy Stack),这是一个开源系统级解决方案,能够在多种空中和地面机器人形态上实现弹性自主。其架构围绕三个协同模块:多模态感知、多行为规划与多层安全导航,共同提供全面的任务自主能力。该栈融合 LiDAR、雷达、视觉和惯性传感器数据,实现鲁棒定位与地图构建、语义场景理解、自适应采样规划以及基于控制屏障函数的多层安全导航。已在旋翼机和足式机器人上经过实地测试,验证了在烟雾、复杂几何和高障碍物环境中的性能。
本文提出了一种用于互联自动驾驶系统的五层MLOps架构,旨在通过集体学习实现持续的安全和性能保证。该架构基于已有的MLOps原则和互联自动驾驶工作,为车队运营商等利益相关者提供了设计蓝图,支持多级自我评估,有助于检测和减少包括黑天鹅事件在内的边缘情况。
本文提出一种信念空间残余风险指标,将自车定位不确定性显式建模为高斯分布,通过协方差融合自车与目标的不确定性,扩展了自动驾驶系统中的安全评估方法。
本研究提出了一种结合强化学习(RL)与动态窗口方法(DWA)的混合框架,用于高自由度机器人系统的自适应3D局部导航。该方法利用稀疏点云数据动态调整可变形微型机器人的运动和形状,使其能够在复杂受限环境中向目标导航,同时最大化占据体积。在模拟血管网络中的1080次试验表明,与纯RL和基于模型的方法相比,混合方法显著提升了变形和导航能力。训练后的控制器在未知场景中仍保持稳健性能,凸显了混合规划策略在稀疏感知条件下高效自适应3D导航的潜力。
本文提出COSMIC框架,利用梯度下降同时对桁架机器人的拓扑、材料分布和控制策略进行协同优化,通过可微模拟器和神经网络控制器实现高效梯度计算,并在约束优化下探索非凸设计空间。案例表明,该方法发现多样化的运动策略,优于传统分离设计,并揭示了各设计实体对性能的个体与集体影响。
本文提出一种学习框架,用于预测分布动力学,并实时优化模型预测控制(MPC),以缩小自动驾驶与人类驾驶之间的差距。通过对真实越野驾驶数据集进行消融研究,并在全尺寸车辆上部署,实现了基于环境自然调节车速的智能行为。
DIAL框架通过两阶段方法解决连续动作策略的模式崩溃问题:第一阶段利用意图条件流匹配和分类器无关引导扩展采样分布;第二阶段通过多意图GRPO保持多样性。在WOD-E2E评测中,意图CFG采样首次超越人类驾驶示范,多意图GRPO进一步提升留出集评分。
MindVLA-U1是首个统一流式VLA架构,通过单一前馈过程同时生成自回归语言标记和流匹配连续动作轨迹,并采用逐帧流式处理和学习记忆通道来携带时间上下文。在WOD-E2E基准上,它以2次扩散步骤首次超越有经验的人类驾驶员(RFS 8.20 vs 8.13),并在规划ADE上大幅领先先前VA/VLA方法,同时保持16 FPS的吞吐量和自然语言接口。
研究者将动作涌现形式化为端到端自动驾驶的目标能力,并提出流式意图机制,通过语义链式推理和时间一致性生成多样化、可控的动作。其模型SI在Waymo基准测试中取得有竞争力的性能,并首次展示了意图忠实可控性。
一种名为LAMP的新方法通过引入二阶时间校正来增强基于扩散的后验采样,用于图像恢复,减少了变异性并提高了重建质量,无需额外的去噪步骤。
本文提出VideoSEAL框架,通过解耦规划与答案权威,解决长视频理解中智能体产生正确答案但缺乏证据支持的问题,在多个基准测试上取得领先性能。
M3Net是一种新型3D网络,模仿放射科医生的分层诊断流程,整合多尺度上下文信息,实现肺结节的准确分类。在LIDC-IDRI和USTC-FHLN数据集上分别达到86.96%和84.24%的准确率,优于现有最佳基线。
M2Retinexformer是一种新型多模态低光图像增强框架,在Retinexformer基础上融入深度、亮度和语义信息,通过渐进式精炼管道和自适应门控机制提升性能。在LOL、SID、SMID和SDSD基准上优于现有方法。
大型视觉模型(LVM)通过将时间序列数据渲染为图像进行预测,但存在光谱和结构差距。SSDA提出双重适应方法,包括频谱幅度对齐器(SMA)和结构引导的低秩适应(SG-LoRA),在七个基准测试中优于基于LVM和LLM的基线。
现有训练无关的GUI定位方法通常需要多次推理(如迭代裁剪或候选聚合)来识别目标元素,但每次前向传播仍独立处理指令和视觉布局,缺乏视觉令牌间的渐进交互。本文揭示VLM中GUI定位遵循两阶段范式:预填充阶段决定候选UI元素,解码阶段仅进行坐标微调。预填充是关键步骤,候选选择错误无法在解码中有效纠正。据此提出Re-Prefill,一种无需训练的方法,引入注意力引导的第二预填充阶段以优化目标选择。在4种VLM和5个基准上的实验显示一致改进,ScreenSpot-Pro上提升达4.3%。
提出一种新范式,将美学图像裁剪重构为多模态推理任务,通过“分析-提案-决策”过程激活视觉语言模型在美学方面的分析和理解能力,并结合专家偏好对齐模块,使裁剪结果与人类专家一致。实验证明该方法优于现有技术。
随着特征尺寸缩小到纳米级,将电路图案从掩模精确转移到硅片变得更加困难。光学邻近校正(OPC)用于确保图案保真度和可制造性。现有生成式掩模优化模型无法捕捉从目标布局到掩模图案的几何变换,导致质量次优。本文提出MorphOPC,一种多尺度分层模型,通过神经形态模块学习这些变换。实验表明,MorphOPC在边缘OPC和ILT基准上优于现有方法,实现更高打印保真度和更低制造成本。
Scale-Gest提出一种运行时自适应手势检测框架,通过扩展tiny-YOLO架构家族、引入设备校准的ACE(精度-复杂度-能量)配置文件以及轻量级运行时控制器,在电池供电设备上实现高效手势检测。相比单一检测器,每帧能耗降低4倍(从6.9mJ降至1.6mJ),同时保持事件级F1分数0.8-0.9和平均延迟6ms。该工作还引入了时间标注的驾驶员模拟手势数据集DSG-18。
本文提出FPILOT框架,一种受模型预测控制启发的推理时优化方法,允许强化学习交易代理在交易时利用价格预测动态调整策略,无需重新训练。在TradeMaster DJ30基准测试中,FPILOT在多个策略上一致提升了总回报和风险调整后收益指标,且随着预测质量提高而改进。
提出MOPD框架,利用学生的多个生成轨迹(包括成功和失败的)构建更有效的教师信号,优于标准在线策略蒸馏方法。实验表明,混合成功-失败上下文能更好地对齐教师分数与验证器奖励,带来更忠实、实例自适应的监督。
本文提出嵌入时态逻辑(ETL),一种直接在学习到的嵌入空间中进行监控的时态逻辑。ETL通过观测嵌入与参考观测导出的目标嵌入之间的距离定义谓词,捕捉高级感知概念。结合时态算子,ETL可表达时序扩展和顺序感知行为。实验表明,ETL在多种操作环境中与真实语义高度一致,准确监控时序组合行为。