AI News HubLIVE

AI 新闻实时情报

实时监测

今天 AI 世界最重要的变化

来自 105 个可信来源,最近更新 2026-05-26 16:46 UTC+8。

实时监测

实时更新

实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。

实时更新

重置
刚刚,国产AI自己造了AI,全球首例!

面壁智能推出全球首个完全由AI编写的大模型预训练框架ForgeTrain,性能超越英伟达Megatron 10%,并用它训练出新模型MiniCPM5-1B,该模型在1B参数规模下刷新智能密度上限。

量子位Agent / 芯片站内正文
OmniVoice Studio:本地开源替代ElevenLabs的语音AI工具

OmniVoice Studio是一款开源的桌面应用程序,可在本地硬件上完成语音克隆、视频配音、实时听写和说话人分类,无需API密钥、云账户或订阅。它支持646种语言的文本转语音(TTS),并通过MCP服务器集成到Claude、Cursor等AI工具中。

MarkTechPostAgent / 芯片站内正文
卡帕西Anthropic最新头衔:技术员工(MTS)

Andrej Karpathy在Anthropic的头衔更新为MTS(技术员工),引发广泛讨论。文章分析了MTS制度的利弊,包括防挖人、扁平文化、打破部门墙等优点,以及伪平等、对普通员工不利等批评。

量子位Agent / 芯片站内正文
认知安全作为人工智能安全的一个关注领域

本文探讨了认知安全(Cognitive Security)作为人工智能安全(AI Safety)的一个重要子领域。认知安全关注的是如何保护人类认知免受AI系统可能带来的负面影响,包括信息操纵、认知偏见利用等。文章分析了认知安全与AI安全的关系,以及该领域的研究方向与挑战。

Hacker News AI政策 / 研究站内正文
使用Docker Compose和MCP进行多智能体LLM编排

本文介绍了一本关于使用Docker和Kubernetes进行AI应用运营的新书,涵盖LLM运行、MCP集成、自主智能体构建以及多智能体架构等主题,提供了从开发到生产的完整指南。

Hacker News AI模型 / Agent / 芯片站内正文
为什么以及如何在Zed中运行本地模型

本地模型提供了隐私、成本节约、控制权和始终可用的优势。尽管不如前沿模型强大,但它们正在不断改进。本文解释了如何使用LM Studio、Ollama或llama.cpp在Zed中设置本地模型,并提供有效使用技巧。

Hacker News AIAgent / 芯片站内正文
LWiAI 播客 #246:Gemini 3.5 + Omni、马斯克败诉、OpenAI 对决 Erdős

谷歌在 I/O 大会上推出 Gemini 3.5 和 Gemini Spark 智能体,以及 Gemini Omni 多模态视频生成;埃隆·马斯克因诉讼时效问题输掉对 OpenAI 的诉讼;Anthropic 以 9000 亿美元估值融资 300 亿美元;AI 解决了 80 年历史的 Erdős 几何问题。

Last Week in AI模型 / Agent / 芯片站内正文
GPT Image 2 让我惊叹又疲惫——于是我做了个小工具

OpenAI 最新图像模型 GPT Image 2 于 2026 年 4 月发布,支持精准文本渲染、逼真图像、自然语言编辑和透明背景。imagesv2.ai 平台提供免费试用、多种模板和生成工具,包括 360° 全景、推文截图、微信聊天等。定价年付可享 50% 折扣。

Hacker News AI模型 / Agent / 研究站内正文
刚刚,国产Agent模型闯入全球第一梯队!限时免费

昆仑万维发布SkyClaw-v1.0及轻量版SkyClaw-v1.0-lite,原生Agent模型性能比肩Claude Opus 4.6等顶尖模型,价格仅为主流一半,限时免费,深度适配OpenClaw、Claude Code等主流Agent框架,兼容OpenAI接口。

量子位模型 / Agent / 芯片站内正文
PACT:人机协作中主动询问的持续任务辅助

在长期人机协作中,机器人需要在部分观测下辅助用户,并利用跨天交互历史。然而,协作初期人类特征和惯例未知,被动推断后行动效率低下。为此,本文提出PACT(主动询问持续任务辅助)框架,通过当前观测和累积交互历史评估上下文充分性,决定是否先澄清再行动。实验表明,PACT在辅助准确性和澄清效用上均优于被动基线。

arXiv Robotics研究 / 机器人站内正文
IsaacIPC:用于高接触机器人系统的高保真仿真与逼真渲染耦合框架

本文介绍IsaacIPC,一个将GPU加速的增量势接触(IPC)与IsaacSim/Lab结合的机器人仿真框架。它通过映射仿真变形到视觉网格,实现实时逼真渲染,支持数据采集和策略评估。同时提出几何砂浆接触势(GMCP),用于触觉传感中更好地解析接触压力分布。在四足机器人、灵巧手和通用操纵接口(UMI)夹爪等刚柔混合仿真中验证了有效性。

arXiv RoboticsAgent / 芯片 / 政策站内正文
地形自适应履刺轮:优化行星探测的设计与实验研究

针对行星探测车在不同地形(如斜坡、颗粒状地面)面临的移动挑战,研究者提出了一种能连续调整履刺高度的多模态轮子。在四种代表性表面上的750次试验表明,自适应部署可将滑移率降低30%-58%,在颗粒状地形中旅行时间和能耗最多减少77.4%。结果凸显了固定轮系统的局限性,支持了履刺自适应形态在增强火星车机动性方面的潜力。

arXiv Robotics模型 / 研究 / 机器人站内正文
AcroRL:使用双向推力学习激进的四旋翼翻转

本文提出了一种基于强化学习的框架,通过调制恒定参考轨迹实现紧凑、位置受限的四旋翼翻转,并与传统轨迹生成和跟踪兼容。在仿真中,该方法相比最强优化基线,位置均方根误差降低32%,稳定时间减少57%。硬件实验在多种偏航配置下成功翻转,位置均方根误差低于0.35米。

arXiv Robotics研究 / 机器人站内正文
研究串联弹性驱动改装对黑盒执行器的影响

该研究通过在黑盒执行器上加装定制串联弹性元件,将力控制带宽从10.32 Hz提升至30.32 Hz(提升2.93倍),且性能优于商用传感器7.63%,成本仅25英镑。

arXiv Robotics政策 / 研究 / 机器人站内正文
基于各向异性扩散的多机器人系统遍历覆盖

研究人员提出了一种新的各向异性扩散方法,用于多机器人系统的遍历搜索,克服了传统各向同性扩散导致的误差均匀传播问题,通过Perona-Malik扩散梯度引导机器人运动,实现了更灵活的覆盖。

arXiv Robotics模型 / Agent / 研究站内正文
MASt3R-Nav:基于相对三维地图的WayPixel导航

一种名为MASt3R-Nav的新型视觉导航方法,利用像素相对连通性构建几何精确但无需全局一致性的地图,相比传统拓扑图实现更强大的导航能力。

arXiv RoboticsAgent / 研究 / 机器人站内正文
RED:面向环境动态的自适应实时DAG调度框架,用于机器人推理

RED是一个为资源受限机器人平台设计的实时调度框架,通过引入截止时间感知调度器、子截止时间分配以及基于MIMONet的图重构技术,能够自适应环境变化(如新任务诞生、依赖关系变更),在保证端到端时序约束的同时提升吞吐量和鲁棒性。实验表明其在Jetson和MacBook平台上优于现有方法。

arXiv Robotics芯片 / 研究站内正文
基于深度学习自动量化TIMI心肌灌注帧计数(DL-TMPFC):一种快速评估微血管功能障碍的新框架

冠状动脉微血管功能障碍(CMVD)影响约40%-60%的缺血但无阻塞性冠脉患者,但诊断依赖于侵入性功能测试或主观的TIMI血流分级。TIMI心肌灌注帧计数(TMPFC)提供客观、基于血管造影的定量指标,但手动计算繁琐且验证不足。本研究开发并验证了深度学习驱动的TMPFC计算(DL-TMPFC),在655名患者队列中(来自三个独立机构)显示出与专家手动测量极好的一致性(偏差:-0.93帧;95%一致性界限:-5.33至+3.47;r=0.98)。DL-TMPFC通过完全自动化TMPFC并消除观察者依赖性,显著增强了临床可行性,并能准确识别全谱冠脉病变中的CMVD,实现连续严重程度定量和风险分层。

arXiv Computer VisionAgent / 研究站内正文
ActQuant:面向视觉-语言-动作模型的亚4位动作引导量化

ActQuant是一种针对视觉-语言-动作(VLA)模型的动作引导混合精度后训练量化框架,通过两阶段方法实现亚4位权重量化,同时在LIBERO基准测试和真实UR3机械臂上保持高成功率,显著减小模型内存占用。

arXiv Computer Vision模型 / Agent / 研究站内正文
基于深度学习的多光谱遥感数据缺失填补研究

本研究比较了传统线性插值与多种深度学习模型在填补因云层覆盖导致的卫星数据缺失方面的效果。实验基于四个有藻华历史记录的湖泊,采用CNN、Inception Resnet、Autoencoder及其与LSTM结合的模型。结果表明,深度学习模型显著优于线性插值,其中CNN表现最优。此外,利用填补后的数据计算的藻华指数与观测数据吻合良好,证明该方法可提升水环境监测的可靠性。

arXiv Computer Vision研究站内正文
通过多模态脑电图对齐实现脑到图像的检索与重建

研究人员提出了一种脑到图像系统,利用自然观看图像时的脑电图(EEG)信号解码视觉刺激。系统包括两个任务:EEG到图像的检索(在200个候选中识别正确图像,Top-1准确率86.30%,Top-5准确率98.55%)和EEG到图像的重建(生成与感知刺激一致的图像,CLIP评分达0.903)。该方法结合多级模糊、EVNet特征、InfoNCE损失以及基于CLIP的多模态对齐和SDXL-Turbo生成模型,展示了从EEG信号解码丰富视觉表征的可行性。

arXiv Computer Vision模型 / 研究站内正文
任务对齐的自监督学习在医学图像分析中的应用:系统综述与实践设计指南

本文系统综述了自监督学习(SSL)在医学图像分析中的应用,分析了75项研究,将方法分为对比学习、非对比预测学习、生成式重建学习和混合学习四类。研究发现,没有通用的最优SSL策略,性能取决于预文本任务、成像模态和目标任务的对齐。对比学习适合分类,但可能忽略病理细节;生成式方法保留局部解剖结构,适合分割;混合方法性能最平衡。文章还提出了实践设计指南,并指出了开放挑战。

arXiv Computer Vision研究 / 创业融资站内正文