BEiTScore是一种基于轻量级交叉编码器的无参考图像描述评估指标,从视觉问答模型初始化,结合对抗性LLM数据增强,在保持高效性的同时实现了最先进的性能。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
AVI-HT是一种自适应视觉-IMU融合方法,通过联合建模第一人称视角图像和手套上的6自由度IMU信号实现3D手部姿态追踪。在严重视觉遮挡的手-物交互场景中,AVI-HT显著提升了精度和可用性。其核心在于同步多模态训练数据和跨传感器深度注意力机制。在DexGloveHOI数据集上的实验表明,AVI-HT将平均关键点误差降低了16.1%,手腕对齐变体降低了24.2%。
MRecover是一种条件生成模型,通过将常规采集的T1w图像合成为TSE图像,并采用自回归切片条件化确保体积一致性,从而恢复运动伪影损坏的MR图像。该模型在7T MRI数据上训练(n=577),在域内测试中表现高保真度(SSIM=0.84,FSIM=0.94),并良好泛化至3T数据。在ADNI3数据集中,经质量控制后,可分析受试者增加了31.8%(593 vs 450),并提高了海马亚区萎缩诊断组间差异的效应量。
现有视觉语言模型在超声图像问答中表现欠佳,因为它们无法模拟超声技师主动聚焦病灶的认知过程,且忽略了标注的主观性。本文提出一种框架,引入“缩放-诊断”范式和基于不确定性的奖励机制,在GRPO框架下鼓励模型对清晰病例增强准确预测,对模糊病例保持谨慎。在肝脏、乳腺和甲状腺数据集上,病灶定位准确率提升39.3%。
本文提出“消融验证”诊断原则及其具体实现——标记替换测试(TRT),用于检验视觉语言模型(VLM)是否真正利用连续潜在标记进行推理。实验表明,即使标记内容被破坏或替换,VLM仍保留大部分性能提升,准确率提升并不能证明模型使用了这些标记进行推理。
UniVL提出一种统一视觉语言嵌入方法,通过将文本指令渲染到空间掩码上,消除对独立文本编码器的需求,实现高效、可控的图像生成。在UniVL-ImgGen基准上,FID从14降至11,PSNR从16升至20,推理TFLOPs减少52%,运行时间减少44%。
GenEvolve是一种自我进化的图像生成框架,通过工具编排的视觉经验蒸馏,将生成尝试建模为工具编排轨迹,并比较多次轨迹以提取结构化视觉经验,提供密集的令牌级监督,帮助智能体更好地进行搜索、知识激活、参考选择和提示构建。实验表明,该方法在公共基准和GenEvolve-Bench上达到了最先进性能。
PhysX-Omni是一个统一的框架,用于生成面向仿真的物理3D资产,涵盖刚体、可变形体和铰接物体。它提出了一种新颖的几何表示方法,可直接编码高分辨率3D结构,无需压缩,从而显著提升生成性能。此外,该框架还引入了首个通用仿真就绪3D数据集PhysXVerse,以及全面评估生成和理解能力的基准PhysX-Bench。实验表明,PhysX-Omni在生成和理解方面均表现优异,在仿真场景生成和机器人策略学习等应用中展现出巨大潜力,有望推动具身智能和物理仿真领域的发展。
JAMtime.ai 是一款创新工具,让音乐人用自然语言描述想要的音色,AI自动生成可编辑的DSP图谱,并支持在浏览器、DAW(免费VST/AU插件)及未来物理效果器上实时运行。它由资深开发者Jeff Ward打造,完全可编辑、可分享、可派生。
智谱AI发布GLM-5.1-highspeed高速API,速度达400 tokens/s,成为顶流模型中最快。实测显示其代码生成如喷射,可实时交互调参、改变游戏世界、快速处理万字内容。背后是推理引擎、调度系统和基础设施的系统工程优化,推动AI Agent进入快时代。
MovieFlow Studio整合剧本解析、分镜、生成、剪辑、资产管理和协作于一体,实现80集短剧3天完成,Token消耗降低70%,推动AI影视工业化。
Nugget AI 是一款利用AI从客户访谈中提取痛点、功能请求和情绪,自动合成主题并生成PRD的工具。它新增的MCP服务器让Claude、ChatGPT等AI代理可以直接查询访谈内容,基于真实用户反馈而非幻觉来生成规范。价格仅为Dovetail的一半,并提供首年66折优惠。
科技巨头纷纷向堪培拉示好,希望在澳训练数据模型。设立人工智能财富基金可让全民分享利润。
联想集团公布截至2026年3月31日的2025/26财年第四季度及全年业绩。第四财季营收近1500亿元,同比增长27.1%,创近20个季度最高增速;调整后净利润同比翻番。全年营收首次突破5000亿元,同比增长20.3%,调整后净利润同比增长42.1%。三大业务集团均实现双位数增长,AI相关业务营收全年同比增长105%。
OpenAI在2026年Gartner企业AI编码代理魔力象限中被列为领导者,其Codex产品因其创新性和企业级部署能力而获得认可。
流式视觉语言模型(VLM)根据指令和输入帧流连续生成响应,用于实时视觉助手。现有基准多评估离线模型,而VSAS-Bench针对流式VLM引入主动性和一致性等指标,拥有超过18,000个密集标注,提供同步和异步评估协议。大规模评估表明,传统VLM无需额外训练即可适应流式场景,性能优于专用流式VLM。
CopilotKit在2026年推出了三个关键工具:AG-UI协议、AIMock测试套件和Pathfinder知识服务器,旨在解决智能体AI从演示到生产环境的架构鸿沟。这些工具分别处理交互、测试和知识检索问题,已被多家财富500强公司采用。
DCP是一个本地加密保险库,允许AI代理在不直接持有私钥或敏感凭证的情况下执行操作。代理请求操作,用户通过Telegram或应用审批,DCP本地签名,秘密从不进入模型上下文。支持Solana钱包签名、API凭证存储、预算和审批限制,兼容多种代理框架。
阿里巴巴Qwen团队在2026阿里云峰会上正式发布Qwen3.7-Max,这是其迄今最先进的智能体模型,拥有100万Token上下文窗口和扩展思考模式,专为长周期任务如编码、调试和多步骤工作流自动化设计。在Artificial Analysis Intelligence Index上得分为56.6,在专有模型中排名第五。
Amazon Nova Act 已列入 HIPAA 合格服务清单,允许在受监管的医疗保健环境中部署自主浏览器 AI 代理,处理电子保护健康信息 (ePHI),实现自动化的索赔处理、转诊协调等工作流程。
Cohere发布开源模型Command A+,这是一款218B参数的稀疏混合专家(MoE)模型,专注于企业智能体工作流。该模型在W4A4量化下仅需两块H100 GPU即可运行,支持48种语言,是Cohere首个多模态推理模型。性能显著提升,在多项基准测试中超越前代。
Daytona CEO Ivan Burazin 讨论了其公司令人瞩目的74%月增长率、日均85万次沙盒运行、裸金属基础设施、强化学习评估,以及AI代理云的新愿景。公司从人类开发环境转向AI沙盒,提供可组合的计算机,支持60ms启动和动态扩缩容。
LangSmith的Auth Proxy通过将凭据隔离在沙箱之外,在网络层注入认证头,并允许团队定义出口策略和动态凭据流程,从而为AI代理沙箱提供更安全的网络访问控制。
Deep Agents、LangChain 和 LangGraph 的最新流式原语引入了类型化事件、作用域订阅、子代理可见性、多模态输出和弹性前端体验,支持构建生产级代理应用。
长期合作伙伴微软与安永宣布扩大合作,共同帮助企业加速采用人工智能技术。
Spotify和环球音乐集团达成许可协议,首次允许用户通过流媒体平台使用人工智能生成歌曲翻唱和混音。
大学毕业生在毕业典礼上对赞扬人工智能的企业高管发出嘘声和质问,这些高管对此感到惊讶。毕业生们对AI取代工作的前景感到愤怒,认为这些高管脱离现实。
Simon Willison 宣布了 Datasette Agent 的首次发布,这是一个可扩展的 AI 助手,为用户提供对话式接口来查询存储在 Datasette 中的数据。它支持通过插件生成图表、图像以及代码执行,并且可以运行本地模型。该助手基于 LLM 库构建,代表了 LLM 与 Datasette 的融合。
传统的放射科工作列表系统依赖僵化的规则,忽视关键上下文,导致诊断延迟和成本增加。本文介绍如何利用Amazon Bedrock AgentCore和Strands Agents SDK构建智能工作流,通过AI代理实现考虑放射科医生专长、工作量、疲劳程度和病例复杂性的上下文感知病例分配。
谷歌正在其Lighthouse分析工具中测试一个名为“代理浏览”的新实验性类别,以评估网站对AI代理的处理能力。