本地模型提供了隐私、成本节约、控制权和始终可用的优势。尽管不如前沿模型强大,但它们正在不断改进。本文解释了如何使用LM Studio、Ollama或llama.cpp在Zed中设置本地模型,并提供有效使用技巧。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
谷歌在 I/O 大会上推出 Gemini 3.5 和 Gemini Spark 智能体,以及 Gemini Omni 多模态视频生成;埃隆·马斯克因诉讼时效问题输掉对 OpenAI 的诉讼;Anthropic 以 9000 亿美元估值融资 300 亿美元;AI 解决了 80 年历史的 Erdős 几何问题。
nilbox是一款桌面GUI沙盒,通过真正的虚拟机隔离运行AI智能体,采用零令牌架构保护API密钥安全。支持MCP服务器、域控制和令牌使用监控。
OpenAI 最新图像模型 GPT Image 2 于 2026 年 4 月发布,支持精准文本渲染、逼真图像、自然语言编辑和透明背景。imagesv2.ai 平台提供免费试用、多种模板和生成工具,包括 360° 全景、推文截图、微信聊天等。定价年付可享 50% 折扣。
BobCA 是一个自主学习编码的智能代理,能够根据用户的偏好进行个性化编程。
昆仑万维发布SkyClaw-v1.0及轻量版SkyClaw-v1.0-lite,原生Agent模型性能比肩Claude Opus 4.6等顶尖模型,价格仅为主流一半,限时免费,深度适配OpenClaw、Claude Code等主流Agent框架,兼容OpenAI接口。
在长期人机协作中,机器人需要在部分观测下辅助用户,并利用跨天交互历史。然而,协作初期人类特征和惯例未知,被动推断后行动效率低下。为此,本文提出PACT(主动询问持续任务辅助)框架,通过当前观测和累积交互历史评估上下文充分性,决定是否先澄清再行动。实验表明,PACT在辅助准确性和澄清效用上均优于被动基线。
本文介绍IsaacIPC,一个将GPU加速的增量势接触(IPC)与IsaacSim/Lab结合的机器人仿真框架。它通过映射仿真变形到视觉网格,实现实时逼真渲染,支持数据采集和策略评估。同时提出几何砂浆接触势(GMCP),用于触觉传感中更好地解析接触压力分布。在四足机器人、灵巧手和通用操纵接口(UMI)夹爪等刚柔混合仿真中验证了有效性。
针对行星探测车在不同地形(如斜坡、颗粒状地面)面临的移动挑战,研究者提出了一种能连续调整履刺高度的多模态轮子。在四种代表性表面上的750次试验表明,自适应部署可将滑移率降低30%-58%,在颗粒状地形中旅行时间和能耗最多减少77.4%。结果凸显了固定轮系统的局限性,支持了履刺自适应形态在增强火星车机动性方面的潜力。
本文提出了一种基于强化学习的框架,通过调制恒定参考轨迹实现紧凑、位置受限的四旋翼翻转,并与传统轨迹生成和跟踪兼容。在仿真中,该方法相比最强优化基线,位置均方根误差降低32%,稳定时间减少57%。硬件实验在多种偏航配置下成功翻转,位置均方根误差低于0.35米。
一种新方法结合了机器人的进化与学习,使用基于具身条件的专家混合模型,在效率与适应性之间取得平衡,避免了单一控制器的问题。
该研究通过在黑盒执行器上加装定制串联弹性元件,将力控制带宽从10.32 Hz提升至30.32 Hz(提升2.93倍),且性能优于商用传感器7.63%,成本仅25英镑。
研究人员提出了一种新的各向异性扩散方法,用于多机器人系统的遍历搜索,克服了传统各向同性扩散导致的误差均匀传播问题,通过Perona-Malik扩散梯度引导机器人运动,实现了更灵活的覆盖。
一种名为MASt3R-Nav的新型视觉导航方法,利用像素相对连通性构建几何精确但无需全局一致性的地图,相比传统拓扑图实现更强大的导航能力。
RED是一个为资源受限机器人平台设计的实时调度框架,通过引入截止时间感知调度器、子截止时间分配以及基于MIMONet的图重构技术,能够自适应环境变化(如新任务诞生、依赖关系变更),在保证端到端时序约束的同时提升吞吐量和鲁棒性。实验表明其在Jetson和MacBook平台上优于现有方法。
冠状动脉微血管功能障碍(CMVD)影响约40%-60%的缺血但无阻塞性冠脉患者,但诊断依赖于侵入性功能测试或主观的TIMI血流分级。TIMI心肌灌注帧计数(TMPFC)提供客观、基于血管造影的定量指标,但手动计算繁琐且验证不足。本研究开发并验证了深度学习驱动的TMPFC计算(DL-TMPFC),在655名患者队列中(来自三个独立机构)显示出与专家手动测量极好的一致性(偏差:-0.93帧;95%一致性界限:-5.33至+3.47;r=0.98)。DL-TMPFC通过完全自动化TMPFC并消除观察者依赖性,显著增强了临床可行性,并能准确识别全谱冠脉病变中的CMVD,实现连续严重程度定量和风险分层。
ActQuant是一种针对视觉-语言-动作(VLA)模型的动作引导混合精度后训练量化框架,通过两阶段方法实现亚4位权重量化,同时在LIBERO基准测试和真实UR3机械臂上保持高成功率,显著减小模型内存占用。
本研究比较了传统线性插值与多种深度学习模型在填补因云层覆盖导致的卫星数据缺失方面的效果。实验基于四个有藻华历史记录的湖泊,采用CNN、Inception Resnet、Autoencoder及其与LSTM结合的模型。结果表明,深度学习模型显著优于线性插值,其中CNN表现最优。此外,利用填补后的数据计算的藻华指数与观测数据吻合良好,证明该方法可提升水环境监测的可靠性。
研究人员提出了一种脑到图像系统,利用自然观看图像时的脑电图(EEG)信号解码视觉刺激。系统包括两个任务:EEG到图像的检索(在200个候选中识别正确图像,Top-1准确率86.30%,Top-5准确率98.55%)和EEG到图像的重建(生成与感知刺激一致的图像,CLIP评分达0.903)。该方法结合多级模糊、EVNet特征、InfoNCE损失以及基于CLIP的多模态对齐和SDXL-Turbo生成模型,展示了从EEG信号解码丰富视觉表征的可行性。
本文系统综述了自监督学习(SSL)在医学图像分析中的应用,分析了75项研究,将方法分为对比学习、非对比预测学习、生成式重建学习和混合学习四类。研究发现,没有通用的最优SSL策略,性能取决于预文本任务、成像模态和目标任务的对齐。对比学习适合分类,但可能忽略病理细节;生成式方法保留局部解剖结构,适合分割;混合方法性能最平衡。文章还提出了实践设计指南,并指出了开放挑战。
数字人水印面临独特挑战:数字人经常需要经过背景替换、重新构图和格式转换等后处理才能部署。本文提出RAW基准,包含来自5家商业供应商的50个合成数字人视频和6种模拟实际工作流的攻击。评估7种现有方法发现,背景移除等数字人特有攻击会显著降低水印恢复率。提出WALT方法,通过3D人脸重建在UV纹理空间嵌入水印,在缩放攻击下鲁棒性最高(92.4%),背景移除性能也强(95.6%)。该基准已开源以促进数字人水印研究。
Nano World Models 是一个极简代码库,专注于基于扩散强制(diffusion forcing)的未来视频预测。它提供统一的接口,支持生成目标、模型规模、动作条件机制、潜在观测空间、数据集、评估协议和长期推演过程,旨在为世界模型研究提供可重复、可扩展的实验平台。
GazeWorld是一种医学影像世界模型,将图像视为世界,放射科医生的注视序列视为轨迹。它通过自回归预测注视补丁的潜在表示,并用空间补全分支覆盖未访问区域。在推理时,仅从图像生成补丁表示,无需真实注视数据。冻结的GazeWorld特征在CheXpert、RSNA肺炎和SIIM-ACR气胸数据集上取得了所有九项监督设置的最新诊断准确率,以及所有三个基准的最佳零样本准确率。在GazeSearch基准上,基于相同冻结特征的通用解码器在ScanMatch和SED指标上分别比专用模型LogitGaze-Med高出16%和22%。该工作表明,建模专家如何读片,而非仅关注其结论,为医学影像AI提供了一种有前景的预训练范式。
音频大语言模型在转录英中混合语音时存在系统性失败模式,包括语言遗漏、翻译代替转录和幻觉。研究者采用直接偏好优化(DPO)方法,构建偏好对训练模型,使其学会保留混合语言内容而非翻译。在三个模型上使用10万对(570小时)数据训练后,模型行为得到显著改善:分布内词错误率(MER)最高降低89.6%,分布外降低20.0%。
AERIC 是一种轻量级安全监控器,通过读取解码过程中的隐藏状态来提前检测隐式有害内容,无需额外前向传播。它仅含 387 个可训练参数,在多个基准测试上优于大型模型,且延迟增加仅 2.34%。
大型语言模型(LLM)常被用作自动评判者,但研究发现它们存在位置、冗长和风格偏好等偏差。本文提出因果框架,引入一套干预措施和指标,检验LLM评判者是否具备提示不变性,即当非证据性提示被扰动时,其排名和解释是否稳定。实验发现,在标签和安慰剂扰动下,LLM存在显著的提示锚定合理化,而PROOF-BEFORE-PREFERENCE方法能显著改善提示不变性。
TriVAL是一个三重验证框架,在自动优化建模的三个阶段(语义规范、数学公式、代码生成)进行显式验证,并引入NL4COP基准测试,包含50种问题类型的150个实例,用于更具挑战性的组合优化问题。
本研究开发了一个基于大型语言模型的框架,直接从10-K报表中提取分部披露信息,并保留可报告和嵌套分部信息。同时,设计了一个检索增强系统,整合多个报表的信息以支持可比性。实验表明,该框架能准确提取信息并有效回答跨期问题,展示了LLM在增强分部披露衡量和解释方面的潜力。
本文提出多角色辩论系统(MPDS),结合文献检索、长上下文大语言模型推理、语料驱动角色归纳和结构化多智能体辩论,自动生成科学假设。在电池材料研究中,MPDS通过构建多达500篇文献的快照,进行三轮引文感知辩论,由主持人综合,生成机制明确且过程感知的提议。评估表明,MPDS在钠离子阳极和全固态电池阴极设计任务中恢复出与实验验证一致的设计逻辑,并在交叉视角整合方面表现优异,有望成为工作流瓶颈诊断工具。
Raon-Speech 是一个9B参数的语音语言模型,支持英语和韩语,在语音理解和生成任务上达到顶尖水平,同时保持强大的文本能力。其全双工扩展 Raon-SpeechChat 通过持续训练实现自然的实时对话。所有模型及代码均已开源。