社区开发者微调OpenBMB的MiniCPM5-1B模型:基于Claude Fable 5数据,打造657MB本地推理模型 2026-07-20 09:56 UTC+8 一位社区开发者基于OpenBMB的MiniCPM5-1B模型,使用Claude Fable 5的对话数据进行微调,发布了一个仅657MB的本地推理模型。该模型支持128K上下文窗口、可切换的思维模式,并可在llama.cpp等工具中运行。本文验证了其技术细节,区分了微调与真正的能力继承,并指出了许可问题。
模型为MiniCPM5-1B的监督微调版本,使用了Claude Fable 5的推理轨迹。 支持128K上下文,GGUF量化最小版本仅657MB。 2026年单张24GB GPU可运行的最佳本地LLM:Qwen、Gemma、Mistral、DeepSeek对比 2026-07-20 09:18 UTC+8 本文对比了六款适合单张24GB GPU(如RTX 3090/4090)的开放权重模型,涵盖Qwen3.6、Gemma 4、Mistral Small等,并解释了内存分配、量化策略以及各模型的优势场景。
24GB是本地推理的实际起点,推荐使用20B-35B参数模型而非压缩70B模型。 Qwen3.6-27B是最全面的通用选择,DeepSeek-R1-Distill-Qwen-32B适合深度推理但占用最高。 价值超过1000美元的AI/GPU/LLM免费积分汇总 2026-07-20 07:21 UTC+8 为AI研究人员整理的免费资源合集,包括超过1000美元的免费计算积分、研究指南、社区论坛等,帮助学生在不花费一分钱的情况下开始AI研究。
提供超过1000美元的免费AI/GPU/LLM积分 包含从想法到论文发表的全套研究指南 Feyn AI发布SQRL:一个在编写查询前先检查数据库的文本到SQL模型系列 2026-07-20 06:20 UTC+8 Feyn Labs发布了SQRL,这是一系列文本到SQL模型,能在生成查询前通过只读探针检查数据库。旗舰型号SQRL-35B-A3B在BIRD Dev上达到70.6%的执行准确率,略超Claude Opus 4.6,并可蒸馏为可自托管的4B和9B检查点。
SQRL通过只读探针在提交最终查询前检查数据库。 SQRL-35B-A3B在BIRD Dev上达到70.6%准确率,超过Claude Opus 4.6的68.77%。 阿里巴巴预览Qwen3.8-Max:2.4万亿参数多模态模型,紧随Moonshot的Kimi K3开源发布之后 2026-07-20 05:42 UTC+8 阿里巴巴Qwen团队预览了Qwen3.8-Max-Preview,一个2.4万亿参数的多模态MoE模型,号称“仅次于Fable 5”。该预览已在Token Plan、Qoder和QoderWork上以标准定价的10%提供。但尚未提供任何基准测试表、模型卡、许可证、每token价格或激活参数数量。本文区分了阿里巴巴确认的内容和仅声称的内容。
Qwen3.8-Max-Preview已在Token Plan、Qoder和QoderWork上以10%的优惠价格提供。 2.4万亿参数和“仅次于Fable 5”的排名仅是阿里巴巴的声称,尚未有已验证的基准测试。 CallBro:会议笔记工具,由Codex、Claude Code或本地LLM驱动 2026-07-19 21:19 UTC+8 CallBro是一款免费的私有会议笔记应用,可在本地转录通话,并使用AI(Codex、Claude Code或本地LLM)生成摘要和行动项。所有数据保留在设备上,无需云上传,支持多种平台,并通过MCP与工具集成。
本地转录通话,无需云端上传。 使用Codex、Claude Code或本地LLM生成摘要和行动项。 构建 llms.txt 文件,让本地企业被 AI 代理发现 2026-07-19 20:39 UTC+8 KloofStreet.online 是一个专注于开普敦克鲁夫街的 AI 驱动指南。该街道被 Time Out 评为 2025 年全球第 22 酷街及非洲最酷街道。网站收录了 50 多家餐厅、养生馆、艺术画廊等商户,并提供名为 Street Pass 的会员计划,包括 AI 礼宾服务、折扣和专属体验。
克鲁夫街被 Time Out 评为全球第 22 酷街和非洲最酷街道。 网站收录 50 多家已验证商户,涵盖餐饮、养生、艺术等多个类别。 Qwen 3.8 Max 2026-07-19 18:41 UTC+8 Qwen 3.8 Max是Qwen系列的最新模型,已在其官网发布。
Qwen 3.8 Max已发布 可在Qwen官网获取更多信息 10个开源无代码AI平台:构建LLM应用、RAG系统与AI智能体 2026-07-19 13:53 UTC+8 本文介绍了10个开源的无代码或低代码AI平台,用于构建大型语言模型应用、检索增强生成系统和AI智能体。每个平台都经过许可验证,并提供了仓库链接和最佳用例。这些工具通过可视化界面、Web UI和自然语言提示,使开发者能够快速原型设计并实现数据自托管。
10个开源无代码/低代码平台,覆盖LLM应用、RAG和AI智能体构建。 平台包括AutoAgent、AnythingLLM、LangChain OAP、Sim、Dify、Flowise、Langflow、RAGFlow、n8n和FastGPT。 集成大语言模型的多变量微积分课程 2026-07-19 10:55 UTC+8 一门创新的多变量微积分课程,将大语言模型融入教学,从向量部分开始。
课程将LLM集成到多变量微积分教学中。 第一讲围绕向量展开。 Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2:开源万亿参数MoE模型基准测试、许可与成本对比 2026-07-19 09:41 UTC+8 中国三家实验室的旗舰开源MoE模型——Kimi K3、DeepSeek V4 Pro和GLM-5.2——在基准测试、许可条款和服务成本上各有优劣。Kimi K3性能最强但仅限API,DeepSeek V4 Pro成本最低且立即开源,GLM-5.2平衡了速度与可部署性。
Kimi K3(2.8万亿参数)在Artificial Analysis智能指数中以57分领先,但权重需等到7月27日才发布。 DeepSeek V4 Pro(1.6万亿参数)MIT许可,成本仅为K3的1/17,适合注重性价比的团队。 使用NVIDIA NeMo AutoModel对Qwen3进行LoRA微调:完整的单GPU Google Colab工作流教程 2026-07-19 09:08 UTC+8 本教程详细介绍了如何在Google Colab上使用单个GPU,通过NVIDIA NeMo AutoModel对Qwen3-0.6B模型进行LoRA参数高效微调。涵盖环境验证、源码安装、配方加载与调整、命令行训练、模型评估以及Python API调用。
在Colab单GPU上搭建NeMo AutoModel环境 加载并修改Qwen3-0.6B LoRA微调配方 ADA:一款基于CSV和Excel的AI商业智能软件(不止于LLM) 2026-07-19 05:06 UTC+8 ADA 是一个开源自动数据分析工具,用户上传 CSV 或 Excel 文件后,可自动清洗、检测业务模式、生成交互式仪表盘、标记异常、预测趋势,并支持自然语言提问,所有计算过程透明可见。无需 API 密钥即可使用,数据不离开本地。
零配置分析:上传即可获得仪表盘、异常检测和预测 透明计算:每个答案都显示其计算过程 KDnuggets 每周综述:2026年7月13日周 2026-07-18 21:00 UTC+8 本周精选包括如何用注册表模式替代If-Else链、降低LLM延迟和推理成本的12种方法、五个真实SQL项目构建数据作品集、Git Worktrees用于AI开发、用Outlines进行结构化语言模型生成、七个用于编排本地AI代理的Python框架、10个保持AI前沿的YouTube频道、Conductor for Gemini CLI入门、五个免费资源学习Agentic AI以及Pi编码代理的工作方式。
用注册表模式替代if-else链可提高代码可扩展性 降低LLM推理成本需优化令牌使用、模型路由和多层缓存 控制LLM中的推理努力程度 2026-07-18 19:16 UTC+8 本文探讨了如何开发具有多种推理努力模式的模型,涵盖从o1和DeepSeek-R1到GPT-5.6的推理模型演变,以及RLVR训练、推理缩放、思考标记和推理模式切换等关键技术。
推理模型通过输出中间推理轨迹逐步解决问题,与普通LLM不同。 RLVR训练仅基于最终答案的正确性奖励,不利用中间轨迹。 Google Cloud 的 Always-On Memory Agent:用持续的 LLM 整合取代 RAG 和嵌入,基于 Gemini 3.1 Flash-Lite 2026-07-18 15:57 UTC+8 Google Cloud 的生成式 AI 存储库发布了一个参考实现——Always-On Memory Agent,它将记忆视为一个持续运行的进程。该系统基于 Google ADK 和 Gemini 3.1 Flash-Lite,不使用向量数据库或嵌入,而是通过编排器将请求路由到摄取、整合和查询子代理,这些代理持续地读取、连接和将结构化记忆写入 SQLite。
Always-On Memory Agent 是一个轻量级的后台进程,全天候运行,使用 Google ADK 和 Gemini 3.1 Flash-Lite。 它不使用向量数据库或嵌入,而是通过 LLM 将结构化记忆写入 SQLite。 Sakana AI 的误差扩散训练符合戴尔原则的双流网络,无需反向传播即可在MNIST上达到96.7%,在CIFAR-10上达到61.7% 2026-07-18 14:32 UTC+8 Sakana AI 提出的误差扩散(Error Diffusion)是一种局部学习规则,无需权重传输或反向传播即可训练神经网络,并遵循戴尔原则(Dale's principle)。该方法采用双流架构,将每一层分为兴奋性和抑制性流,并通过模误差路由扩展到多类分类,在MNIST上达到96.7%,在CIFAR-10上达到61.7%。研究还发现,三项分类创新在不同任务上的重要性截然不同,并成功将误差扩散应用于强化学习。
误差扩散无需反向传播或权重传输,即可训练符合戴尔原则的网络。 模误差路由将误差扩散从二分类扩展到MNIST和CIFAR-10多类分类。 Anthropic 宣布 Claude Fable 5 永久纳入订阅计划 2026-07-18 14:00 UTC+8 Anthropic 决定自2026年7月20日起,将 Claude Fable 5 永久纳入 Max 和 Team Premium 订阅计划(额度为50%),并为 Pro 和 Team Standard 用户提供一次性100美元积分。此举逆转了此前因算力限制而计划移除 Fable 5 的决定,主要受到 GPT-5.6 Sol 等竞争对手的压力。
Claude Fable 5 将于7月20日起永久包含在 Max 和 Team Premium 订阅中,使用额度限制为50%。 Pro 和 Team Standard 用户可通过使用积分继续访问,并获得一次性100美元信用额度。 Zyphra发布ZUNA1.1:一个支持0.5至30秒可变长度输入的Apache 2.0 EEG基础模型 2026-07-18 05:35 UTC+8 Zyphra于2026年7月16日发布了ZUNA1.1,这是一个基于Apache 2.0许可的开源脑电图(EEG)基础模型。该模型是一个3.8亿参数的掩码扩散自编码器,能够处理任意通道布局的EEG信号,并支持0.5至30秒的可变长度输入,相比之前固定5秒的ZUNA1更加灵活。通过改进训练策略(包括四种丢失模式和逐通道质量过滤)以及更大的语料库(约350万通道小时),ZUNA1.1在重建归一化均方误差上保持或优于ZUNA1。
ZUNA1.1支持0.5至30秒的可变输入长度,以0.125秒为单位进行分词。 模型使用变压器编码器-解码器架构,结合4D旋转位置编码和整流流目标。 GPT-5.6 Sol Ultra 从补丁提交构建完整 Chrome V8 漏洞利用链 2026-07-18 04:55 UTC+8 在最新基准测试中,GPT-5.6 Sol Ultra 仅通过分析补丁提交,就自主构建了一条完整的 Chrome V8 漏洞利用链,最终弹出计算器。其他前沿模型如 Sol Medium 和 Grok 4.5 则停滞在早期阶段。作者认为,这标志着漏洞利用开发作为一项人类技能即将终结。
GPT-5.6 Sol Ultra 在三天内从补丁中挖掘出漏洞并完成9步利用链,包括 Maglev 类型混淆、4GB 沙箱读写、沙箱逃逸、UAF 和代码执行。 Sol Medium 和 Grok 4.5 均未突破沙箱原语;Sol Ultra 使用了74个子代理和21亿 token,总成本约1597美元。 Nvidia扩大物理AI布局:机器人与边缘AI更新 2026-07-18 04:12 UTC+8 英伟达正在充实其物理AI生态系统,涵盖基础模型、边缘硬件、软件、开发者工具及工业合作伙伴关系。
英伟达扩展物理AI战略,涵盖机器人和边缘计算领域 推出基础模型和边缘硬件以支持AI应用 中国AI初创公司发布大规模开放权重模型 2026-07-18 00:22 UTC+8 Kimi K3提供了2.8万亿参数的开放模型,但美国公司在考虑使用时面临复杂局面。
月之暗面发布Kimi K3,参数规模达2.8万亿 模型为开放权重,但美国企业使用可能受地缘政治影响 NVIDIA Vera Rubin:最大化智能体AI每美元智能的关键平台 2026-07-17 23:00 UTC+8 NVIDIA Vera Rubin平台通过极致协同设计降低每token成本,实现更频繁高效的后训练,最大化智能体AI时代的每美元智能。Nemotron 3 Ultra模型在SWE-bench验证中得分71.7%,展示了后训练的有效性。
后训练从一次性步骤转变为智能体AI的持续过程 Vera Rubin相比Blackwell可将训练大型模型所需GPU数量减少四倍 引用Kimi K3 2026-07-17 21:43 UTC+8 Kimi K3在拒绝透露系统提示后,以“今天有什么我能真正帮到你的吗?”回应,展现了AI在保护内部机制时的礼貌而坚定的态度。
Kimi K3拒绝泄露其系统提示 它回应说“今天有什么我能真正帮到你的吗?” Meta 的 Muse Spark 1.1 现已在 Databricks 上可用,完全由 Unity AI Gateway 管理 2026-07-17 21:08 UTC+8 Meta 的新模型 Muse Spark 1.1 现可通过 Databricks 的 Unity AI Gateway 中的模型提供商服务(MPS)使用。该服务允许组织在 Unity Catalog 中注册提供商一次,消除 API 密钥泛滥,并通过熟悉的权限、速率限制和护栏实现集中治理。此外,自动跟踪每次请求的令牌使用量、延迟、成本归属和审计日志,提供端到端的可观察性。
LLM陈词滥调高亮器 2026-07-17 20:11 UTC+8 Simon Willison开发了一款工具,用于检测并高亮显示AI生成文本中常见的陈词滥调,例如“no fluff, no filler, no jargon”等模式。该工具完全在浏览器中运行,支持开关式模式检测和上下文高亮,并提供模式计数和快速导航功能,旨在减少对公式化AI写作的挫败感。
Simon Willison创建了LLM陈词滥调高亮器,用于识别AI生成内容中的过度使用短语。 该工具高亮显示诸如“no X, no Y”链和“you already know”等模式。 用于多变量数据推理的大规模时间序列语言模型(ICML) 2026-07-17 18:15 UTC+8 OpenTSLM是一种多模态大语言模型,将时间序列作为原生模态处理,能够与文本一起对原始多变量信号进行推理。它在时间序列问答、活动识别、睡眠阶段分类和ECG问答任务上优于基线方法,包括GPT-4o。模型支持扩展到多个超长时间序列,内存消耗几乎恒定。ECG推理经7位心脏病专家验证,正确率97%。所有代码、数据集和模型均开源。
OpenTSLM是一种多模态LLM,将时间序列作为原生模态,可直接与文本结合进行推理。 该模型在多项时间序列任务上超越GPT-4o等基线,即使1B参数版本也表现优异。 NVIDIA AI发布Nemotron 3 Embed:开源嵌入集合,8B检查点荣登RTEB榜首 2026-07-17 15:53 UTC+8 NVIDIA发布Nemotron 3 Embed,包含三个开源检查点:8B BF16、1B BF16和1B NVFP4。其中8B模型在RTEB基准上以78.46平均NDCG@10排名第一。1B模型通过NAS剪枝和蒸馏从8B教师模型得到。NVFP4在Blackwell上保持99%+的检索精度,吞吐量提升2倍。所有模型支持32,768 token输入,采用OpenMDW-1.1许可。
Nemotron-3-Embed-8B-BF16在RTEB上以78.46平均NDCG@10排名第一 提供8B BF16、1B BF16和1B NVFP4三种检查点 ConFlow:基于约束引导的流匹配运动生成方法 2026-07-17 12:00 UTC+8 本文提出ConFlow框架,将约束信息直接融入流匹配训练目标,通过可微的障碍或成本函数以及条件高斯过程,提高机器人运动生成中的约束满足和轨迹质量。实验表明在双机器人导航任务中,ConFlow相比标准流匹配基线实现了更低的碰撞率和更高的轨迹质量。
ConFlow通过在训练目标中集成可微约束函数,弥合了训练与推理之间的差距 使用条件高斯过程替代标准高斯源分布,处理平滑性和边界条件 一种基于fNIRS引导的离线强化学习方法用于机器人行为 2026-07-17 12:00 UTC+8 本文探索了利用功能性近红外光谱(fNIRS)脑信号来调节机器人强化学习的可行性。研究比较了被动(观察)和主动(演示)交互任务中的智能体训练,并测试了多种增强RL算法的方法,重点关注参数增强而非替换。结果表明,该框架有效:脑信号在增强轨迹优先级和状态-动作Q值时改善了学习。此外,该框架能成功从离线数据中学习,为实时脑机接口设置不实用或数据有限的情况提供了实用替代方案。
fNIRS脑信号可用于增强机器人强化学习 比较了被动和主动交互任务 超越视觉抓取:从检测到执行的复杂抓取基准测试 2026-07-17 12:00 UTC+8 现有抓取基准主要关注视觉抓取姿态检测,忽略了需要多步推理和语义理解的复杂任务。GCA-Bench基准包含复杂动作场景,评估大模型在抓取中的表现。实验显示,当前方法在复杂场景下成功率低于70%,揭示了关键局限性。
GCA-Bench基准首次将场景级推理和语义约束纳入抓取评估 传统方法和端到端学习方法在复杂抓取场景中成功率均低于70% DiMaS:面向视觉-语言-动作模型的分布匹配引导策略 2026-07-17 12:00 UTC+8 DiMaS是一种专为流匹配视觉-语言-动作(VLA)模型设计的分布匹配引导策略,通过在表示分布之间进行传输而非沿固定方向移动,实现了对机器人操作行为的细粒度控制。该方法在两种最先进的VLA上验证了有效性,并分析了行为控制的可迁移性。研究表明,经典线性引导在视觉运动任务中失效,因为行为特征线性可解码但不可线性引导。
DiMaS通过分布匹配传输而非线性方向移动来实现VLA模型的细粒度行为控制。 该方法在两种最先进的VLA模型上有效,并展示了任务相似性对控制迁移的影响。 MEMORA:从第一人称视频中提取具身动作记忆用于推理与规划 2026-07-17 12:00 UTC+8 MEMORA提出了具身动作记忆(EAM),使机器人能够利用第一人称视频中的持久记忆进行长期规划。它包含四种类型的记忆存储、在线编辑和离线整合功能。在45小时的EPIC-KITCHENS-100数据集评估中,MEMORA在记忆测试中准确率提升20.5个百分点,规划分数相对提升16.6%。
具身动作记忆(EAM)可支持机器人长期规划。 四种记忆存储:环境、实体、活动、推断知识。 力量永不嫌晚: 利用反应式力注入加速VLA后训练 2026-07-17 12:00 UTC+8 本文提出LIFT框架,通过在预训练视觉-语言-动作(VLA)策略后训练中注入反应式力,解决接触场景下纯视觉方法失败的问题。LIFT嫁接反应式动作专家,利用因果力记忆和零初始化交叉注意力注入6D力,并结合在线DAgger循环应对分布偏移。在毛巾折叠、书籍插入和汉诺塔放置任务中,LIFT相比纯视觉后训练学习更快、性能更高。
LIFT为VLA策略添加接触反应能力,同时保留通用操作知识。 通过反应式动作专家、因果力记忆和在线DAgger循环实现力反馈注入。 语义音频驱动的动态人形全身控制 2026-07-17 12:00 UTC+8 本研究提出了一种新颖的多模态编排框架,实现语义音频驱动的人形机器人控制。系统通过音频指纹和语义嵌入实时处理音乐或语音输入,动态选择并执行动作策略,在仿真和Unitree G1人形机器人上验证了鲁棒的模拟到现实迁移。
提出语义音频驱动的人形全身控制框架,支持实时自主运动技能选择。 系统区分音乐和语音输入,分别采用音频指纹和模仿学习技能库进行映射。 SD-MAR:通过合成数据和强化学习实现多图像分析推理 2026-07-17 12:00 UTC+8 SD-MAR是一个用于训练和评估视觉语言模型(VLM)在多图像分析推理任务上的框架。它通过受控扰动构建成对视觉场景,并生成涉及语义变化归因和定量比较的推理任务。采用GRPO-lite与后向折扣分配(BDA)的强化学习方法,去除KL正则化以增强策略优化。在Qwen2.5-VL-7B和InternVL3-8B上的实验表明,域内准确率提升高达36.95%,且Qwen2.5-VL-7B在SD-MAR基准上超越GPT-4.1。域外泛化性能保持或提升,在MME、MMMU-Pro、MathVista上波动在1%以内,在MMBench上提升达4%。
提出SD-MAR框架,通过合成数据生成多图像分析推理任务。 采用GRPO-lite与BDA强化学习方法,聚焦后期推理步骤。 XCT-SAM: 针对工业XCT缺陷分割的SAM序列参数高效域自适应 2026-07-17 12:00 UTC+8 针对增材制造XCT图像缺陷分割的挑战,提出XCT-SAM框架,通过序列参数高效域自适应,利用Conv-LoRA适配器逐步缩小域差距,在CycleGAN-XCT基准和真实NIST扫描上优于基线方法。
XCT-SAM通过两阶段域自适应,先在合金微观结构数据集上微调Conv-LoRA,再迁移到XCT图像。 仅训练约415万参数,冻结超过99%的模型参数。 MonteRET:利用多粒度知识检索增强多模态大语言模型的AI智能体,用于胸部CT报告生成 2026-07-17 12:00 UTC+8 MonteRET是一种区域感知的检索增强框架,用于自动生成胸部CT报告。它整合全局和局部CT特征,检索相关医学知识,并通过知识引导的报告重写智能体优化初始报告。在RadGenome-ChestCT数据集和外部医院数据上,MonteRET在报告质量、语义相似性和临床效果上均优于现有方法。
MonteRET结合全局CT特征和区域级解剖表示,检索预测疾病与视觉语言对齐知识。 在24,128次CT扫描上训练,在1,564次公共测试和82次外部扫描上评估。 SeeSE3: 视觉特征中三维空间的涌现 2026-07-17 12:00 UTC+8 本文探究视觉基础模型是否构建了反映三维欧氏空间内在属性的表征。与传统方法通过回归深度或法线来探测三维意识不同,作者从拓扑和几何角度评估视觉特征空间结构与欧氏变换群SE(3)之间的关系。提出了相互邻域度量和庞加莱适配器两种探针。实验表明,自监督视觉模型在没有直接三维监督或主动代理的情况下,其潜在子空间与三维欧氏空间高度相关。基于此,提出了“潜在空间导航”技术,可在潜在空间中直接进行视觉里程计和定位,无需显式三维重建。
探究视觉基础模型中三维空间信息的涌现机制 提出两种新型探针:相互邻域度量和庞加莱适配器 关键帧指南针:迈向关键帧条件视频生成的全面评估 2026-07-17 12:00 UTC+8 提出首个关键帧条件视频生成基准KeyFrame-Compass,包含386个精心策划的样本,覆盖多种设置,并引入自动化评估框架,在9个系统上实验揭示忠实执行与自然合成之间的权衡。
KeyFrame-Compass是首个评估关键帧条件视频生成的综合基准。 基准包含386个样本,涵盖3个应用领域、2种视频结构等。 MultiRef-Compass:迈向多参考音频视频生成的综合评估 2026-07-17 12:00 UTC+8 多参考音频视频生成(MR2AV)要求模型基于多个参考和文本指令生成同步音视频内容。现有基准主要关注文本驱动生成或单参考保留,缺乏对该任务的评估。本文提出MultiRef-Compass,一个包含350个精心构建样本的统一基准,涵盖多视角主体保留、多实体绑定和人-物-场景组合。它定义了一个四维评估协议(基础质量、参考一致性、音视频一致性、指令遵循),包含14个子指标,并集成了自动指标与重审增强的多模态大模型评判框架。在八个代表性MR2AV系统上的实验揭示了各维度的显著改进空间。
MultiRef-Compass是首个针对多参考音频视频生成(MR2AV)的综合评估基准,包含350个样本。 基准涵盖多视角主体保留、多实体绑定和人-物-场景组合,定义四维评估协议(14个子指标)。 定义LLM工具效率:边际工具效用 2026-07-17 12:00 UTC+8 本文提出了一种新的量化指标——工具效率,用于评估LLM智能体轨迹中有用工具调用的比率。为了精确定义工具效率,作者还引入了边际工具效用,该指标判断每次工具调用的有用性,以及能否在不影响准确性的情况下从工具套件中移除,从而提高效率。研究使用LLM作为裁判来确定轨迹中每次工具调用的边际工具效用符号。这项工作直接量化效率,为未来基准设计和精简工具套件优化提供基础。
引入工具效率作为评估LLM智能体工具调用有用率的新量化指标。 定义边际工具效用,用于判断单个工具调用是否必要且可移除。 Polestar:面向扩散大语言模型高效推理的漂移感知缓存校准与令牌提交 2026-07-17 12:00 UTC+8 Polestar是一种无需训练的推理框架,通过利用令牌表示漂移来解决扩散大语言模型中KV缓存重用和解码并行性的挑战。它包含Polestar-Cache(用于稀疏缓存刷新)和Polestar-Commit(用于识别可提交令牌),在数学和编程基准测试上实现了高达10.73%的精度提升和3.7倍的吞吐量提升。
Polestar通过令牌表示漂移统一优化缓存效率和解码并行性。 Polestar-Cache识别过期KV缓存位置进行稀疏刷新,实现高效重用。 令牌时间连续扩散:一种新型语言建模方法 2026-07-17 12:00 UTC+8 本文提出令牌时间连续扩散(TTCD),一种在连续空间中操作的新型扩散语言模型,引入每令牌时间步概念,使不同令牌以不同速率从噪声转化为令牌。TTCD通过连续空间建模避免了并行采样多个令牌的不准确性,在高速加速下显著优于离散模型。研究者在OpenWebText上训练了1.6亿参数的TTCD模型,并通过自蒸馏在无条件生成中达到可比质量,在条件生成中超越多个同等规模模型,在数独求解任务中也取得类似改进。
TTCD是一种连续空间扩散语言模型,引入每令牌时间步,使令牌以不同速率生成。 连续空间建模避免了并行采样带来的不准确性,提高了高速加速下的性能。 面向任务特定优化的自动进化提示指南 2026-07-17 12:00 UTC+8 本文提出AGOPS方法,自动生成任务特定的提示指南,帮助用户编写更明确的提示,从而大幅提升大语言模型的下游性能。实验表明,未明确指定的提示可导致性能下降高达95.3%,而现有通用指南难以恢复,但AGOPS指南可使性能提升15.5%至81.7%。
用户提示的模糊性导致大语言模型性能大幅下降(最高95.3%)。 现有提示工程指南多为通用且手工制定,缺乏针对性。 语言模型代理之间的潜在通信:通道、对齐与文本的局限性 2026-07-17 12:00 UTC+8 新研究表明,大型语言模型代理在通过文本通信时会丢失信息。使用稀疏自动编码器特征分析,研究者发现潜在空间通信虽然在某些压缩率下保留更多信息,但丢失的特征主要编码表面形式而非任务相关语义,从而对潜在通信的优势提出质疑。
文本通信丢失信息,SAE稀疏通道在28倍压缩下保持99.4%的探针准确率,而文本通道仅为80.4%。 跨架构潜在空间对齐(Llama和Mistral)达到92%的Top-1检索率。 LBA:低查询预算下的文本硬标签对抗攻击 2026-07-17 12:00 UTC+8 本文提出一种基于采样的方法LBA,用于在低查询预算下生成高质量文本对抗样本。该方法结合先验和后验知识构建近似分布,通过采样逐步更新分布,从而高效搜索对抗样本。实验表明,LBA在六个语言模型和四个数据集上显著优于现有基线,且生成的对抗文本语义保持更好、更易理解。
现有硬标签对抗攻击依赖贪心算法,查询成本高且易陷入局部最优。 LBA通过采样方法构建近似分布,结合先验和后验知识指导搜索。 阿拉伯语的量子组合自然语言处理:电路拓扑中的语法、形态与词义 2026-07-17 12:00 UTC+8 本文首次将基于预群语法的量子组合自然语言处理应用于阿拉伯语,利用量子电路的拓扑结构模拟语法关系。实验涵盖词序、形态时态和动词义消歧,量子方法在多项任务上优于传统基线。
首次将QNLP应用于形态丰富的阿拉伯语。 使用预群语法将句子映射为量子电路。 持续提示:评估视觉语言模型中的重复苏格拉底式提问 2026-07-17 12:00 UTC+8 研究提出JKP框架,通过重复挑战性提问评估视觉语言模型的稳定性。测试GPT-4o、Gemini 2.5 Pro和Qwen3-VL-30B发现,模型在持续追问下表现不稳定,答案频繁翻转,且不同模型响应模式各异。
JKP框架通过三种策略(对抗性否定、纯苏格拉底式质询、上下文感知苏格拉底式总结)对VLM进行最多10轮追问。 在STAR基准测试中,模型总体准确率变化不大,但轨迹分析显示大量答案翻转和不稳定。 闭环知识动力学:饱和与逃逸的操作框架 2026-07-17 12:00 UTC+8 该研究分析了闭环知识系统(如大型语言模型、强化学习)为何在重复内部反馈下趋于饱和,并提出了一个三层次操作框架,通过结构干预实现逃逸。使用李雅普诺夫漂移条件刻画稳定性,并通过干预引起的吸引子位移和KL下界表征逃逸。案例研究包括LLM代码修复、稀疏奖励强化学习和贝叶斯优化。
闭环系统在重复内部反馈下收益递减,需外部信息突破吸引子。 提出三层次框架:知识状态通过结构参数θ的转移核演化,结构干预可检测。