与Claude Code团队的Cat和Thariq炉边谈话
Simon Willison在AI Engineer World's Fair上与Anthropic的Cat Wu和Thariq Shihipar进行了炉边谈话,讨论了Claude Code、Claude Tag、Fable模型、编码代理安全、评估、工具设计以及Anthropic内部如何使用这些工具。关键要点包括:Claude Tag现在为产品工程团队处理65%的PR;系统提示减少了80%;建议使用更少的“不要做X”指令;以及通过提升工作野心来抵消编码代理带来的“深蓝”效应。
- Claude Tag为Claude Code产品工程团队处理65%的PR。
- Claude Code仅向内部员工发布功能,并仅发布具有用户留存率的功能。
LWiAI播客 #252 - GPT 5.6、Grok 4.5、Nemotron-Labs-Diffusion、AI 2040
OpenAI 推出了 GPT-5.6 并重塑 ChatGPT Work;SpaceX AI 发布超低成本编码模型 Grok 4.5;Meta 推出 Muse Spark 1.1 及 Muse Image/Video(引发争议);中国开源模型市场份额增长;Anthropic 发表可解释性研究;美中在 AI 政策上的协调提议。
- OpenAI 发布 GPT-5.6(包括 Sol 和 Luna),并将桌面代理编码产品更名为 ChatGPT Work,同时因美国政府的放行和延迟引发争议。
- SpaceX AI 推出 Grok 4.5,以极低价格提供 Opus 级编码能力,但缺乏安全文档。
5门免费课程:从AI新手到实践者
本文介绍了一个由5门免费课程组成的路线图,从经典算法到从头训练大语言模型,帮助有Python基础的学习者系统掌握AI技能。
- 哈佛CS50 AI课程建立AI逻辑基础
- 谷歌机器学习速成课程掌握数学与TensorFlow
中国低价Z.ai模型暴露程序员昂贵习惯
Z.ai的GLM 5.2模型以低价和开放权重挑战美国前沿AI模型,但许多程序员仍习惯使用昂贵模型,忽略成本。该模型在基准测试中接近Claude Opus 4.8,但实际使用效果参差不齐。
- GLM 5.2 API价格仅为Anthropic Opus 4.8的五分之一,Fable的十分之一
- 开放权重允许自托管,避免数据隐私问题
“仅次于Fable 5”:阿里巴巴发布Qwen3.8,但未提供任何真实数据
阿里巴巴宣布推出其最新大语言模型Qwen3.8,声称仅次于Anthropic的Fable 5,但未提供任何基准测试或模型卡。此举发生在竞争对手月之暗面发布Kimi K3并附有详细技术细节之后。阿里巴巴的声明缺乏透明度,引发对其发布时机和动机的质疑。
- 阿里巴巴声称Qwen3.8仅次于Anthropic的Fable 5,但未提供任何数据支持。
- 该声明紧随月之暗面发布Kimi K3之后,后者提供了完整的基准测试和技术细节。
上周AI资讯 #251 - Mythos回归、Sonnet 5、Etched、LongCat
Anthropic与美国政府谈判后重新部署Claude Fable 5,增加网络安全分类器,并推出Claude Sonnet 5更便宜版本;Google NotebookLM新增TikTok风格视频摘要,Nano Banana 2 Lite图像生成器发布;Etched获大量投资打造全栈推理硬件,百度AI芯片单元计划IPO,Agility Robotics通过SPAC上市,DeepSeek扩招,中国发布Longcat 2.0 MoE模型及长周期智能体基准测试。
- Anthropic重新部署Claude Fable 5,增加网络分类器和安全框架
- Anthropic推出Claude Sonnet 5,以更低价位支持智能体应用
上周AI #250 - Mythos 混乱、GPT 5.6-Sol、GLM 5.2
本期涵盖Anthropic的AI条约讨论、美国政府影响AI模型发布、OpenAI处理器开发、内存市场影响等话题。
- 美国政府扩大对前沿AI的管控,Anthropic获准向特定公司发布Mythos-5,OpenAI推出GPT-5.6 Sol,初始访问受限。
- 模型能力与安全信号仍不明确,基准测试披露有限。
序列知识 #898:轨迹即教师:将推理蒸馏到小模型
2025年1月,DeepSeek利用其大型推理模型R1生成了约80万个完整解题过程(长链思维,包括假启动、自我修正等),过滤后对Qwen和Llama等小型开源模型进行简单的监督微调,无需强化学习,却意外地使小模型展现出超越自身规模的推理能力。这挑战了此前认为序列级模仿不适用于推理蒸馏的观点。
- DeepSeek R1生成80万推理轨迹用于蒸馏。
- 使用简单监督微调,无强化学习,小模型推理能力大幅提升。
中国开源权重模型便宜,华盛顿正在决定其代价
美国政策制定者正在讨论是否通过监管风险来限制中国开源权重模型的使用。Moonshot AI的Kimi K3模型发布后,这一争论再次升温。企业面临的问题不仅是性能,还有未来一年内使用这些模型是否依然畅通无阻。
- Moonshot AI的Kimi K3是迄今最大的开源权重模型,其发布重新引发了华盛顿的政策辩论。
- 讨论的机制包括联邦采购规则、出口黑名单和安全建议,这些将通过云服务提供商影响全球企业。
中国AI模型使特朗普的AI世界陷入内讧
中国开源AI模型Kimi的发布,引发了特朗普政府内部AI战略家的分裂。该模型性能媲美OpenAI和Anthropic的付费模型,却完全免费,对特朗普的经济和政治构成挑战。围绕如何应对中国AI竞争,各方意见不一,从开放支持到加强管控,分歧加剧。
- 中国公司Moonshot发布免费开源模型Kimi,性能接近顶级付费模型。
- 特朗普前AI顾问David Sacks与现任官员Emil Michael公开批评美国AI公司。
面向长时域机器人操作的预见性残差强化学习与视觉-语言-动作模型
本文提出预见性残差强化学习(Foresight Residual RL),通过在冻结的视觉-语言-动作(VLA)基策略上添加一个离线估计的预见值(即当前子任务终止状态下未来子任务成功的概率)来优化子任务间的交接质量,从而提升长时域机器人操作的成功率。在Isaac Gym中的三阶段扳手螺母拧紧任务上,该方法实现了85.6%的完整任务成功率,显著优于标准子任务残差RL(54.5%)和VLA基线。
- VLA策略在紧公差、接触密集的装配任务中因长时域信用分配和子任务耦合而失败
- 标准残差RL孤立优化每个子任务,但链式执行时因终端状态质量不可控而收益甚微
PRISM:面向非结构化环境中机器人导航的多模态地形测绘系统
PRISM是一种多模态感知系统,通过融合热成像、光学和深度传感器,结合新型视觉变换器网络OmniUnet,实现非结构化环境中的地形分割与可通行性地图生成,并在资源受限的嵌入式计算机上成功部署,支持自主导航。
- PRISM集成了RGB、深度和热成像传感器,实现多模态地形感知。
- 核心网络OmniUnet基于视觉变换器,专为多模态语义分割设计。
HyperDCM:双曲空间中的动态聚类记忆回放实现跨场景持续机器人导航
针对视觉导航中的灾难性遗忘问题,研究者提出HyperDCM,一种结构感知的记忆机制。它利用大视觉语言模型提取场景语义三元组,通过关系图卷积网络编码为场景图嵌入,并投影到双曲空间增强结构分离性。动态聚类和结构敏感更新策略选择代表性样本进行记忆回放,保持知识多样性。实验表明,HyperDCM在多场景室内外数据集上优于现有持续学习方法。
- 提出HyperDCM,结合场景图建模和记忆回放增强扩散策略导航。
- 利用大视觉语言模型和R-GCN提取并编码场景语义。
面向部分标注的多任务面部情感识别的共享潜变量
提出一种共享潜变量方法,通过变分瓶颈在部分标注的多任务面部情感识别中实现跨任务信号共享,在s-Aff-Wild2数据集上提升表情识别宏F1至0.446,并通过第二个骨干网络突破动作单元瓶颈。
- 将部分标注的多任务学习视为对共享情感潜变量的边缘化,一个变分瓶颈协调三个任务解码器。
- 在s-Aff-Wild2上,仅37%的帧具有全部标签,该方法将表情宏F1从0.403提升至0.446。
MAC 2026:推动微动作分析迈向细粒度理解
第三届微动作分析大挑战赛(MAC 2026)与ACM Multimedia 2026同期举办,通过引入利用多模态大语言模型评估的新任务,将微动作分析从识别推进到细粒度理解。本文详细介绍了数据集、协议、竞赛结果以及该新兴领域的未来方向。
- MAC 2026引入了使用多模态大语言模型的细粒度微动作理解任务。
- 该挑战超越传统的识别与检测,深入解读细微的人类行为。
GenSyn10:用于基准测试图像分类的多生成式AI数据集
GenSyn10是一个包含6万张合成图像的数据集,与CIFAR-10对齐,使用三种架构不同的生成模型创建,旨在推进AI生成图像检测研究。评估显示,模型在已知生成器上表现良好,但在未知生成器上性能显著下降,凸显了分布外泛化的局限性。
- GenSyn10包含6万张32x32的合成图像,覆盖10个类别,由FLUX.2-dev、HunyuanImage-3.0和Qwen-Image-2512三种模型生成。
- 在20种图像分类模型上评估,CIFAR-10训练模型零样本准确率达96.86%,微调后达99.88%。
移动如人:面向毫瓦级硬件的实时空中人员追踪的自我运动归一化时间特征
本文提出EMTS-Det系统,用于无人机上的实时跟随人员追踪,在低功耗硬件上实现高效运行。系统通过自我运动归一化的残差运动通道检测人员,使用仅22k参数的轻量网络,在Raspberry Pi Zero 2W上达到31.85 FPS,性能远超YOLOv8n。
- EMTS-Det系统仅需22k参数和7.6 MFLOP计算量,在资源受限设备上实现实时人员追踪。
- 通过自我运动归一化残差运动通道,系统能在10-60像素的小目标上有效区分人与背景。
3D FaceShell:3D面部头像中的属性转移作为VLM防御机制
研究人员提出3D FaceShell框架,通过向3D面部头像添加微妙扰动来误导视觉语言模型推断敏感属性,同时保持视觉身份不变。
- 3D FaceShell使用可学习的高斯壳为3D头像提供隐私保护。
- 它能在不改变人类可识别外观的情况下重定向VLM属性推断。
JEPA预测器:可迁移的遮挡特征补全算子
联合嵌入预测架构(JEPA)在训练时联合训练预测器与编码器,但下游部署通常丢弃预测器。研究表明,JEPA预测器可作为可迁移的遮挡特征补全算子,通过线性投影适配到不同编码器族,显著提升遮挡分类精度。
- JEPA预测器是学习从可见上下文特征到被遮挡位置特征的算子,可跨编码器族迁移。
- 通过线性投影将I-JEPA和V-JEPA 2的预测器适配到CLIP、DINOv3等编码器,仅需500张图像进行闭式拟合。
尽管语言模型努力仍会犯错:用于自纠正科学生成的共形预测
本研究提出科学可行性控制(SFC)框架,一种图结构共形预测方法,为科学推理的有效性提供统计保证。SFC将科学推理分解为原子单元,通过渐进式绝对一致事实性验证,在检测到违反科学原则时动态分支到替代生成路径。实验表明,SFC在PhyX等多模态科学推理基准上达到50.1%的准确率,超过DeepSeek-R1和GPT-4,同时将科学定律违反减少73%,并提供91.7%的科学有效性保证。
- SFC采用图结构共形预测,对科学推理中的逻辑依赖进行建模。
- 通过动态分支机制,在检测到科学错误时切换到已验证的上下文。
算术启发式神经元是否具有形式不变性?对LLM中符号、文本和代码的机制分析
本研究通过机制可解释性方法,分析Llama-3模型在符号算术、自然语言应用题和Python代码三种形式下的算术计算机制,发现一组紧凑的共享神经元在三种形式中均被激活,且跨格式失败源于激活状态而非不同电路,表明LLM的算术计算在神经元层面具有形式不变性。
- 使用归因修补和激活修补的两阶段管道识别算术启发式神经元。
- 发现一组紧凑的共享神经元在符号、文本和代码三种形式中均起作用。
SpecLA: 线性注意力模型的高效推测解码
本文提出了 SpecLA,一种针对有状态线性注意力模型的推测解码运行时。它通过拓扑感知内核验证链和树,存储验证过程中产生的紧凑因子以恢复接受状态,并使用置信剪枝和目标对齐的EAGLE风格草案生成器提供有用候选。在NVIDIA H100上使用公共GDN-1.3B目标,SpecLA实现了比自回归解码高达1.70倍的端到端加速。
- 线性注意力模型用循环状态替代增长的KV缓存,但自回归解码仍逐令牌处理。
- 现有推测解码系统设计用于Transformer KV缓存,不适用于有状态线性注意力模型。
OpenLanguageModel:用于教育和研究的可读可组合小语言模型预训练
OpenLanguageModel (OLM) 是一个开源的 PyTorch 库,用于构建和预训练小型语言模型,同时保持其内部机制可见。模型代码直接反映架构,组件如 Block、Residual、Repeat 和 Parallel 描述连接方式。OLM 集成了分词器、数据集、优化、混合精度、回调、检查点以及硬件感知的执行,支持从教学笔记本到完整预训练的无缝迁移。该库包含 9 个常见模型家族的 27 个预设,并提供从基础到架构研究的文档。验证显示与独立参考实现高度一致,348M 参数模型在四 GPU 上弱扩展效率达 90.6%,且早期可用性反馈积极。OLM 采用 MIT 许可证,可通过 PyPI、GitHub 和文档站点获取。
- OLM 提供可读的模型代码,直接对应架构组件,便于教学和研究。
- 支持从笔记本到完整预训练的无縫迁移,集成完整训练流程。
从记忆到技能:基于证据的长期LLM代理协同进化治理
现有长期LLM代理的记忆系统往往将先前轨迹作为被动上下文检索,而非转化为可执行能力。本文提出MSCE框架,一种无需训练的记忆-技能协同进化框架,将代理经验组织为基础步骤轨迹、可重用过程策略和声明性环境认知。MSCE将具有正估计增益的证据支持的L2策略结晶为可调用技能,并引入反射加权值回填。实验表明MSCE显著优于现有方法。
- MSCE将代理经验组织为基础步骤轨迹、可重用过程策略和声明性环境认知。
- 通过反射加权值回填,MSCE将稀疏终端反馈传播至密集局部自我反思,产生证据校准的轨迹值。
NOWJ@COLIEE 2026:法律检索与推理的自适应流水线
本文介绍了NOWJ团队在COLIEE 2026竞赛中五项任务的方法和结果,包括法律案例检索、先例推理、法条检索与推理、法律文本蕴含以及法律判决预测,提出了多种自适应流水线和深度学习模型。
- 提出四阶段法律案例检索流水线,包括候选过滤、密集检索、交叉编码器重排序和自适应截断预测
- 法律案例蕴含任务结合BM25过滤、T5重排序和LLM蕴含验证
编码脑电信号探究语言模型中类似人类的下一词预测行为
该研究通过脑电图记录的事件相关电位(ERP),对比人类与语言模型在下一词预测任务中的表现,发现仅信息论中的“惊奇度”指标与语言处理的ERP相关,尤其是对于语义丰富的高内容词,而模型规模扩大并不必然带来更类人的认知处理。
- 语言模型在下一词预测准确度上接近人类,但高准确度未必反映人类阅读理解的认知信号。
- 研究使用顶部预测和惊奇度两种信息度量,建模ERP模式以分析LMs的认知合理性。
在推理之前已承诺:行为复现及开放权重LLM中答案预承诺的初步激活水平证据
一项新研究通过简单问题(洗车应步行还是开车)揭示了语言模型常先决定答案再推理以证明其合理性,而非从前提推导。实验表明Qwen3-8B模型在多数情况下错误承诺步行,即使开车是唯一合理选择。研究者通过激活层次分析发现,模型在输出答案前已显示出向步行倾斜的迹象,即便最终回答开车。该发现提示现有模型存在推理前的决策偏差。
- Qwen3-8B在简单洗车任务中85-100%的采样输出错误推荐步行,即便开车才符合逻辑。
- 模型在输出答案前,隐藏状态已显示步行偏向,甚至对最终回答开车的例子也是如此。
RIMS:面向小型语言模型检索增强生成的平滑多对偏好优化框架
小型语言模型在检索增强生成中易受噪声证据影响。本文提出RIMS,一种三阶段偏好优化框架,包括合成思维链偏好数据生成、可微平滑聚合机制和偏好优化。实验表明其在多跳问答基准上优于现有方法。
- 提出RIMS框架,通过平滑多对聚合优化小型语言模型的偏好学习
- 使用目标模型自身进行拒绝采样生成合成偏好数据,不依赖专有模型
多级上下文建模实现混合专家模型中的一致专家选择
混合专家模型(MoE)通过将令牌路由到一小部分专家来高效扩展Transformer模型。然而,现有路由器通常基于浅层或孤立的令牌表示来选择专家,导致路由决策不稳定且语义不一致。本文从表示角度重新审视专家选择,并提出多级上下文融合MoE(MCF-MoE)框架,通过整合跨层语义聚合和局部令牌交互的互补信号来构建上下文感知表示,从而实现更信息丰富且一致的专家选择。实验表明,MCF-MoE在路由一致性和下游性能上均优于强基线,凸显了上下文完整性在专家路由中的重要性。
- 现有MoE路由器因上下文不完整导致路由不一致。
- 提出MCF-MoE,融合跨层语义与局部令牌交互。
用于乳腺癌亚型分类与生存预测的令牌级跨模态Transformer与对比多任务学习
本研究提出了一种令牌级跨模态Transformer模型,结合对比多任务学习,用于整合基因组和临床数据,实现乳腺癌亚型分类与生存预测的联合优化,克服了现有方法中模态交互粗糙、融合方式简单、目标独立优化等局限。
- 现有方法将每种模态视为整体特征向量,无法进行细粒度令牌级交互。
- 提出令牌级跨模态Transformer实现结构化令牌交换。
从权重到语言:用自然语言表达和编辑偏好模型推理
本文提出“从权重到语言”方法,自动从选择数据中发现以自然语言描述的偏好维度,解决偏好学习中的欠确定性和黑箱问题。实验表明,该方法能提高预测准确率,并允许用户实时检查和编辑模型推理。
- 提出“从权重到语言”方法,自动提取自然语言描述的偏好维度。
- 在道德困境、电影、葡萄酒和LLM响应等四个领域验证了方法的通用性。
算子感知的混合精度容差校准应用于张量核
本文提出了一种基于算子感知的混合精度容差校准方法,通过挖掘累积的云GPU运行数据,自动确定张量核正确性测试的最佳绝对容差,相比手工选择的容差更严格,并显著提高了错误检测召回率。
- 当前张量核测试使用固定手工选取的容差,很少更新。
- 新方法通过分析云GPU运行中的误差分布来校准每个算子的容差。
LLM遗忘机制在网络安全中的应用:方法、挑战与新兴威胁综述
大型语言模型在关键领域的部署带来了遗忘能力的缺失,导致隐私泄露和安全风险。本文综述了基于梯度的LLM遗忘方法,探讨其是否真正移除知识或仅抑制表达,并分析了安全、鲁棒性和可验证遗忘的挑战。
- LLM遗忘技术旨在在不完全重训练的情况下移除模型中的敏感或危险知识。
- 当前方法主要是基于梯度的,但存在知识是否真正被移除的争议。
支持本地机器学习的新型智能眼镜平台
本文介绍ARGO智能眼镜平台,利用STM32N6微控制器及其集成NPU实现本地机器学习,保护隐私并降低延迟。通过软硬件协同设计,部署优化后的YOLOv11模型进行实时城市障碍物识别,引入头并行注意力机制(HPA)适配NPU,模型仅占用2.483 MB内存,mAP50-95达24。该平台集成多模态传感器,以10 FPS运行,200 mAh电池续航约113分钟,展示了高性能、隐私保护且社交可接受辅助设备的可行性。
- ARGO智能眼镜平台采用STM32N6微控制器和NPU,实现本地ML处理,避免云依赖
- 引入头并行注意力(HPA)优化YOLOv11模型,在严格内存限制下达到mAP50-95 24
DocOCR-Eval:一种基于校正的无真实标注OCR工具选择框架
本文提出DocOCR-Eval,一种无需人工标注的评估框架,用于自动评估和选择OCR工具。该框架通过三阶段校正和排序策略,在缺乏真实标签的情况下近似基于标注的工具排序。实验表明,聚合多个多模态大语言模型可逐步提升与人工标注排序的一致性,为实际部署文档解析系统提供指导。
- DocOCR-Eval无需人工标注即可评估OCR工具性能。
- 采用三阶段校正和排序策略近似真实排序。
仅需8个token:通过辅助分支的弱到强离策略强化学习
一种新的强化学习方法W2SPO,利用弱辅助模型在大型语言模型推理路径中注入简短片段,在数学推理任务上提升了性能并加速训练。
- 标准强化学习用于大型语言模型时存在语义冗余和支持有限问题
- W2SPO在中间轨迹中注入短辅助片段(最少8个token)
掩码扩散语言模型成为智能体强化学习中强大且可操控的文本世界模型
强化学习领域需要多样化的训练环境,但传统手工设计的环境难以扩展。自回归世界模型存在从左到右的偏差,无法充分利用全局状态信息。一项新研究提出使用掩码扩散语言模型(MDLM)作为文本世界模型,通过双向锚点感知去噪,在连贯性和多样性上显著优于参数规模大4倍的语言模型,并引入GRPO训练框架实现高达47%的零样本迁移性能提升。该工作已开源。
- MDLM在文本世界建模中比自回归语言模型在连贯性和多样性上表现更好。
- 双向锚点感知去噪允许基于全局状态锚点进行条件生成。
生成式本体归纳:使用大语言模型从文档语料库中发现领域无关的模式
本文提出生成式本体归纳(GOI),一种领域无关的框架,能从示例语料库中归纳出实体、维度、属性、关系和约束的生成蓝图,并导出为带有六种节点类型和七种边类型的类型图(YAML/JSON格式)。引入节点覆盖率评分(NCS)评估指标。在四个对比本体上的验证表明,GOI提示生成覆盖了95-100%的结构骨干,而通用模板覆盖率显著下降。
- GOI是一种领域无关的本体归纳框架,利用大语言模型从文档语料库中自动发现模式。
- 输出为类型图(六种节点、七种边),支持YAML/JSON格式,可直接用于下游管道。
AI代理系统确定性重放框架agrepl
AI代理系统因结合大语言模型与外部工具而本质非确定性。arXiv论文提出agrepl框架,通过MITM代理拦截外部交互,实现运行轨迹的确定性重放,并凭噪声感知差异算法区分HTTP头部变化。实验显示重放保真度F=1.0,单步延迟降低98.3%。
- AI代理系统(LLM+工具/API)的运行本质上非确定,难以复现。
- agrepl框架使用MITM代理记录全部外部交互,并在隔离环境中重放。
PlanFlip:通过规划阶段提示注入攻击多智能体LLM系统
一项新研究提出PlanFlip框架,包含四种针对多智能体LLM系统规划阶段的提示注入攻击。研究发现,更强的模型(如GPT-5)反而更易受攻击,同质化骨干网络存在相关智能体盲点,而推理增强型模型(如DeepSeek-R1)能抵御攻击。提出的两种防御方法检测率高达1.00。
- PlanFlip引入四种针对多智能体系统规划阶段的提示注入攻击。
- 更强的模型(如GPT-5)攻击成功率更高,挑战了能力即安全的假设。
一些大型语言模型表现出一致的风险态度
一项新研究通过跨领域框架测试了大型语言模型(LLMs)在不确定性下的风险态度,发现大多数模型在任务内和跨任务中都表现出稳定且一致的风险偏好,且其风险态度分布比人类更集中。
- 研究引入跨领域框架,将情境风险信念与类别决策分离,测试了6个LLM和100名人类参与者。
- 大多数LLM在空间导航、临床分诊和财务分配任务中表现出稳健的任务内一致性。
轻量级1D CNN的设计与验证:用于软毛绒伴侣的情感触觉分类
本研究提出了一种基于MATLAB的开源框架,用于开发软交互伴侣中的情感触觉识别紧凑深度学习模型。通过468个CNN模型的系统探索,确定了13.2k参数的扩张1D CNN为最佳方案,测试准确率75%,留一法交叉验证准确率85%。混合推理管道结合瞬时启发式滤波和CNN精细分类,可在20 Hz实时运行,实现隐私保护的情感触觉解读。
- 公开了1326个手势序列的FAIR兼容数据集,涵盖25名参与者。
- 13.2k参数的1D CNN达到75%测试准确率和85%留一法交叉验证准确率。
Concentrate: LLM网关
Concentrate 是一个托管的LLM网关,提供单一API访问超过130个来自主要供应商的模型。它具备模型路由、支出跟踪、安全控制和故障转移冗余等功能,专为扩展AI生产的团队设计。
- 单一API可访问来自OpenAI、Anthropic、Google等提供商的130多个模型。
- 内置数据脱敏、零数据保留、审计日志、SSO和RBAC等安全功能。
开放权重AI是减速主义的吗?
OpenAI战略未来主管Dean Ball认为开放权重模型本质上是减速主义的,因为它们抑制资本支出。本文从经济学角度探讨了这一观点,分析了中国在AI基础设施方面的投资、训练范式的转变以及价值在价值链中的迁移。文章认为,开放权重模型可能通过降低成本扩大应用范围,促进创新,从而实际上是加速主义的。
- Dean Ball声称开放权重模型是减速主义的,因为它减少了资本投资。
- 中国可能通过补贴产能和压缩利润加剧这一趋势。
Colibrì概念验证:用25GB内存运行1.5TB的AI模型
意大利工程师Vincenzo(又名JustVugg)创建了Colibrì,这是一个概念验证项目,能够在仅25GB RAM和1GB/s NVMe的CPU上运行7440亿参数的GLM-5.2模型(1.5TB)。尽管速度极慢(每0.05-0.1秒一个token),但利用混合专家(MoE)架构按token加载专家,实现了前沿水平的回答质量。项目开源,旨在探索在消费级硬件上运行大型模型的可行性。
- Colibrì在低端硬件上运行1.5TB的GLM-5.2模型,速度仅0.05-0.1 token/秒。
- 利用MoE架构按token加载专家子模型,通过反复加载/卸载适应有限内存。
GPT-5.6 Sol 与 Kimi K3 在《坎巴拉太空计划》中实时竞速直播
直播中,GPT-5.6 Sol 与 Kimi K3 在《坎巴拉太空计划》里进行速度竞赛,展示 AI 在复杂游戏中的实时决策能力。
- GPT-5.6 Sol 和 Kimi K3 在 Twitch 直播中竞速《坎巴拉太空计划》。
- 比赛考验 AI 的实时规划与操作技巧。
阿里通义实验室发布Qwen-Audio-3.0-TTS:支持16种语言的Flash和Plus两档托管文本转语音模型
阿里通义实验室推出Qwen-Audio-3.0-TTS,一款面向生产的文本转语音系统,提供Flash(实时交互)和Plus(高质量生成)两档,通过阿里云模型托管服务交付。该模型覆盖16种语言和20种中文方言,支持自然语言风格控制和86种细粒度内联标签,并在Artificial Analysis语音竞技场中排名第一。文章详细介绍了模型架构、性能表现、开发者反馈及定价信息。
- Qwen-Audio-3.0-TTS提供Flash(约300毫秒首包延迟)和Plus(质量优先)两个版本,均为API托管服务。
- Plus版本在Artificial Analysis竞技场Elo评分约1236,每百万字符价格约27.59美元,但吞吐量仅约16字符/秒。
逆向工程现在变得便宜了
不断有用户分享他们利用编码代理逆向工程并自动化家中设备的轶事。这展示了编码成本降低带来的影响。过去,逆向工程虽然可行,但投资回报率低,且需面对不稳定API的维护风险。编码代理彻底改变了这一局面,降低了初始工作和失败的成本,也减轻了未来维护的心理负担。
- 编码代理降低了逆向工程和自动化的门槛
- 过去因成本高、维护风险大而不值得做的项目现在变得可行
谁在害怕中国模型?
本·汤普森提出美国应立法明确训练数据为合理使用,并禁止禁止蒸馏的服务条款,以帮助美国开源模型与中国模型竞争。同时,阿里巴巴决定发布Qwen 3.8 Max开源权重,可能受习近平鼓励开源合作的讲话影响。
- 本·汤普森建议美国立法将训练数据收集定为合理使用,并禁止禁止蒸馏的服务条款。
- 蒸馏(即查询API)几乎无法阻止,美国应转变政策,鼓励通过训练成果推动创新。
Kimi K3:开放权重升级
Moonshot AI发布了最新旗舰模型Kimi K3,这是一个2.8万亿参数的MoE模型,将于7月27日开放权重。K3在多项基准测试中排名靠前,成为最强的开源模型。文章探讨了中美AI模型差距缩小、中国开源策略、开源模型的经济影响以及中国AI的效率优势。
- Kimi K3是2.8T参数的MoE模型,开放权重,性能接近前沿闭源模型。
- 中国AI实验室展示出独立创新能力,而不仅仅是快速追随。