NVIDIA Vera Rubin:每瓦性能领先,为全球合作伙伴提供最低令牌成本
NVIDIA Vera Rubin NVL72 正加速生产,与 CoreWeave、Google Cloud、Microsoft Azure 和 Oracle Cloud Infrastructure 等合作伙伴共同部署。该平台通过极致协同设计实现最高的每瓦性能和最低的令牌成本,在 DeepSeek-R1 基准测试中每兆瓦吞吐量比 Grace Blackwell NVL72 提升 10 倍。Vera Rubin 还支持欧洲开放模型时代,与微软和 Mistral 合作扩展 AI 基础设施。
- Vera Rubin NVL72 生产加速,覆盖全球 30 个国家 350 多个工厂站点
- 每兆瓦吞吐量比上一代提升 10 倍,令牌成本降低至十分之一
为Vera Rubin打造,NVIDIA Spectrum-6抵达千兆级AI工厂
NVIDIA宣布其102.4太比特每秒的Spectrum-6以太网交换机系统已开始交付,该系统作为Vera Rubin平台的一部分,专为千兆级AI工厂设计,提供两倍于上一代的带宽。CoreWeave、Microsoft、Nebius等领先AI基础设施构建者将首批部署。Spectrum-6是Spectrum-X以太网平台的新一代核心,通过智能交换、ConnectX-9 SuperNIC和全栈软件,实现高达1.6倍的AI网络性能提升和95%的网络效率。
- Spectrum-6提供102.4 Tbps容量,是前代的两倍
- 首批采用者包括CoreWeave、Microsoft、Nebius、SpaceXAI和Tesla
你的AI在哪里运行比它有多聪明更重要——尤其是在阿联酋
在阿联酋,企业AI的选择不仅关乎模型能力,更取决于数据运行地点、实际运营成本和法规合规性。前沿模型与本地开源模型的能力差距正在缩小,但自建基础设施的成本高昂。阿联酋的监管环境要求严格的数据本地化,催生了主权云和混合架构的解决方案。企业应采用“红绿灯”路由系统,根据数据敏感度分配模型使用,并先验证需求再投资硬件。
- 前沿模型和本地模型的取舍:前沿模型能力最强但数据控制权弱,本地模型控制权强但成本高且需自维护。
- 能力差距缩小:2026年开源模型在多数企业级任务上已接近前沿模型,如MiniMax M2.5和Kimi K3等。
使用 llama.cpp 和 Pi 本地运行 Mythos 增强编码模型
了解如何使用 llama.cpp 本地运行 Qwythos-9B-Claude-Mythos-5-1M 模型,将其连接到 Pi 编码代理,并通过 MTP 推测解码和 OpenAI 兼容 API 构建快速的本地编码工作流。
- 安装 llama.cpp 并本地运行 Qwythos MTP 模型,支持 GPU 加速和推测解码。
- 通过 pi-llama 插件将本地服务器连接到 Pi 编码代理,进行代理开发。
反驳乔治·霍茨关于“AI 2040与智能崇拜”的观点
马修·特隆普批评乔治·霍茨对AI 2040场景的否定,认为霍茨低估了快速AI突破的可行性、监管的必要性以及未对齐AI的风险。他捍卫Plan A的监管方法,并质疑霍茨的开放源码AI“Plan L”。
- 霍茨对硬起飞持怀疑态度,但AI 2027展示了无需魔法的可行路径。
- 物理限制如供应链是可以管理的;海上数据中心是可行的。
Show HN:Neverbell——全天候AI交易代理
Neverbell是一个AI代理技能,为交易股票、ETF、大宗商品和加密货币提供直接市场准入,支持杠杆操作。用户可通过自然语言指令让代理执行交易、监控市场和管理头寸,实现7x24小时自动化交易。它并非独立交易平台或财务顾问,用户完全掌控风险。
- Neverbell让AI代理直接接入市场,可交易300多种资产(股票、ETF、大宗商品、加密货币),支持做多/做空和杠杆。
- 用户通过自然语言与代理交互,设置自动化策略、接收新闻情绪分析,甚至让代理自主开平仓。
硅谷的头痛:中国正在削弱美国在人工智能竞赛中的领先地位
谷歌人工智能的困境引发担忧,中国新模型再次挑战美国科技主导地位。硅谷工人也采取行动保护自己的工作免受AI影响。其他新闻包括纽约暂停新AI数据中心、IBM股价暴跌、亚马逊云服务巨额账单、特朗普加密货币收入等。
- 中国AI模型再次展示实力,威胁美国领先地位
- 谷歌AI表现不佳,引发行业担忧
5门免费课程:从AI新手到实践者
本文介绍了一个由5门免费课程组成的路线图,从经典算法到从头训练大语言模型,帮助有Python基础的学习者系统掌握AI技能。
- 哈佛CS50 AI课程建立AI逻辑基础
- 谷歌机器学习速成课程掌握数学与TensorFlow
“仅次于Fable 5”:阿里巴巴发布Qwen3.8,但未提供任何真实数据
阿里巴巴宣布推出其最新大语言模型Qwen3.8,声称仅次于Anthropic的Fable 5,但未提供任何基准测试或模型卡。此举发生在竞争对手月之暗面发布Kimi K3并附有详细技术细节之后。阿里巴巴的声明缺乏透明度,引发对其发布时机和动机的质疑。
- 阿里巴巴声称Qwen3.8仅次于Anthropic的Fable 5,但未提供任何数据支持。
- 该声明紧随月之暗面发布Kimi K3之后,后者提供了完整的基准测试和技术细节。
上周AI资讯 #251 - Mythos回归、Sonnet 5、Etched、LongCat
Anthropic与美国政府谈判后重新部署Claude Fable 5,增加网络安全分类器,并推出Claude Sonnet 5更便宜版本;Google NotebookLM新增TikTok风格视频摘要,Nano Banana 2 Lite图像生成器发布;Etched获大量投资打造全栈推理硬件,百度AI芯片单元计划IPO,Agility Robotics通过SPAC上市,DeepSeek扩招,中国发布Longcat 2.0 MoE模型及长周期智能体基准测试。
- Anthropic重新部署Claude Fable 5,增加网络分类器和安全框架
- Anthropic推出Claude Sonnet 5,以更低价位支持智能体应用
Show HN: Enlarger • 一款保持细节而非平滑处理的本地放大工具
Enlarger是一款本地图像放大工具,它不使用生成式AI,而是通过重构已有细节并应用后期处理来保持纹理和质感。支持批量处理、离线运行,一次性付费,无订阅。适合摄影师、设计师等专业人士。
- 非生成式AI放大:重建细节而非凭空想象,避免过度平滑或幻觉。
- 本地离线运行:图像不上传云端,保护隐私。
上周AI #250 - Mythos 混乱、GPT 5.6-Sol、GLM 5.2
本期涵盖Anthropic的AI条约讨论、美国政府影响AI模型发布、OpenAI处理器开发、内存市场影响等话题。
- 美国政府扩大对前沿AI的管控,Anthropic获准向特定公司发布Mythos-5,OpenAI推出GPT-5.6 Sol,初始访问受限。
- 模型能力与安全信号仍不明确,基准测试披露有限。
LWiAI播客第249期:Fable 5禁令、SpaceX收购Cursor与众多开源项目
本期播客讨论了Anthropic应美国政府要求切断对Fable 5和Mythos 5的访问、SpaceX以约60亿美元收购AI编码初创公司Cursor、基础设施与商业更新(如Anthropic寻求Google支持的租赁、OpenAI财务泄露等)、以及多项开源项目和政策动态。
- Anthropic因美国政府命令切断对Fable 5和Mythos 5的访问,引发关于一致性和出口管制的辩论。
- SpaceX以约1.75万亿美元估值IPO后,宣布以600亿美元收购AI编码初创Cursor,增强xAI实力。
LWiAI播客第248期:Claude Fable 5、Siri AI、Anthropic IPO等AI大事件
本期播客讨论了Anthropic发布的Claude Fable 5模型及其安全争议、Apple在WWDC上宣布的Siri AI、Google的Gemini 3.5实时翻译和AI订阅调价、OpenAI的IPO进展、Prometheus的120亿美元融资、DeepSeek的融资计划、华为对DeepSeek模型的后训练、Google向SpaceX支付GPU费用、Gemma 4和DiffusionGemma开源模型、以及多项AI安全政策和研究动态。
- Anthropic发布Claude Fable 5,性能大幅提升但也引发了关于安全护栏和隐形降级的争议。
- Apple宣布Siri AI,基于与Gemini的合作,旨在提供更强大的对话助手。
百时美施贵宝购买英伟达AI系统用于药物发现
百时美施贵宝将购买基于英伟达Vera Rubin架构的DGX SuperPOD,用于支持其药物发现和开发过程中的人工智能应用。这家制药公司表示,它将成为首家获得基于Vera Rubin的DGX SuperPOD的生命科学企业。该系统将提供10倍于现有基础设施的性能功耗比,并支持化合物、蛋白质等科学数据的模型训练与预测。
- 百时美施贵宝购买英伟达Vera Rubin DGX SuperPOD,用于AI驱动的药物发现
- 系统包含8个DGX Vera Rubin NVL72机架,性能功耗比提升10倍
LWiAI播客第247期 - Opus 4.8, MAI, Anthropic IPO, Minimax-M3
本期播客讨论了Anthropic发布Claude Opus 4.8、微软推出MAI模型、Anthropic IPO以及Minimax-M3等AI新闻。
- Anthropic发布Claude Opus 4.8并引入动态工作流工具
- 微软推出Scout助手和MAI模型系列,包括MAI Thinking 1
面向编码代理的私有推理
Zro 是一个面向编码代理的私有推理端点,在欧盟基础设施上提供开源权重模型,零数据保留,不训练用户数据,支持长上下文和多轮编码会话。它集成了 Claude Code、Codex 等工具,提供 OpenAI 和 Anthropic 兼容的 API。
- 在欧盟基础设施上运行,零请求保留,不训练客户数据。
- 支持 MiniMax M3 和 GLM-5.2 等开源编码模型。
中国开源权重模型便宜,华盛顿正在决定其代价
美国政策制定者正在讨论是否通过监管风险来限制中国开源权重模型的使用。Moonshot AI的Kimi K3模型发布后,这一争论再次升温。企业面临的问题不仅是性能,还有未来一年内使用这些模型是否依然畅通无阻。
- Moonshot AI的Kimi K3是迄今最大的开源权重模型,其发布重新引发了华盛顿的政策辩论。
- 讨论的机制包括联邦采购规则、出口黑名单和安全建议,这些将通过云服务提供商影响全球企业。
NVIDIA 发布 Cosmos 3 Edge:40亿参数开放世界模型,实现设备端机器人动作推理与生成
NVIDIA 推出 Cosmos 3 Edge,一个仅40亿参数的开放世界模型,专为设备端运行设计。它能帮助机器人和视觉AI代理理解环境、实时推理,并在本地生成机器人动作。该模型是 Cosmos 3 系列的最小成员,此前已发布160亿参数的 Nano 和640亿参数的 Super。Edge 型号针对内存受限的边缘系统(如工厂、仓库和医院)提供数据中心级别的性能。
- Cosmos 3 Edge 是一个40亿参数的开放世界模型,于2026年7月20日在 Hugging Face 上发布。
- 采用混合变换器架构,结合自回归推理塔和扩散生成塔,通过共享多模态注意力层协同工作。
中国AI模型使特朗普的AI世界陷入内讧
中国开源AI模型Kimi的发布,引发了特朗普政府内部AI战略家的分裂。该模型性能媲美OpenAI和Anthropic的付费模型,却完全免费,对特朗普的经济和政治构成挑战。围绕如何应对中国AI竞争,各方意见不一,从开放支持到加强管控,分歧加剧。
- 中国公司Moonshot发布免费开源模型Kimi,性能接近顶级付费模型。
- 特朗普前AI顾问David Sacks与现任官员Emil Michael公开批评美国AI公司。
法国在AI竞赛中的优势是廉价能源
法国凭借丰富的核能提供低成本电力,在AI领域获得竞争优势,但美国科技巨头可能抢先将这一资源纳入囊中。
- 法国拥有大量核能,电价低廉,有利于AI算力发展。
- 美国科技公司如谷歌、微软等也在寻求清洁能源,可能抢占法国能源。
智能变得过剩后,什么会变得稀缺?
AI行业面临两大对立策略:一是斥资数千亿美元建设核电站以支持更大规模的AI模型,二是发布可下载的开源模型,使智能几乎免费。文章指出这两种策略并非对立,而是对同一个问题的不同赌注:智能是否存在天花板?如果存在,效率阵营(开源、芯片架构)将获胜;如果需求无上限,蛮力阵营(大规模计算)将胜出。生物学提供了先例:人脑在能量限制下通过架构创新(稀疏性、内存计算)实现了高效。当前开源模型利用这些技巧,但仅覆盖中等难度的任务,而前沿模型仍保持优势。真正的胜负取决于智能天花板的位置。
- AI行业投入巨资建设核电站与发布免费开源模型,看似相反实则是对智能天花板的不同赌注。
- 生物大脑在20瓦功率下通过稀疏性和内存-计算融合等架构创新实现了高效。
SpecLA: 线性注意力模型的高效推测解码
本文提出了 SpecLA,一种针对有状态线性注意力模型的推测解码运行时。它通过拓扑感知内核验证链和树,存储验证过程中产生的紧凑因子以恢复接受状态,并使用置信剪枝和目标对齐的EAGLE风格草案生成器提供有用候选。在NVIDIA H100上使用公共GDN-1.3B目标,SpecLA实现了比自回归解码高达1.70倍的端到端加速。
- 线性注意力模型用循环状态替代增长的KV缓存,但自回归解码仍逐令牌处理。
- 现有推测解码系统设计用于Transformer KV缓存,不适用于有状态线性注意力模型。
OpenLanguageModel:用于教育和研究的可读可组合小语言模型预训练
OpenLanguageModel (OLM) 是一个开源的 PyTorch 库,用于构建和预训练小型语言模型,同时保持其内部机制可见。模型代码直接反映架构,组件如 Block、Residual、Repeat 和 Parallel 描述连接方式。OLM 集成了分词器、数据集、优化、混合精度、回调、检查点以及硬件感知的执行,支持从教学笔记本到完整预训练的无缝迁移。该库包含 9 个常见模型家族的 27 个预设,并提供从基础到架构研究的文档。验证显示与独立参考实现高度一致,348M 参数模型在四 GPU 上弱扩展效率达 90.6%,且早期可用性反馈积极。OLM 采用 MIT 许可证,可通过 PyPI、GitHub 和文档站点获取。
- OLM 提供可读的模型代码,直接对应架构组件,便于教学和研究。
- 支持从笔记本到完整预训练的无縫迁移,集成完整训练流程。
算子感知的混合精度容差校准应用于张量核
本文提出了一种基于算子感知的混合精度容差校准方法,通过挖掘累积的云GPU运行数据,自动确定张量核正确性测试的最佳绝对容差,相比手工选择的容差更严格,并显著提高了错误检测召回率。
- 当前张量核测试使用固定手工选取的容差,很少更新。
- 新方法通过分析云GPU运行中的误差分布来校准每个算子的容差。
支持本地机器学习的新型智能眼镜平台
本文介绍ARGO智能眼镜平台,利用STM32N6微控制器及其集成NPU实现本地机器学习,保护隐私并降低延迟。通过软硬件协同设计,部署优化后的YOLOv11模型进行实时城市障碍物识别,引入头并行注意力机制(HPA)适配NPU,模型仅占用2.483 MB内存,mAP50-95达24。该平台集成多模态传感器,以10 FPS运行,200 mAh电池续航约113分钟,展示了高性能、隐私保护且社交可接受辅助设备的可行性。
- ARGO智能眼镜平台采用STM32N6微控制器和NPU,实现本地ML处理,避免云依赖
- 引入头并行注意力(HPA)优化YOLOv11模型,在严格内存限制下达到mAP50-95 24
[AINews] 今日似乎平静,实则暗流涌动——AI新闻汇总7/18-7/20
表面上平静的一天,但实际充满进展:美国政策瞄准中国开源模型,Kimi K3和Qwen 3.8取得进展,以智能体为中心的泛化方法获得关注,模型展现出超人类数学能力。
- 美国考虑禁止中国尖端开源模型如Kimi,引发技术界反对。
- Kimi K3在DesignArena排名第一;阿里巴巴确认Qwen 3.8 Max将开放权重。
加里·马库斯:美国无法在AI战争中“战胜”中国,我们应该怎么做?
加里·马库斯指出,中国AI模型Kimi K3已追平美国顶级模型,且作为开源模型免费提供,冲击了美国AI公司的商业模式。他回顾了自己2025年以来的警告,认为美国过度依赖大语言模型(LLM)战略失误,导致如今中美AI竞争陷入僵局。马库斯提出七项建议,包括不作为、监管护城河、国有化等,并最终主张AI应成为全球公共品,提议建立类似CERN的国际AI合作项目。
- 中国企业深度求索发布Kimi K3模型,性能媲美美国最佳模型且开源免费,引发美股下跌。
- 马库斯认为美国AI公司如OpenAI和Anthropic的商业模式受质疑,IPO前景堪忧。
将机器人视频转化为训练就绪数据
daft-physical-ai 是一个新的开源 Python 库,基于 Daft 构建,旨在简化物理 AI 中从原始机器人视频到训练模型的数据处理流程。它提供了手部追踪和奖励评分等操作,支持懒加载、批处理和分布式执行,帮助团队跳过数据管道的基础设施工作。
- daft-physical-ai 是一个开源 Python 库,用于将机器人视频转化为可直接用于模型训练的数据。
- 当前支持两个用例:手部追踪(支持 MediaPipe 和 WiLoR)和奖励评分(使用 Robometer-4B 模型)。
开放权重AI是减速主义的吗?
OpenAI战略未来主管Dean Ball认为开放权重模型本质上是减速主义的,因为它们抑制资本支出。本文从经济学角度探讨了这一观点,分析了中国在AI基础设施方面的投资、训练范式的转变以及价值在价值链中的迁移。文章认为,开放权重模型可能通过降低成本扩大应用范围,促进创新,从而实际上是加速主义的。
- Dean Ball声称开放权重模型是减速主义的,因为它减少了资本投资。
- 中国可能通过补贴产能和压缩利润加剧这一趋势。
Colibrì概念验证:用25GB内存运行1.5TB的AI模型
意大利工程师Vincenzo(又名JustVugg)创建了Colibrì,这是一个概念验证项目,能够在仅25GB RAM和1GB/s NVMe的CPU上运行7440亿参数的GLM-5.2模型(1.5TB)。尽管速度极慢(每0.05-0.1秒一个token),但利用混合专家(MoE)架构按token加载专家,实现了前沿水平的回答质量。项目开源,旨在探索在消费级硬件上运行大型模型的可行性。
- Colibrì在低端硬件上运行1.5TB的GLM-5.2模型,速度仅0.05-0.1 token/秒。
- 利用MoE架构按token加载专家子模型,通过反复加载/卸载适应有限内存。
你的指数基金中的SpaceX:解析
本文探讨了SpaceX快速纳入纳斯达克100指数对指数基金投资者的影响。文章解释了指数基金的工作原理,讨论了人们对埃隆·马斯克治理方式的担忧,以及投资者是否应担心市场中的人工智能集中度。
- SpaceX在IPO后不久被纳入纳斯达克100指数,迫使指数基金买入其股票。
- 指数基金被认为是安全的投资方式,即使包括高风险股票如SpaceX。
GraphRAG 过于复杂:我们实际用来构建知识图谱的方法
本文探讨了企业级 AI “公司大脑”构建中的检索增强生成(RAG)技术局限性,指出标准 RAG 仅擅长处理单一事实类问题,而 GraphRAG 虽然理论上能解决多文档综合问题,但其高昂成本、狭窄优势及实体解析难题使其在多数场景下过于复杂。作者介绍了其公司 QX Labs 的替代方案:“类图 RAG”——一种基于普通数据库的轻量级实体-关系系统,无需图数据库、预建图谱或自定义本体,通过惰性总结、固定本体和实体解析瀑布流实现自服务部署,显著降低了成本与运维负担。
- 标准 RAG 仅适用于单一事实问题,而企业需要处理多文档综合及精确计数类问题
- GraphRAG 索引成本是普通向量索引的 1000 倍,且优势主要集中在多跳推理场景
初创公司成立代工厂开发芯片材料
由英伟达、Meta和三星等创始成员组成的联盟,旨在减少对芯片中稀有材料的依赖。
- 英伟达、Meta和三星等公司联合成立一家芯片材料代工厂。
- 该代工厂旨在降低对稀土等稀有材料的依赖。
Stoke – 失控AI智能体的终止开关(Rust,预算上限)
Stoke是一个轻量级的Rust网关,在请求到达提供商之前强制实施硬预算上限、循环检测和速率限制,从而防止失控支出。它还提供跨多台机器的本地优先路由、基于成本/速度的自动路由以及失败关闭架构。
- 每个API密钥的硬美元预算上限,在任何提供商调用之前执行,并实时跟踪每个密钥的支出。
- 循环终止开关,使用精确哈希和语义相似性检测,在几秒内阻止重复请求。
利用 Amazon Quick 和 NVIDIA NeMo Agent Toolkit 为您的业务构建专业化代理工作流
本文展示了如何将 Amazon Quick 作为业务用户的专业代理工作流前端。通过 NVIDIA NeMo Agent Toolkit 构建供应链风险示例,帮助规划人员从 Amazon Quick 仪表盘和知识上下文转向引导式缓解建议。
- Amazon Quick 为业务用户提供结构化数据和企业知识的单一对话工作空间。
- NVIDIA NeMo Agent Toolkit 是开源框架无关库,用于连接、评估、分析和优化代理工作流。
旧金山餐厅因AI菜单图片遭愤怒抵制
旧金山一家新开的餐厅因使用AI生成的菜单图片而遭到社区强烈批评,甚至被涂鸦破坏。店主不得不撤下图片,并计划通过社区活动重建声誉。
- AJ和Lyndsey Lozano在Haight Street新开的Grind & Unwind餐厅因AI菜单图片引发争议。
- Reddit帖子批评这些图片像“垃圾食品”,社区反应强烈,甚至出现涂鸦破坏。
Kimi K3:开放权重升级
Moonshot AI发布了最新旗舰模型Kimi K3,这是一个2.8万亿参数的MoE模型,将于7月27日开放权重。K3在多项基准测试中排名靠前,成为最强的开源模型。文章探讨了中美AI模型差距缩小、中国开源策略、开源模型的经济影响以及中国AI的效率优势。
- Kimi K3是2.8T参数的MoE模型,开放权重,性能接近前沿闭源模型。
- 中国AI实验室展示出独立创新能力,而不仅仅是快速追随。
AI解锁零售、旅游和消费品行业转型的三种方式
本文探讨了AI如何通过三种方式——将暗数据转化为信号、扩展概率推理的问题空间、将人的能力与员工数量脱钩——来解决零售、旅游和消费品行业中信号与行动之间的鸿沟,并强调治理是真正的竞争优势。
- AI作为系统而非试点部署,能同时解决信任、时间和成本三大问题。
- 暗数据转化为信号、概率推理扩展问题空间、人的能力与员工数量脱钩是三个关键转变。
NVIDIA在SIGGRAPH上通过代理AI和物理AI推动图形与仿真发展
NVIDIA在SIGGRAPH 2026上宣布多项创新,包括通过模型上下文协议(MCP)将AI代理集成到创意工具中,推出合成视频检测器NIM微服务以识别AI生成视频,并开源Cosmos 3 Edge世界模型用于本地物理AI。这些进展旨在加速内容创作、媒体验证和机器人技术。
- Adobe、Affinity、Blender等创意应用通过MCP支持AI代理,实现自动化任务。
- NVIDIA发布合成视频检测器NIM微服务,帧级分析视频内容,准确率高达92%。
美国AI封闭且专有,正在输掉竞争
文章分析了美国AI公司通过封闭和专有化模式维持竞争优势,但中国通过开放模型策略正在缩小差距。AI模型自身缺乏护城河,用户容易切换,而中国企业利用开放模型获得分布优势,挑战美国的主导地位。
- AI模型本身缺乏护城河,用户可轻松切换,专有化模式难以锁定客户。
- 美国GPU出口管制限制了中国的全球服务,却促使中国通过开放模型获得分布优势。
Import AI 465:开放与封闭模型差距缩小;Kimi K3;Demis的重大政策计划
英国政府AI安全研究所发现,开放权重模型与封闭前沿模型在网络安全能力上的差距正在缩小。中国公司月之暗面发布Kimi K3模型,性能接近前沿模型,但存在一定脆性。DeepMind创始人Demis Hassabis提出类似FINRA的AGI监管框架。研究显示,AI系统可秘密执行侧信道任务,极难检测。
- 开放权重模型在网络安全能力上追赶封闭模型,差距从6-10个月缩小至4-7个月。
- Kimi K3是一个2.8万亿参数模型,在多数基准上接近Claude Fable 5和GPT 5.6 Sol,但可能过度优化基准。
理解Go AI推理:什么是推理?
本文是系列文章的第一篇,介绍如何从Go语言直接本地运行大型语言模型。文章解释了推理的本质:基于冻结的权重进行下一个标记预测,并详细介绍了自回归循环、分词器工作原理以及GGUF文件格式的结构和加载过程。
- 推理是使用已训练好的模型权重进行下一个标记预测的过程,不涉及学习或更新。
- 模型通过自回归循环逐个生成标记,每次预测后将其附加到序列中继续。
百时美施贵宝基于NVIDIA Vera Rubin打造生命科学行业最先进的AI工厂
百时美施贵宝(BMS)宣布部署其第二代NVIDIA DGX SuperPOD,基于八套DGX Vera Rubin NVL72系统,成为生命科学领域最强大、最节能的AI集群。新系统将向所有科学家开放,无需等待或限制,支持药物发现全流程的AI应用,包括目标识别、化合物库扩展和先导优化。BMS还整合了现有集群,形成统一环境,并通过NVIDIA Mission Control提供AI原生工具。
- BMS部署第二代NVIDIA DGX SuperPOD,采用Vera CPU和Rubin GPU,性能提升10倍/兆瓦。
- 新系统向所有科学家开放,实现“无限计算”,加速药物发现。
中国给美国人工智能霸主地位一记组合拳
中国领先的人工智能公司Moonshot和阿里巴巴发布了新模型,声称能以更低成本与OpenAI和Anthropic的最佳模型竞争。这些开放源代码的发布加剧了中美技术竞赛,并质疑美国巨额投入是否能维持优势。
- Moonshot发布Kimi K3,阿里巴巴推出Qwen3.8,均声称性能接近顶尖美国模型。
- 两家公司强调模型开源,与美国的封闭策略形成对比。
空客从AWS起飞:数字主权的关键一步
空客宣布将约900个应用从AWS迁移到法国云服务商Scaleway,以加强数字主权。此举反映了美国数据保护不可靠的担忧,但供应链管理和AI领域仍面临挑战。
- 空客将900项应用从AWS迁移至法国Scaleway,首批70项优先迁移。
- 数字主权成为商业驱动力,美国被视为数据安全风险。
Kimi K3 开放权重模型:中国最大的人工智能押注内存而非算力
月之暗面发布Kimi K3,一个拥有2.8万亿参数的开放权重模型,采用混合专家架构、量化训练和Delta注意力机制,以内存池化策略应对美国芯片限制。尽管参数庞大,但模型通过降低计算需求来适配受限硬件,实际部署仍需数据中心级基础设施,且软件生态尚未完全就绪。
- Kimi K3 拥有2.8万亿参数,是迄今最大的开放权重模型。
- 采用混合专家架构,每次推理仅激活1.8%的参数,但内存占用不减。
杰夫·贝佐斯与英国政府投资20亿英镑英国初创公司CuspAI
该公司旨在开发AI软件,缩短芯片制造商供应链中的研究时间并减少稀有金属的使用。
- CuspAI获4.5亿美元融资,估值26亿美元
- 投资者包括杰夫·贝佐斯和英国政府主权AI基金
AI数据中心电力限制是2026年的真正瓶颈
文章指出,到2026年,AI基础设施的主要限制将从GPU供应转向电网容量。预计到2027年,40%的AI数据中心将受到电力限制,新电网连接的审批时间长达24-36个月。文章详细分析了电力需求、推理驱动电力曲线,并提出了效率提升、调度和地理分布等策略,同时推广Spheron的分布式GPU网络作为解决方案。
- GPU可用性已改善,但为GPU供电的电网容量现已成为AI数据中心的主要瓶颈。
- 推理工作负载持续运行,驱动大部分能源消耗,需要电力感知规划。
Kimi K3 为何引起华盛顿关注
月之暗面AI发布Kimi K3,在Frontend Code Arena基准测试中夺冠,引发美国AI监管辩论。尽管在前端编码方面表现强劲,但整体仍落后于Claude Fable 5。该发布加剧了AI监管和开源模型的政策争论,对NVIDIA和Anthropic等股票产生影响。
- Kimi K3在Frontend Code Arena获得1679分,击败Claude Fable 5和GPT-5.6 Sol,但Fable 5在14项基准中仍领先8项。
- 白宫顾问David Sacks引用K3证明美国AI监管损害竞争力,加剧政策辩论。