2026年单张24GB GPU可运行的最佳本地LLM:Qwen、Gemma、Mistral、DeepSeek对比 2026-07-20 09:18 UTC+8 本文对比了六款适合单张24GB GPU(如RTX 3090/4090)的开放权重模型,涵盖Qwen3.6、Gemma 4、Mistral Small等,并解释了内存分配、量化策略以及各模型的优势场景。
24GB是本地推理的实际起点,推荐使用20B-35B参数模型而非压缩70B模型。 Qwen3.6-27B是最全面的通用选择,DeepSeek-R1-Distill-Qwen-32B适合深度推理但占用最高。 Show HN: Headroom —— 测量本地AI的GPU真实带宽上限 2026-07-20 08:44 UTC+8 Headroom是一款30秒的浏览器内测试工具,用于测量本地AI推理时GPU内存带宽的真实上限,无需下载模型,使用合成权重,需要WebGPU支持。它通过三种独立方法测量带宽,并检测导致浏览器内LLM输出错误的子组bug。验证表明,当前浏览器引擎受发射开销限制,硬件仍有2-3倍潜力。
30秒浏览器测试,无需模型下载,使用合成权重 三种独立带宽测量:缓冲复制、三读写、纯读归约 价值超过1000美元的AI/GPU/LLM免费积分汇总 2026-07-20 07:21 UTC+8 为AI研究人员整理的免费资源合集,包括超过1000美元的免费计算积分、研究指南、社区论坛等,帮助学生在不花费一分钱的情况下开始AI研究。
提供超过1000美元的免费AI/GPU/LLM积分 包含从想法到论文发表的全套研究指南 台积电加速亚利桑那工厂建设以抓住人工智能“大趋势” 2026-07-20 07:16 UTC+8 台积电首席财务官黄仁昭对CNBC表示,公司正在加速亚利桑那工厂的产能扩张,以应对AI驱动的多年结构性需求。公司额外承诺投资1000亿美元,使在美总投资达到2650亿美元,并将全年资本支出上调至600-640亿美元。台积电正在将5纳米产能转换为先进的3纳米节点,2纳米技术将成为下一季度营收的新驱动力。
台积电额外投资1000亿美元扩大亚利桑那工厂,总投资达2650亿美元。 公司正在将5纳米产能转换为3纳米节点,以满足AI需求。 Feyn AI发布SQRL:一个在编写查询前先检查数据库的文本到SQL模型系列 2026-07-20 06:20 UTC+8 Feyn Labs发布了SQRL,这是一系列文本到SQL模型,能在生成查询前通过只读探针检查数据库。旗舰型号SQRL-35B-A3B在BIRD Dev上达到70.6%的执行准确率,略超Claude Opus 4.6,并可蒸馏为可自托管的4B和9B检查点。
SQRL通过只读探针在提交最终查询前检查数据库。 SQRL-35B-A3B在BIRD Dev上达到70.6%准确率,超过Claude Opus 4.6的68.77%。 阿里巴巴预览Qwen3.8-Max:2.4万亿参数多模态模型,紧随Moonshot的Kimi K3开源发布之后 2026-07-20 05:42 UTC+8 阿里巴巴Qwen团队预览了Qwen3.8-Max-Preview,一个2.4万亿参数的多模态MoE模型,号称“仅次于Fable 5”。该预览已在Token Plan、Qoder和QoderWork上以标准定价的10%提供。但尚未提供任何基准测试表、模型卡、许可证、每token价格或激活参数数量。本文区分了阿里巴巴确认的内容和仅声称的内容。
Qwen3.8-Max-Preview已在Token Plan、Qoder和QoderWork上以10%的优惠价格提供。 2.4万亿参数和“仅次于Fable 5”的排名仅是阿里巴巴的声称,尚未有已验证的基准测试。 福布斯认为AI创造了新职业,但历史早已有之 2026-07-20 05:02 UTC+8 硅谷出现了一批精通AI、加密货币等技术的豪华伴游,客人为了一次深入对话支付数千美元。但这种现象并非AI独有:日本艺伎、希腊赫泰拉等早已存在类似模式。技术改变,但人类对关注和陪伴的需求始终未变。
硅谷豪华伴游通过谈论AI、Nvidia等话题吸引科技富豪,收费高昂。 文章指出该现象并非新奇,历史上艺伎、名妓等皆扮演类似角色。 Moonshot AI 因Kimi K3需求大增暂停新订阅 2026-07-20 00:02 UTC+8 由于Kimi K3需求超出预期,Moonshot AI宣布暂停新订阅以保护现有用户体验。
Kimi K3需求在48小时内接近容量上限 为保护现有用户,暂停新订阅 序列雷达 #897:上周AI要闻:中国、压缩与开放模型竞赛 2026-07-19 19:00 UTC+8 本周AI领域多项重要进展:Thinking Machines发布开源975B参数MoE模型Inkling,Moonshot AI推出2.8万亿参数Kimi K3,PrismML展示可在手机上运行的Bonsai 27B模型。OpenAI的GPT-Red通过自博弈实现自动化红队测试,并在测试中对GPT-5.1达到84%的攻破率。此外,习近平在上海世界人工智能大会上强调开源AI作为全球公共品,呼吁国际合作。
Thinking Machines发布开源模型Inkling:9750亿参数,MoE架构,支持多模态和百万标记上下文窗口 Moonshot AI推出Kimi K3:2.8万亿参数,激活16个专家,针对长时编码和知识工作 从算法到自主:AI如何重写软件与移动出行架构 2026-07-19 18:21 UTC+8 人工智能正从基于规则的程序设计(软件1.0)演变为机器学习(软件2.0),再到如今具有涌现推理能力的自然语言界面(软件3.0)。大规模语言模型(LLM)是一种通用技术,影响广泛,但缺乏物理根基。下一个前沿是空间智能与物理AI,推动自动驾驶和人形机器人发展。
AI经历了从人类编写逻辑到机器学习,再到自然语言界面的三个阶段。 LLM作为通用技术,类似于电力,具有广泛的适用性和变革性。 Show HN: Zlvox – 25款免费开发者工具(AI、JSON、PDF),零追踪 2026-07-19 13:02 UTC+8 Zlvox是一个提供25款免费开发者工具的平台,涵盖AI、JSON、PDF、图像处理等,强调隐私保护(客户端处理,零数据存储)和卓越性能。无需注册即可使用。
25款免费开发者工具,涵盖AI、JSON、PDF、图像等领域,零追踪。 所有工具在客户端运行,数据不离开浏览器,不存储任何用户数据。 Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2:开源万亿参数MoE模型基准测试、许可与成本对比 2026-07-19 09:41 UTC+8 中国三家实验室的旗舰开源MoE模型——Kimi K3、DeepSeek V4 Pro和GLM-5.2——在基准测试、许可条款和服务成本上各有优劣。Kimi K3性能最强但仅限API,DeepSeek V4 Pro成本最低且立即开源,GLM-5.2平衡了速度与可部署性。
Kimi K3(2.8万亿参数)在Artificial Analysis智能指数中以57分领先,但权重需等到7月27日才发布。 DeepSeek V4 Pro(1.6万亿参数)MIT许可,成本仅为K3的1/17,适合注重性价比的团队。 使用NVIDIA NeMo AutoModel对Qwen3进行LoRA微调:完整的单GPU Google Colab工作流教程 2026-07-19 09:08 UTC+8 本教程详细介绍了如何在Google Colab上使用单个GPU,通过NVIDIA NeMo AutoModel对Qwen3-0.6B模型进行LoRA参数高效微调。涵盖环境验证、源码安装、配方加载与调整、命令行训练、模型评估以及Python API调用。
在Colab单GPU上搭建NeMo AutoModel环境 加载并修改Qwen3-0.6B LoRA微调配方 市长曼达尼:房东不得使用AI图像发布出租广告 2026-07-19 06:13 UTC+8 纽约市长佐兰·曼达尼发布《租赁欺诈报告》,要求房东和中介在租房广告中披露是否使用AI生成或编辑的图像。此举旨在打击虚假房源广告,保护租客权益,并将推动租户工会合法化、扩大租客谈判权等措施。
纽约市长曼达尼发布报告,要求房东披露AI修改的房源图片。 AI生成的虚假房产图片问题日益严重,尤其影响远程签约租客。 NVIDIA发布DeepStream 9.1:为视觉AI带来13项技能和多视角3D追踪的智能体AI 2026-07-19 03:16 UTC+8 NVIDIA DeepStream 9.1 引入了13项智能体技能,允许Claude Code和Codex等编码代理通过自然语言提示构建多摄像头视频分析管道。多视角3D追踪(MV3DT)将每个摄像头的检测结果融合到一个共享的3D世界中,并分配全局一致的对象ID,而AutoMagicCalib(AMC)则消除了手动摄像头校准。该版本还增加了JetPack 7.2支持和一个统一的GitHub开源仓库。
DeepStream 9.1 提供13个智能体技能,支持自然语言驱动的多摄像头视觉管道搭建。 MV3DT 实现跨摄像头3D追踪,分配全局唯一ID,无需手动校准。 Talon:一个自托管的长期AI代理框架 2026-07-19 00:24 UTC+8 Talon是一个多平台、可自托管的AI代理框架,支持Telegram、Discord、Microsoft Teams、终端及跨平台的桌面/移动应用。它提供可插拔的后端(Claude Agent SDK、Kilo、OpenCode、Codex、OpenAI Agents)和完整的MCP工具访问,具备背景代理、目标管理、技能系统、事件总线等功能。项目架构清晰,前端与后端独立,支持热重载插件和技能,便于扩展。
Talon支持多种前端(Telegram、Discord、Teams、终端、桌面/移动应用)和后端(Claude、Kilo、OpenCode、Codex、OpenAI Agents),通过MCP协议提供丰富工具。 具备背景代理(心跳、梦境)、持久目标、技能系统(SKILL.md)和触发器,使代理能主动推进任务。 人工智能繁荣建立在债务之上,投资者需求骤降,超大规模企业加速债券发行 2026-07-18 20:58 UTC+8 人工智能(AI)繁荣日益依赖债务融资,但随着超大规模企业加大债券发行,投资者需求却在下降。亚马逊最近的债券发行不得不提高收益率,订单倍数下降。AI债券供应激增,但投资者要求更高利差。同时,中国AI模型Kimi K3的突破性性能引发对美国AI支出可持续性的担忧,可能导致经济衰退。
自2025年初以来,Alphabet、Meta、亚马逊、甲骨文等公司已发行超过3000亿美元债券。 投资者对AI债券的需求下降,亚马逊债券订单倍数从3.2倍降至2.5倍。 PixelUp:一款完全脱机、轻量级的AI视频放大软件(Windows) 2026-07-18 20:20 UTC+8 PixelUp 是一款专为 Windows 设计的轻量级 AI 视频放大工具,利用 FSRCNN 和 ESPCN 深度学习模型,在本地硬件上快速将低分辨率视频提升至高清画质。它支持 Nvidia CUDA、Vulkan 和 CPU 处理,提供批量任务管理、无损音频同步,并采用终身许可证模式,一次性付费 $19,无需订阅,完全保护用户隐私。
完全本地运行,无需联网或注册账户,保障数据隐私。 采用优化的 FSRCNN 和 ESPCN 模型,快速重建细节。 AIpine – iPhone上AI工件的瑞士军刀 2026-07-18 20:20 UTC+8 AIpine是一款专为iPhone设计的应用,用于查看、预览和组织AI生成的各类文件,如JSX、HTML、Mermaid图表、SVG等,支持离线使用,无账户和云服务,保护用户隐私。
AIpine提供对AI生成文件的预览和源代码查看,支持多种格式。 应用完全离线工作,文件存储在本地,无需账户或云服务。 BaseRT - Apple M5优化版 2026-07-18 16:15 UTC+8 BaseRT在Apple M5芯片上实现显著性能提升,比llama.cpp快6.4倍,比MLX快3.9倍。
BaseRT针对Apple M5芯片进行了优化,提供超高速推理性能。 性能基准测试显示,比llama.cpp快6.4倍,比MLX快3.9倍。 Timeline Studio:本地优先的AI视频编辑器 2026-07-18 16:12 UTC+8 Timeline Studio 是一款在浏览器中运行的本地优先 AI 视频编辑器,结合了 CapCut 风格的多轨道时间线、浏览器端 AI 配音、自动字幕、视觉工具、虚拟形象生成以及确定性离线导出功能。
支持多语言 AI 配音、自动字幕、智能构图、人像分割、AI 人声分离和数字人功能。 提供完整的视频编辑功能,包括多轨道时间线、关键帧动画、滤镜效果、贴纸等。 埃隆·马斯克的孟菲斯人工智能帝国成为数据中心抵制的中心 2026-07-18 14:07 UTC+8 埃隆·马斯克在孟菲斯快速建造人工智能数据中心,引发居民对噪音和排放的不满,全国范围内出现政策提案、抗议和诉讼。
马斯克的xAI数据中心Colossus和Colossus II使用燃气轮机,造成噪音和污染。 纽约州和新泽西州已通过法规限制或规范数据中心建设。 Anthropic 宣布 Claude Fable 5 永久纳入订阅计划 2026-07-18 14:00 UTC+8 Anthropic 决定自2026年7月20日起,将 Claude Fable 5 永久纳入 Max 和 Team Premium 订阅计划(额度为50%),并为 Pro 和 Team Standard 用户提供一次性100美元积分。此举逆转了此前因算力限制而计划移除 Fable 5 的决定,主要受到 GPT-5.6 Sol 等竞争对手的压力。
Claude Fable 5 将于7月20日起永久包含在 Max 和 Team Premium 订阅中,使用额度限制为50%。 Pro 和 Team Standard 用户可通过使用积分继续访问,并获得一次性100美元信用额度。 Cicy-code – 通过 npx 使用的本地优先多智能体编码工作区 2026-07-18 13:50 UTC+8 cicy-code 是一个开源的、本地优先的多智能体开发工作区,集成了 tmux、WebTTY 终端、React 前端、AI 网关和技能市场。它通过 npx 作为单个二进制文件分发,让用户能够在约 5 分钟内启动一个智能体团队。
本地优先的多智能体工作区,支持编码智能体编排。 集成 tmux、WebTTY、React、AI 网关和技能市场。 一个逃避AI检测的小实验 2026-07-18 13:29 UTC+8 作者尝试使用Claude Code、10个并行代理和基本技巧来逃避AI检测,但失败了。文章详细记录了多次尝试,包括使用维基百科规则、Pangram API反馈和模仿特定作者风格,所有尝试均未成功。唯一的成功案例是手动重写自己的文章,AI检测分数降至0%。
作者使用AI辅助撰写了84篇博客文章,几乎所有内容都被检测为100% AI生成。 尝试通过AI代理编辑、模仿人类写作风格和特定作者声音来逃避检测,均未成功。 Gpu.ai 10万美元大奖黑客马拉松:2026年8月22日,免费云GPU构建 2026-07-18 13:00 UTC+8 GPU.ai 将于2026年8月22日至24日举办在线全球黑客马拉松,提供1,000美元现金大奖及免费GPU积分。参赛者需基于GPU.ai平台构建AI应用、代理、推理API或创意工作流,仅限50支团队入选。
GPU.ai 黑客马拉松于2026年8月22日启动,提供1,000美元大奖和免费GPU积分 仅接受50支团队,个人或团队均可参赛 AINews:今日平淡无奇 2026-07-18 12:30 UTC+8 今日AI新闻较为平静,但Kimi K3的发布成为焦点,引发了关于中国开源模型是否接近前沿的广泛讨论。此外,Databricks完成1880亿美元M轮融资,OpenRouter可能被收购。技术方面,深入分析了K3的架构、基准测试性能及智能体框架。
Kimi K3发布重新点燃中美前沿模型差距讨论 Databricks完成1880亿美元M轮融资 Anthropic与Meta初步洽谈租用计算能力 2026-07-18 09:24 UTC+8 据知情人士透露,人工智能初创公司Anthropic正与Meta进行初步谈判,计划租用其计算能力,潜在交易价值约100亿美元。此举表明Anthropic继续通过合作获取英伟达AI芯片,以缓解算力瓶颈。此前,Anthropic已与SpaceX达成类似协议。
Anthropic与Meta就租用AI计算能力进行初步谈判,交易金额或达100亿美元。 此举紧随Anthropic与SpaceX的数据中心合作,旨在增加付费用户的算力。 过度训练:通往类人AI之路 2026-07-18 09:03 UTC+8 文章探讨了Gwern的理论,认为通过过度训练(grokking)大模型在小数据集上,可以实现更接近人类的通用智能。作者分析了当前LLM的局限性,并提出了与主流做法相反的训练策略。
Grokking现象:长时间训练后模型突然大幅提高能力 LLM泛化不足,需要更深层次的规则发现 AI基础设施资本支出排名追踪 2026-07-18 07:54 UTC+8 基于对45家公司的追踪,AI基础设施总资本支出达9415亿美元,其中AI相关支出约3995亿美元。Alphabet以1850亿美元位居榜首,亚马逊、阿里巴巴、微软紧随其后。
追踪45家公司,总资本支出9415亿美元,AI相关支出占42.4% Alphabet以1850亿美元总支出和1300亿美元AI支出领先 人工智能领域最具影响力人物榜 2026-07-18 07:05 UTC+8 2026年人工智能领域的权力格局已发生剧变。传统上根据算力和资本排名的时代已经过去。本文基于过去12个月内对AI资本流向的控制力,评选出最具影响力的人物,包括埃隆·马斯克、桑达尔·皮查伊、达里奥·阿莫代伊、马克·扎克伯格、萨姆·奥尔特曼等。文章详细介绍了他们的战略举措、投资规模及行业影响。
AI权力不再仅由算力和资本决定,资本控制力成为新标准。 埃隆·马斯克通过整合xAI、SpaceX和X,打造1.75万亿美元垂直帝国。 Zyphra发布ZUNA1.1:一个支持0.5至30秒可变长度输入的Apache 2.0 EEG基础模型 2026-07-18 05:35 UTC+8 Zyphra于2026年7月16日发布了ZUNA1.1,这是一个基于Apache 2.0许可的开源脑电图(EEG)基础模型。该模型是一个3.8亿参数的掩码扩散自编码器,能够处理任意通道布局的EEG信号,并支持0.5至30秒的可变长度输入,相比之前固定5秒的ZUNA1更加灵活。通过改进训练策略(包括四种丢失模式和逐通道质量过滤)以及更大的语料库(约350万通道小时),ZUNA1.1在重建归一化均方误差上保持或优于ZUNA1。
ZUNA1.1支持0.5至30秒的可变输入长度,以0.125秒为单位进行分词。 模型使用变压器编码器-解码器架构,结合4D旋转位置编码和整流流目标。 习近平发起新的人工智能联盟WAICO 2026-07-18 04:24 UTC+8 中国国家主席习近平在上海世界人工智能大会上呼吁各国合作发展AI,并宣布成立由29个国家组成的世界人工智能合作组织(WAICO),旨在制定全球AI规则。此举被视为中国挑战美国在AI领域主导地位的举措。
习近平呼吁AI发展不应是“单个国家的独奏”,而是国际合作。 中国牵头成立WAICO,29个创始成员国包括印尼、巴西、俄罗斯等。 Nvidia扩大物理AI布局:机器人与边缘AI更新 2026-07-18 04:12 UTC+8 英伟达正在充实其物理AI生态系统,涵盖基础模型、边缘硬件、软件、开发者工具及工业合作伙伴关系。
英伟达扩展物理AI战略,涵盖机器人和边缘计算领域 推出基础模型和边缘硬件以支持AI应用 1999.ai:人工智能与互联网泡沫的昨日重现 2026-07-18 02:11 UTC+8 本文作者Scott Galloway认为,当前人工智能领域的投资热潮与1999年的互联网泡沫有诸多相似之处,但结局可能不同。他警告AI泡沫正在破裂,并分析了从B2C到基础设施的连锁反应,最终指出AI创造的价值可能更多流向用户而非股东。
OpenAI的财务状况类似1999年的互联网公司,亏损巨大且商业模式不可持续 AI领域的循环融资和过度支出正引发担忧,企业开始削减AI预算 跟随问题,走向深处 2026-07-18 01:25 UTC+8 贝利·弗拉尼根是一位跨学科研究者,现任麻省理工学院施瓦茨曼计算机学院、政治学系和电气工程与计算机科学系的联合教员。她的研究聚焦于利用计算和数学工具促进民主参与,开发了用于随机选择公民大会参与者的算法,并部署在Panelot.org平台上。
贝利·弗拉尼根从医学、公共卫生到经济学,最终转向计算机科学和政治学的跨学科研究。 她开发的算法帮助随机选择公民大会参与者,平衡代表性与公平性。 《下载》专题:围绝经期谣言与中国AI最新突破 2026-07-18 01:02 UTC+8 本期《下载》探讨了围绝经期错误信息的泛滥,以及中国开源AI模型缩小与美国差距的进展。此外还有特朗普媒体变现、宜居行星大气层发现、脑机接口恢复触觉等科技新闻。
围绝经期话题虽去污名化,但错误信息与缺乏科学依据的治疗建议盛行。 中国初创公司发布世界最大开源AI模型,缩小与美国差距。 苹果超越英伟达,重夺全球市值最高公司宝座 2026-07-17 23:01 UTC+8 苹果在周五超过英伟达,成为全球市值最高的公司,这反映了投资者对人工智能前景的重新评估。苹果市值稳定在4.88万亿美元,而英伟达因股价下跌3.5%市值降至约4.86万亿美元。
苹果超越英伟达,成为全球市值最高的公司。 投资者正在重新评估人工智能的前景。 NVIDIA Vera Rubin:最大化智能体AI每美元智能的关键平台 2026-07-17 23:00 UTC+8 NVIDIA Vera Rubin平台通过极致协同设计降低每token成本,实现更频繁高效的后训练,最大化智能体AI时代的每美元智能。Nemotron 3 Ultra模型在SWE-bench验证中得分71.7%,展示了后训练的有效性。
后训练从一次性步骤转变为智能体AI的持续过程 Vera Rubin相比Blackwell可将训练大型模型所需GPU数量减少四倍 NVIDIA AI发布Nemotron 3 Embed:开源嵌入集合,8B检查点荣登RTEB榜首 2026-07-17 15:53 UTC+8 NVIDIA发布Nemotron 3 Embed,包含三个开源检查点:8B BF16、1B BF16和1B NVFP4。其中8B模型在RTEB基准上以78.46平均NDCG@10排名第一。1B模型通过NAS剪枝和蒸馏从8B教师模型得到。NVFP4在Blackwell上保持99%+的检索精度,吞吐量提升2倍。所有模型支持32,768 token输入,采用OpenMDW-1.1许可。
Nemotron-3-Embed-8B-BF16在RTEB上以78.46平均NDCG@10排名第一 提供8B BF16、1B BF16和1B NVFP4三种检查点 中国英伟达替代品公司预测销售额激增,AI芯片需求旺盛 2026-07-17 15:02 UTC+8 中国芯片设计公司摩尔线程和紫光信息预测上半年收入大幅增长,得益于国内AI计算需求激增。摩尔线程预计收入增长135%-149%,紫光信息预计增长55.6%-70.2%。这凸显了中国在AI基础设施上的强劲需求,以及在美国出口限制下国产芯片的崛起。
摩尔线程预计上半年收入同比增长135.1%至149.4%,达到16.5亿至17.5亿元人民币。 紫光信息预计上半年收入同比增长55.6%至70.2%,达到85亿至93亿元人民币。 巴菲特揭秘:伯克希尔310亿美元押注谷歌的背后决策者 2026-07-17 14:15 UTC+8 沃伦·巴菲特透露,是他本人而非继任者格雷格·阿贝尔主导了伯克希尔对谷歌母公司Alphabet的310亿美元投资。他表示,人工智能巨头被迫进行巨额资本支出以保持竞争力,这种模式类似于他曾投资的铁路和公用事业,因此吸引了长期回避科技股的他。
巴菲特亲自决定伯克希尔投资Alphabet 310亿美元,而非继任CEO。 他改变对科技股的看法,因AI公司资本支出模式转向类似铁路和公用事业。 分支策略优化:面向沙盒的原生语言智能体强化学习 2026-07-17 12:00 UTC+8 提出分支策略优化(BPO),利用沙盒的确定性、可快照和可恢复特性,通过共享前缀的树形 rollout 拓扑降低策略梯度方差,在多个基准上较 GRPO 和 RLOO 提升 3.6-6.1 个绝对百分点。
BPO 利用沙盒可快照和可恢复的特性,构建共享前缀的树形 rollout 拓扑,替代独立轨迹采样。 该算法在决策点分支并计算兄弟轨迹间的优势,理论上证明方差严格低于轨迹级基线。 人工智能的真正瓶颈在于数据交付 2026-07-17 11:16 UTC+8 企业大规模部署AI时,最大障碍往往是数据从存储到计算的基础设施,而非GPU等计算硬件。文章指出,许多组织误以为性能问题需要更多计算资源,实则根源在于数据饥饿,即数据无法高效、安全、持续地在存储与计算之间流动。通过引入应用交付控制器实现松耦合架构,以及关注可达性、策略和交付三个维度的韧性,可显著提升GPU利用率和AI投资回报。
AI性能瓶颈常被误认为计算不足,实则是数据交付基础设施的制约。 松耦合架构(如引入ADC)可将存储与计算解耦,提升灵活性和性能。 [AINews] Kimi K3 2.8T-A50B:有史以来最大的开源模型;Opus 4.8级别的性能,Sonnet 5的定价 2026-07-17 09:46 UTC+8 Moonshot AI发布了Kimi K3,一个2.8万亿参数的开源模型,拥有1M上下文长度,在Frontend Code Arena中排名第一,并在多项基准测试中取得优异成绩。此次发布标志着开源模型的一个里程碑,尽管与顶级闭源模型仍存在差距。新闻通讯还涵盖了其他AI新闻,包括安全事件、智能体框架和机器人技术。
Kimi K3是一个2.8万亿参数的开源模型,拥有1M上下文和原生多模态输入。 它在Frontend Code Arena中排名第一,超越了Claude Fable 5。 SAM — 一款在本地运行的开源AI智能体 2026-07-17 09:34 UTC+8 SAM是一个免费的开源AI智能体,它能在你的计算机上本地运行,无需订阅。它不仅能聊天,还能实际执行任务,拥有173种工具,支持团队协作、离线运行,并且注重隐私。
免费开源,本地运行,数据隐私安全 支持173种真实工具,可执行网页、文件、终端等操作 月之暗面发布 Kimi K3:2.8万亿参数开源MoE模型,搭载Kimi Delta Attention和百万上下文 2026-07-17 07:47 UTC+8 月之暗面于2026年7月16日发布Kimi K3,这是一款2.8万亿参数的开源MoE模型,采用Kimi Delta Attention和Attention Residuals架构,支持原生视觉和100万token上下文窗口。K3在多项基准测试中表现出色,但整体性能仍略逊于最强大的专有模型。
Kimi K3是首款开源2.8万亿参数MoE模型,激活896个专家中的16个。 引入Kimi Delta Attention(KDA)和Attention Residuals(AttnRes),分别提升解码速度和训练效率。 AegisDB – 自托管AI代理内存,单个C语言二进制文件 2026-07-17 07:15 UTC+8 AegisDB是一个自托管的AI代理内存系统,提供持久化、语义化和工作记忆功能,通过简单的JSON-over-TCP协议访问。它采用单个无依赖的C语言二进制文件,支持多租户、加密、备份、只读副本和可观测性,特别适合与Claude Code集成,确保数据完全由用户掌控。
单个C语言二进制文件,零依赖,支持Docker部署 提供持久化、语义化(向量搜索)和工作记忆三种内存类型 Kimi K3 在智能知识工作基准测试中击败 GPT-5.6 Sol 2026-07-17 07:02 UTC+8 Artificial Analysis 发布了 AA-Briefcase 智能知识工作基准测试结果,Kimi K3 以 1547 Elo 排名第一,领先于 GPT-5.6 Sol 的 1495 分。该基准测试模拟真实商业工作流,评估模型在生成电子表格、演示文稿和备忘录等任务中的表现。
Kimi K3 在 AA-Briefcase 基准测试中排名第一,Elo 得分为 1547。 GPT-5.6 Sol 以 1495 分排名第三,落后于 Claude Fable 5。 你的AI已就绪,但数据基础可能尚未完善 2026-07-17 06:00 UTC+8 Cushman & Wakefield首席数字和信息官Sal Companieh分享了如何通过产品运营模式、统一数据战略以及与Databricks的合作,建立企业级AI核心,将想法到成果的时间从数月缩短至数天。
将技术人员嵌入业务部门,建立信任和以行为为导向的运营模式 通过资本投资模型要求技术计划与业务负责人共同创建,确保与业务优先级一致