待翻译:Introducing NVIDIA Nemotron 3.5 ASR Streaming 2026-08-05 06:17 UTC+8 AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:AI models Introducing NVIDIA Nemotron 3.5 ASR Streaming Deploy NVIDIA Nemotron 3.5 ASR for low-latency, production-ready speech recognition with 6x higher throughput and multilingual support. Authors Ansel Erol Ian Carr…
AI 服务暂时不可用,系统已先保留来源内容与降级元数据。 AI models Introducing NVIDIA Nemotron 3.5 ASR Streaming Deploy NVIDIA Nemotron 3.5 ASR for low-latency, production-ready speech recognition with 6x higher throughput and multiling… 待翻译:Laguna S 2.1 goes Greek: a repository-scale game transformation 2026-08-04 06:14 UTC+8 AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:AI models Laguna S 2.1 goes Greek: a repository-scale game transformation We put Poolside’s new Laguna S 2.1 model to the test, tasking it with a repository-scale transformation of the open-source game Hypersomnia. Auth…
AI 服务暂时不可用,系统已先保留来源内容与降级元数据。 AI models Laguna S 2.1 goes Greek: a repository-scale game transformation We put Poolside’s new Laguna S 2.1 model to the test, tasking it with a repository-scale transformation o… 微调Qwen3-TTS实现高质量语音克隆 2026-08-01 04:04 UTC+8 本文介绍如何微调Qwen3-TTS实现高质量语音克隆,对比ICL、仅说话人嵌入和微调三种方式,并给出完整训练流程。基于约1.5小时LJ Speech数据在单张H100上训练约1小时,微调模型TTFA约130ms,比ICL快约16%,并省去推理时的参考音频处理。
Qwen3-TTS支持ICL和仅说话人嵌入两种即时克隆模式,但更丰富的克隆能力需要微调。 微调通过SFT学习更多文本音频配对,并将说话人嵌入质心烘焙进模型权重,推理时无需参考音频。 22,580:从GPT-2到Kimi K3,解读其发展历程 2026-07-31 00:01 UTC+8 本文追溯了从GPT-2(1.24亿参数)到Kimi K3(2.8万亿参数)的架构演进,七年间规模增长22580倍。文章解释了关键创新,包括KV缓存、线性注意力和DeltaNet,揭示了基础机制如何演化以支撑巨大规模。
GPT-2有1.24亿参数;Kimi K3有2.8万亿参数,增长22580倍。 KV缓存避免重复计算,但随序列长度线性增长。 如何在任何框架中运行 Kimi K3:使用 Baseten Switch 进行路由 2026-07-30 22:01 UTC+8 Baseten Switch 是一款本地 Mac 应用,可让您在流行的人工智能框架(如 Claude Code 和 Codex)中无缝混合运行开源和闭源模型,只需切换开关即可在 Kimi K3、GLM 5.2 等模型之间切换,并跟踪成本、性能和使用情况。
Baseten Switch 是本地 Mac 应用(Go 编写),在不同模型之间路由请求。 支持在 Claude Code、Codex 等框架中实时切换开源和闭源模型。 Baseten宣布推出Model Labs平台 2026-07-30 01:57 UTC+8 Baseten发布了专为闭权模型实验室设计的新平台Baseten for Model Labs,提供推理基础设施、模型分发、知识产权保护和市场推广支持,帮助实验室快速实现模型货币化。已有15个合作伙伴如Cartesia、Gradium、Inception、NVIDIA等参与。平台旨在促进多样化的模型生态系统发展。
Baseten推出Model Labs平台,为闭权模型实验室提供推理、分发和货币化一站式服务。 平台包括生产级推理基础设施、模型库分发、IP保护和联合市场推广支持。 将Kimi K3分词速度提升18倍,用于百万令牌的代理工作负载 2026-07-28 05:52 UTC+8 Baseten推出了新的分词器(Basetenkenizer),将Kimi K3的分词速度提升多达18倍,适用于百万令牌的代理工作负载。它结合了基于Rust的优化技术,包括专用预分词、BPE合并、多核分块和零拷贝NumPy传输,同时保持与tiktoken完全一致的令牌ID。这一改进显著降低了长输入序列的首令牌时间,尤其是在前缀缓存命中率高的情况下。
Baseten Tokenizer将Kimi K3百万令牌序列的分词速度提升高达18倍。 优化包括专用预分词、栈内BPE合并、多核并行化和零拷贝NumPy所有权传输。 如何为Kimi K3构建Day-0 API 2026-07-27 23:52 UTC+8 Baseten 为 Kimi K3 提供了 Day-0 支持,这是一个 2.8T 参数的新前沿开放模型。本文介绍了在发布日前运行该模型所需的技术工作,包括硬件配置、权重加载、推理引擎集成、质量验证、性能优化和规模化部署。
Kimi K3 是一个 2.8T 参数的开放模型,采用 Kimi Delta Attention 和 Stable LatentMoE 等新技术。 Baseten 与 Inferact 和 RadixArk 团队合作,在 vLLM 和 SGLang 上支持 Kimi K3。 推出GLM 5.2 Fast 2026-07-24 03:38 UTC+8 我们推出了一个新的模型API服务层级——GLM-5.2 Fast,专为实时代理工作负载优化,提供与标准GLM-5.2相同的权重,但基础设施针对每用户吞吐量进行了调整,以实现低延迟和稳定的性能。
GLM-5.2 Fast是独立的模型API层级,使用相同的GLM-5.2权重,但基础设施针对实时应用优化。 适用于代理工作流,作为主代理协调子任务,减少延迟累积。 H100 与 H200 GPU 对比 2026-07-23 09:38 UTC+8 本文对比了H100和H200 GPU在AI推理中的表现。H100适合中小模型和低流量场景,性价比高;H200凭借更大的HBM3e显存和更高带宽,更适合大模型、长上下文推理和高KV缓存需求。文章还介绍了MIG分区和异步编程等技术。
H100性价比高,适合中小模型和低流量场景。 H200显存更大、带宽更高,适合大模型和长上下文。 如何优化LLM推理速度并降低生产环境成本 2026-07-23 09:37 UTC+8 本文介绍了多种优化LLM推理延迟和成本的技术,包括连续批处理、推测解码、KV缓存优化、量化、内核优化、智能路由、拓扑感知并行以及分离式预填充和解码。根据工作负载选择合适的组合。
连续批处理允许在批处理过程中动态添加请求,减少排队延迟。 推测解码使用小模型生成候选词,再由大模型并行验证,提升吞吐量。 如何选择AI模型:来自Notion和Gamma的教训 2026-07-23 09:36 UTC+8 Notion和Gamma的经验表明,选择AI模型时应考虑成本、可靠性、任务匹配度,并善用开源模型。不要默认使用最强大的模型,而是根据具体工作流选择最经济高效的模型。
不要构建通用的模型框架,每个模型有其原生框架,最佳实践是针对模型修改框架。 模型切换的成本值得付出,因为它带来可靠性、成本和快速采用新模型的灵活性。 GLM 5.2 具备视觉能力 2026-07-22 09:33 UTC+8 研究人员通过训练一个仅5000万参数的MLP投影器,成功为开源语言模型GLM 5.2添加了视觉功能,使其在MMMU-Pro上达到与Claude 4.5 Haiku相当的性能(55%)。该过程使用Kimi K2.6的视觉塔,仅训练投影器,并在SFT和RL阶段观察到“顿悟”现象,模型甚至能识别训练数据中未出现的人物(如史蒂芬·霍金)。
成功为GLM 5.2后训练视觉能力,仅用50M参数的2层MLP。 视觉性能达到Claude 4.5 Haiku水平(MMMU-Pro 55%),且不损害纯文本能力。 Baseten 实时视频生成推理:53.6倍加速 2026-07-17 07:17 UTC+8 Baseten 的模型性能团队通过时间步蒸馏、自定义内核优化和 NVFP4 量化,将 Wan 2.2 视频生成速度提升至每片段 2.75 秒,相比基线实现加速 53.6 倍。
Wan 2.2 视频生成从 2 分钟以上降至 2.75 秒,成本降低 31 倍 采用时间步蒸馏(4 步)、自定义自注意力内核(1.58 倍加速)和 NVFP4 量化(1.5 倍加速) 使用 NVIDIA Nemotron 3 Embed 实现快速准确的检索 2026-07-17 01:16 UTC+8 NVIDIA 发布 Nemotron 3 Embed 系列嵌入模型,提供 8B 和 1B 两种规模,现已在 Baseten 平台上线。8B 模型在检索基准测试中领先,1B 模型通过剪枝和蒸馏保留了 95% 的准确率,同时显著降低延迟和成本。文章还介绍了与 turbopuffer 的合作,以及微调方法。
NVIDIA Nemotron 3 Embed 8B 和 1B 模型现已在 Baseten 上可用,分别针对检索质量和索引速度优化。 8B 模型在 RTEB 排行榜上领先,1B 模型保留 95% 准确率,NVFP4 版本在 Blackwell GPU 上吞吐量提升 2 倍。 认识 Inkling:Thinking Machines Lab 的新型可定制模型 2026-07-16 03:13 UTC+8 Thinking Machines Lab 发布了 Inkling,一个拥有 9750 亿参数的开源权重多模态模型,支持文本、图像和音频输入,采用混合专家架构,活跃参数为 410 亿。Baseten 提供首发支持。
Inkling 是一个 975B 参数的 MoE 模型,活跃参数 41B。 支持文本、图像和音频输入,上下文窗口达 100 万 token。 介绍 Step 3.7 Flash:大规模多模态推理 2026-07-14 11:08 UTC+8 StepFun 的 Step 3.7 Flash 是一款 1980 亿参数的稀疏 MoE 视觉语言模型,现已在 Baseten 模型库中以硬件高效配置提供。该模型支持多模态输入、256k 上下文窗口和灵活推理,专为代理工作流设计。通过 FP8 量化,可在 4 块 H100 GPU 上部署,大幅降低成本。
198B 参数 MoE 架构,每 token 仅激活 11B 参数 原生支持图像和视频输入,256k 上下文窗口 使用NVIDIA Nemotron 3 Ultra和LangChain Deep Agents在Baseten上构建智能体 2026-07-09 00:51 UTC+8 NVIDIA Nemotron 3 Ultra结合LangChain Deep Agents,在Baseten上以约10倍低的成本实现了顶尖的开放模型智能体准确率。本文介绍如何设置和使用该组合构建合规性审查智能体。
LangChain为NVIDIA Nemotron 3 Ultra发布了Deep Agents定制配置文件,无需微调即可达到顶尖准确率。 通过Baseten的模型API部署,成本仅为封闭替代方案的十分之一。 H100 vs H200 vs B200:您应该使用哪款GPU? 2026-07-03 04:33 UTC+8 H100、H200和B200 GPU在内存、计算和成本方面各有不同的权衡。本文帮助您根据模型大小、流量和预算选择最合适的GPU。
H100支持MIG,适合小模型和间歇流量,成本效益高。 H200可单节点运行超大型模型如DeepSeek-R1,内存高达1.128 TB。 AI训练与推理:有什么区别? 2026-06-26 06:12 UTC+8 AI训练让模型从数据中学习,而推理则是模型在生产中响应请求。本文详细解释了两者在硬件、成本、优化等方面的关键差异,并介绍了模型从预训练到服务的完整生命周期,以及衡量推理性能的四个关键指标。
训练是模型从大量数据中学习并调整权重的过程,通常需要大量计算资源。 推理是训练后的模型对新输入生成输出的过程,每次用户请求都会触发推理。 如何在任意环境中运行GLM-5.2 2026-06-26 06:12 UTC+8 GLM-5.2是今年的DeepSeek时刻,性能与闭源模型相当,但速度快4.5倍、成本低5倍。本文详细介绍如何在Claude Code、Codex和Deep Agents CLI中配置并使用GLM-5.2,整个过程不到5分钟。
GLM-5.2是高性能开源模型,可替代闭源模型如Opus 4.8 在Claude Code中通过修改环境变量即可使用GLM-5.2 NVIDIA BioNeMo Agent Toolkit 在 Baseten 上发布 2026-06-24 04:06 UTC+8 NVIDIA BioNeMo Agent Toolkit 旨在将通用 AI 智能体转变为能够执行真实生物学和药物发现任务的科学智能体。该工具包结合了 BioNeMo Skills、开放模型、NVIDIA NIM 微服务和智能体基础设施,支持蛋白质结构预测、蛋白质设计、虚拟筛选、基因组分析和靶点发现等流程。所有 BioNeMo NIM 微服务现已在 Baseten 模型库中可用,方便开发者部署和扩展科学 AI 应用。
NVIDIA BioNeMo Agent Toolkit 将通用 AI 智能体转化为科学智能体,用于生物学和药物发现。 工具包整合了 BioNeMo Skills、开放模型、NVIDIA NIM 微服务和智能体编排基础设施。 最佳开源大语言模型(LLM)对比 2026-06-18 16:13 UTC+8 本文比较了8款顶级开源LLM,涵盖DeepSeek V4 Pro、Gemma 4、GLM 5.1、GPT OSS 120B、Kimi K2.6、MiniMax M3、Nemotron 3 Ultra和Qwen 3.6。针对智能编码、长上下文推理、成本和速度等不同需求,提供了选型建议。
Kimi K2.6 是最全面的模型;Qwen 3.6 和 GLM 5.1 在智能编码方面领先;DeepSeek 和 Nemotron 在长上下文和企业工作负载中表现出色;GPT OSS 120B 在成本和速度上表现优异。 DeepSeek V4 Pro 拥有1M token上下文窗口,通过混合注意力机制将KV缓存内存降至标准模型的2%。 滚动部署:实现模型更新的零停机时间 2026-06-13 01:37 UTC+8 Baseten 推出滚动部署功能,允许团队逐步更新模型版本,无需停机或加倍 GPU 开销。该方法在每次替换一个副本,逐步转移流量,并提供暂停、恢复和回滚控制。用户报告部署频率提升 50–60%,无需在非高峰时段手动监控。
滚动部署逐步替换副本,避免蓝绿部署的双倍 GPU 成本和硬切换的全有或全无风险。 支持 max_surge(优先扩新副本)和 max_unavailable(优先缩旧副本)两种模式,适应延迟或成本敏感场景。 首个推理扩散LLM Mercury 2现已登陆Baseten 2026-06-12 22:13 UTC+8 Inception推出的Mercury 2是目前速度最快的推理LLM,采用扩散架构而非传统自回归方式,在标准NVIDIA GPU上可达到每秒1000 token以上的生成速度,速度是同级模型的5-10倍,成本降低一半以上,质量与Haiku和GPT-5 mini相当。Augment Code在生产环境中使用后,成本降低90%,延迟降低82%。Baseten为其提供企业级推理平台支持。
Mercury 2是首个推理扩散LLM,通过并行生成整个输出再逐步精炼的方式,突破了自回归模型的序列生成瓶颈。 在标准NVIDIA GPU上可达1000+ tokens/秒,无需专用芯片,速度是同类优化模型的5-10倍。 NVIDIA Nemotron 3 Ultra 发布:Nemotron 3.x 系列来了! 2026-06-04 21:50 UTC+8 Nemotron 3 Ultra 是一种混合 Mamba-Transformer 模型,专为长时间运行的代理设计,通过用 Mamba 层替换大部分注意力机制,实现高达 5 倍的推理速度提升和 30% 的成本降低。该模型完全开源,使代理能够高效完成冗长任务而不会变慢。
Nemotron 3 Ultra 采用以 Mamba 层为主的混合架构,在上下文增长时保持恒定推理速度。 与开放前沿模型相比,在长时间运行的代理工作流中可实现高达 5 倍的推理速度提升和 30% 的成本降低。 MAI-Thinking-1 即将登陆 Baseten 2026-06-03 03:45 UTC+8 Baseten 与微软 AI 宣布,MAI-Thinking-1 即将在 Baseten 平台上提供。该模型是微软 AI 的旗舰推理模型,结合了开源模型的灵活性与闭源模型的管理便利性,具有干净数据来源、商业级质量和定制化能力。
MAI-Thinking-1 是微软 AI 的新旗舰推理模型,填补了开源与闭源模型之间的空白。 模型采用无蒸馏的干净数据训练,数据来源可审计且商业安全。 Nvidia Cosmos 3:机器人终于要接管世界了吗? 2026-06-01 13:41 UTC+8 Nvidia发布的Cosmos 3是一个专为物理世界构建的基础模型,旨在帮助开发者训练机器人、自动驾驶系统和视觉AI代理。与传统的生成式视频模型不同,Cosmos 3着重于理解物体、动作和因果关系,支持六种交互模式,可作为机器人直接控制器或数据工厂,大幅降低机器人训练的数据成本。
Cosmos 3是面向物理世界的基础模型,而非简单的视频生成器。 支持六种模式:文本生成图像、文本生成视频、图像生成视频、前向动力学、逆向动力学和策略生成。 为持续学习时代提供推理动力 2026-05-28 09:32 UTC+8 Baseten与Trajectory合作构建了一个生产级推理流水线,实现模型的持续学习:模型通过生产数据不断更新,训练到部署的时间压缩至约一小时。该流水线融合了LoRA适配器合并、架构感知验证、A/B测试路由与来源追踪,使模型在使用中持续改进。
持续学习使模型能够从生产使用中持续改进,而非静态发布。 Baseten和Trajectory开发了涵盖合并、验证、A/B路由和来源追踪的流水线,部署时间从数小时缩短至约一小时。 开源AI模型入门指南 2026-05-27 21:31 UTC+8 本文介绍了开源AI模型的基本概念、工作原理及使用场景。开源模型通常指开放权重的模型,用户可以对其进行微调和部署,相比闭源模型具有成本低、可定制性强等优势。文章还讨论了开源与闭源模型的比较、适用时机以及未来发展趋势。
开源模型主要是开放权重的模型,允许用户微调和部署。 相比闭源模型,开源模型平均成本低87%,并提供更好的控制性和定制化能力。