AI News HubLIVE
公开文章 37采集文章 48可信度 82刷新频率 120 分钟
健康状态 健康来源类型 官方原文权限 官方原文最近入库 2026-08-04ID baseten-blog运行状态 已启用

Official AI inference and deployment platform blog; confirm reuse terms before full body display.

最新公开文章

待翻译:Introducing NVIDIA Nemotron 3.5 ASR Streaming

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:AI models Introducing NVIDIA Nemotron 3.5 ASR Streaming Deploy NVIDIA Nemotron 3.5 ASR for low-latency, production-ready speech recognition with 6x higher throughput and multilingual support. Authors Ansel Erol Ian Carr…

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • AI models Introducing NVIDIA Nemotron 3.5 ASR Streaming Deploy NVIDIA Nemotron 3.5 ASR for low-latency, production-ready speech recognition with 6x higher throughput and multiling…
站内正文

待翻译:Laguna S 2.1 goes Greek: a repository-scale game transformation

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:AI models Laguna S 2.1 goes Greek: a repository-scale game transformation We put Poolside’s new Laguna S 2.1 model to the test, tasking it with a repository-scale transformation of the open-source game Hypersomnia. Auth…

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • AI models Laguna S 2.1 goes Greek: a repository-scale game transformation We put Poolside’s new Laguna S 2.1 model to the test, tasking it with a repository-scale transformation o…
站内正文

微调Qwen3-TTS实现高质量语音克隆

本文介绍如何微调Qwen3-TTS实现高质量语音克隆,对比ICL、仅说话人嵌入和微调三种方式,并给出完整训练流程。基于约1.5小时LJ Speech数据在单张H100上训练约1小时,微调模型TTFA约130ms,比ICL快约16%,并省去推理时的参考音频处理。

  • Qwen3-TTS支持ICL和仅说话人嵌入两种即时克隆模式,但更丰富的克隆能力需要微调。
  • 微调通过SFT学习更多文本音频配对,并将说话人嵌入质心烘焙进模型权重,推理时无需参考音频。
站内正文

22,580:从GPT-2到Kimi K3,解读其发展历程

本文追溯了从GPT-2(1.24亿参数)到Kimi K3(2.8万亿参数)的架构演进,七年间规模增长22580倍。文章解释了关键创新,包括KV缓存、线性注意力和DeltaNet,揭示了基础机制如何演化以支撑巨大规模。

  • GPT-2有1.24亿参数;Kimi K3有2.8万亿参数,增长22580倍。
  • KV缓存避免重复计算,但随序列长度线性增长。
站内正文

如何在任何框架中运行 Kimi K3:使用 Baseten Switch 进行路由

Baseten Switch 是一款本地 Mac 应用,可让您在流行的人工智能框架(如 Claude Code 和 Codex)中无缝混合运行开源和闭源模型,只需切换开关即可在 Kimi K3、GLM 5.2 等模型之间切换,并跟踪成本、性能和使用情况。

  • Baseten Switch 是本地 Mac 应用(Go 编写),在不同模型之间路由请求。
  • 支持在 Claude Code、Codex 等框架中实时切换开源和闭源模型。
站内正文

Baseten宣布推出Model Labs平台

Baseten发布了专为闭权模型实验室设计的新平台Baseten for Model Labs,提供推理基础设施、模型分发、知识产权保护和市场推广支持,帮助实验室快速实现模型货币化。已有15个合作伙伴如Cartesia、Gradium、Inception、NVIDIA等参与。平台旨在促进多样化的模型生态系统发展。

  • Baseten推出Model Labs平台,为闭权模型实验室提供推理、分发和货币化一站式服务。
  • 平台包括生产级推理基础设施、模型库分发、IP保护和联合市场推广支持。
站内正文

将Kimi K3分词速度提升18倍,用于百万令牌的代理工作负载

Baseten推出了新的分词器(Basetenkenizer),将Kimi K3的分词速度提升多达18倍,适用于百万令牌的代理工作负载。它结合了基于Rust的优化技术,包括专用预分词、BPE合并、多核分块和零拷贝NumPy传输,同时保持与tiktoken完全一致的令牌ID。这一改进显著降低了长输入序列的首令牌时间,尤其是在前缀缓存命中率高的情况下。

  • Baseten Tokenizer将Kimi K3百万令牌序列的分词速度提升高达18倍。
  • 优化包括专用预分词、栈内BPE合并、多核并行化和零拷贝NumPy所有权传输。
站内正文

如何为Kimi K3构建Day-0 API

Baseten 为 Kimi K3 提供了 Day-0 支持,这是一个 2.8T 参数的新前沿开放模型。本文介绍了在发布日前运行该模型所需的技术工作,包括硬件配置、权重加载、推理引擎集成、质量验证、性能优化和规模化部署。

  • Kimi K3 是一个 2.8T 参数的开放模型,采用 Kimi Delta Attention 和 Stable LatentMoE 等新技术。
  • Baseten 与 Inferact 和 RadixArk 团队合作,在 vLLM 和 SGLang 上支持 Kimi K3。
站内正文

推出GLM 5.2 Fast

我们推出了一个新的模型API服务层级——GLM-5.2 Fast,专为实时代理工作负载优化,提供与标准GLM-5.2相同的权重,但基础设施针对每用户吞吐量进行了调整,以实现低延迟和稳定的性能。

  • GLM-5.2 Fast是独立的模型API层级,使用相同的GLM-5.2权重,但基础设施针对实时应用优化。
  • 适用于代理工作流,作为主代理协调子任务,减少延迟累积。
站内正文

H100 与 H200 GPU 对比

本文对比了H100和H200 GPU在AI推理中的表现。H100适合中小模型和低流量场景,性价比高;H200凭借更大的HBM3e显存和更高带宽,更适合大模型、长上下文推理和高KV缓存需求。文章还介绍了MIG分区和异步编程等技术。

  • H100性价比高,适合中小模型和低流量场景。
  • H200显存更大、带宽更高,适合大模型和长上下文。
站内正文

如何优化LLM推理速度并降低生产环境成本

本文介绍了多种优化LLM推理延迟和成本的技术,包括连续批处理、推测解码、KV缓存优化、量化、内核优化、智能路由、拓扑感知并行以及分离式预填充和解码。根据工作负载选择合适的组合。

  • 连续批处理允许在批处理过程中动态添加请求,减少排队延迟。
  • 推测解码使用小模型生成候选词,再由大模型并行验证,提升吞吐量。
站内正文

如何选择AI模型:来自Notion和Gamma的教训

Notion和Gamma的经验表明,选择AI模型时应考虑成本、可靠性、任务匹配度,并善用开源模型。不要默认使用最强大的模型,而是根据具体工作流选择最经济高效的模型。

  • 不要构建通用的模型框架,每个模型有其原生框架,最佳实践是针对模型修改框架。
  • 模型切换的成本值得付出,因为它带来可靠性、成本和快速采用新模型的灵活性。
站内正文

GLM 5.2 具备视觉能力

研究人员通过训练一个仅5000万参数的MLP投影器,成功为开源语言模型GLM 5.2添加了视觉功能,使其在MMMU-Pro上达到与Claude 4.5 Haiku相当的性能(55%)。该过程使用Kimi K2.6的视觉塔,仅训练投影器,并在SFT和RL阶段观察到“顿悟”现象,模型甚至能识别训练数据中未出现的人物(如史蒂芬·霍金)。

  • 成功为GLM 5.2后训练视觉能力,仅用50M参数的2层MLP。
  • 视觉性能达到Claude 4.5 Haiku水平(MMMU-Pro 55%),且不损害纯文本能力。
站内正文

Baseten 实时视频生成推理:53.6倍加速

Baseten 的模型性能团队通过时间步蒸馏、自定义内核优化和 NVFP4 量化,将 Wan 2.2 视频生成速度提升至每片段 2.75 秒,相比基线实现加速 53.6 倍。

  • Wan 2.2 视频生成从 2 分钟以上降至 2.75 秒,成本降低 31 倍
  • 采用时间步蒸馏(4 步)、自定义自注意力内核(1.58 倍加速)和 NVFP4 量化(1.5 倍加速)
站内正文

使用 NVIDIA Nemotron 3 Embed 实现快速准确的检索

NVIDIA 发布 Nemotron 3 Embed 系列嵌入模型,提供 8B 和 1B 两种规模,现已在 Baseten 平台上线。8B 模型在检索基准测试中领先,1B 模型通过剪枝和蒸馏保留了 95% 的准确率,同时显著降低延迟和成本。文章还介绍了与 turbopuffer 的合作,以及微调方法。

  • NVIDIA Nemotron 3 Embed 8B 和 1B 模型现已在 Baseten 上可用,分别针对检索质量和索引速度优化。
  • 8B 模型在 RTEB 排行榜上领先,1B 模型保留 95% 准确率,NVFP4 版本在 Blackwell GPU 上吞吐量提升 2 倍。
站内正文

认识 Inkling:Thinking Machines Lab 的新型可定制模型

Thinking Machines Lab 发布了 Inkling,一个拥有 9750 亿参数的开源权重多模态模型,支持文本、图像和音频输入,采用混合专家架构,活跃参数为 410 亿。Baseten 提供首发支持。

  • Inkling 是一个 975B 参数的 MoE 模型,活跃参数 41B。
  • 支持文本、图像和音频输入,上下文窗口达 100 万 token。
站内正文

介绍 Step 3.7 Flash:大规模多模态推理

StepFun 的 Step 3.7 Flash 是一款 1980 亿参数的稀疏 MoE 视觉语言模型,现已在 Baseten 模型库中以硬件高效配置提供。该模型支持多模态输入、256k 上下文窗口和灵活推理,专为代理工作流设计。通过 FP8 量化,可在 4 块 H100 GPU 上部署,大幅降低成本。

  • 198B 参数 MoE 架构,每 token 仅激活 11B 参数
  • 原生支持图像和视频输入,256k 上下文窗口
站内正文

使用NVIDIA Nemotron 3 Ultra和LangChain Deep Agents在Baseten上构建智能体

NVIDIA Nemotron 3 Ultra结合LangChain Deep Agents,在Baseten上以约10倍低的成本实现了顶尖的开放模型智能体准确率。本文介绍如何设置和使用该组合构建合规性审查智能体。

  • LangChain为NVIDIA Nemotron 3 Ultra发布了Deep Agents定制配置文件,无需微调即可达到顶尖准确率。
  • 通过Baseten的模型API部署,成本仅为封闭替代方案的十分之一。
站内正文

H100 vs H200 vs B200:您应该使用哪款GPU?

H100、H200和B200 GPU在内存、计算和成本方面各有不同的权衡。本文帮助您根据模型大小、流量和预算选择最合适的GPU。

  • H100支持MIG,适合小模型和间歇流量,成本效益高。
  • H200可单节点运行超大型模型如DeepSeek-R1,内存高达1.128 TB。
站内正文

AI训练与推理:有什么区别?

AI训练让模型从数据中学习,而推理则是模型在生产中响应请求。本文详细解释了两者在硬件、成本、优化等方面的关键差异,并介绍了模型从预训练到服务的完整生命周期,以及衡量推理性能的四个关键指标。

  • 训练是模型从大量数据中学习并调整权重的过程,通常需要大量计算资源。
  • 推理是训练后的模型对新输入生成输出的过程,每次用户请求都会触发推理。
站内正文

如何在任意环境中运行GLM-5.2

GLM-5.2是今年的DeepSeek时刻,性能与闭源模型相当,但速度快4.5倍、成本低5倍。本文详细介绍如何在Claude Code、Codex和Deep Agents CLI中配置并使用GLM-5.2,整个过程不到5分钟。

  • GLM-5.2是高性能开源模型,可替代闭源模型如Opus 4.8
  • 在Claude Code中通过修改环境变量即可使用GLM-5.2
站内正文

NVIDIA BioNeMo Agent Toolkit 在 Baseten 上发布

NVIDIA BioNeMo Agent Toolkit 旨在将通用 AI 智能体转变为能够执行真实生物学和药物发现任务的科学智能体。该工具包结合了 BioNeMo Skills、开放模型、NVIDIA NIM 微服务和智能体基础设施,支持蛋白质结构预测、蛋白质设计、虚拟筛选、基因组分析和靶点发现等流程。所有 BioNeMo NIM 微服务现已在 Baseten 模型库中可用,方便开发者部署和扩展科学 AI 应用。

  • NVIDIA BioNeMo Agent Toolkit 将通用 AI 智能体转化为科学智能体,用于生物学和药物发现。
  • 工具包整合了 BioNeMo Skills、开放模型、NVIDIA NIM 微服务和智能体编排基础设施。
站内正文

最佳开源大语言模型(LLM)对比

本文比较了8款顶级开源LLM,涵盖DeepSeek V4 Pro、Gemma 4、GLM 5.1、GPT OSS 120B、Kimi K2.6、MiniMax M3、Nemotron 3 Ultra和Qwen 3.6。针对智能编码、长上下文推理、成本和速度等不同需求,提供了选型建议。

  • Kimi K2.6 是最全面的模型;Qwen 3.6 和 GLM 5.1 在智能编码方面领先;DeepSeek 和 Nemotron 在长上下文和企业工作负载中表现出色;GPT OSS 120B 在成本和速度上表现优异。
  • DeepSeek V4 Pro 拥有1M token上下文窗口,通过混合注意力机制将KV缓存内存降至标准模型的2%。
站内正文

滚动部署:实现模型更新的零停机时间

Baseten 推出滚动部署功能,允许团队逐步更新模型版本,无需停机或加倍 GPU 开销。该方法在每次替换一个副本,逐步转移流量,并提供暂停、恢复和回滚控制。用户报告部署频率提升 50–60%,无需在非高峰时段手动监控。

  • 滚动部署逐步替换副本,避免蓝绿部署的双倍 GPU 成本和硬切换的全有或全无风险。
  • 支持 max_surge(优先扩新副本)和 max_unavailable(优先缩旧副本)两种模式,适应延迟或成本敏感场景。
站内正文

首个推理扩散LLM Mercury 2现已登陆Baseten

Inception推出的Mercury 2是目前速度最快的推理LLM,采用扩散架构而非传统自回归方式,在标准NVIDIA GPU上可达到每秒1000 token以上的生成速度,速度是同级模型的5-10倍,成本降低一半以上,质量与Haiku和GPT-5 mini相当。Augment Code在生产环境中使用后,成本降低90%,延迟降低82%。Baseten为其提供企业级推理平台支持。

  • Mercury 2是首个推理扩散LLM,通过并行生成整个输出再逐步精炼的方式,突破了自回归模型的序列生成瓶颈。
  • 在标准NVIDIA GPU上可达1000+ tokens/秒,无需专用芯片,速度是同类优化模型的5-10倍。
站内正文

NVIDIA Nemotron 3 Ultra 发布:Nemotron 3.x 系列来了!

Nemotron 3 Ultra 是一种混合 Mamba-Transformer 模型,专为长时间运行的代理设计,通过用 Mamba 层替换大部分注意力机制,实现高达 5 倍的推理速度提升和 30% 的成本降低。该模型完全开源,使代理能够高效完成冗长任务而不会变慢。

  • Nemotron 3 Ultra 采用以 Mamba 层为主的混合架构,在上下文增长时保持恒定推理速度。
  • 与开放前沿模型相比,在长时间运行的代理工作流中可实现高达 5 倍的推理速度提升和 30% 的成本降低。
站内正文

MAI-Thinking-1 即将登陆 Baseten

Baseten 与微软 AI 宣布,MAI-Thinking-1 即将在 Baseten 平台上提供。该模型是微软 AI 的旗舰推理模型,结合了开源模型的灵活性与闭源模型的管理便利性,具有干净数据来源、商业级质量和定制化能力。

  • MAI-Thinking-1 是微软 AI 的新旗舰推理模型,填补了开源与闭源模型之间的空白。
  • 模型采用无蒸馏的干净数据训练,数据来源可审计且商业安全。
站内正文

Nvidia Cosmos 3:机器人终于要接管世界了吗?

Nvidia发布的Cosmos 3是一个专为物理世界构建的基础模型,旨在帮助开发者训练机器人、自动驾驶系统和视觉AI代理。与传统的生成式视频模型不同,Cosmos 3着重于理解物体、动作和因果关系,支持六种交互模式,可作为机器人直接控制器或数据工厂,大幅降低机器人训练的数据成本。

  • Cosmos 3是面向物理世界的基础模型,而非简单的视频生成器。
  • 支持六种模式:文本生成图像、文本生成视频、图像生成视频、前向动力学、逆向动力学和策略生成。
站内正文

为持续学习时代提供推理动力

Baseten与Trajectory合作构建了一个生产级推理流水线,实现模型的持续学习:模型通过生产数据不断更新,训练到部署的时间压缩至约一小时。该流水线融合了LoRA适配器合并、架构感知验证、A/B测试路由与来源追踪,使模型在使用中持续改进。

  • 持续学习使模型能够从生产使用中持续改进,而非静态发布。
  • Baseten和Trajectory开发了涵盖合并、验证、A/B路由和来源追踪的流水线,部署时间从数小时缩短至约一小时。
站内正文

开源AI模型入门指南

本文介绍了开源AI模型的基本概念、工作原理及使用场景。开源模型通常指开放权重的模型,用户可以对其进行微调和部署,相比闭源模型具有成本低、可定制性强等优势。文章还讨论了开源与闭源模型的比较、适用时机以及未来发展趋势。

  • 开源模型主要是开放权重的模型,允许用户微调和部署。
  • 相比闭源模型,开源模型平均成本低87%,并提供更好的控制性和定制化能力。
站内正文

全部来源