AI News HubLIVE
公開文章 37採集文章 48可信度 82刷新頻率 120 分鐘
健康狀態 健康來源類型 官方原文權限 官方原文最近入庫 2026-08-04ID baseten-blog運行狀態 已啟用

Official AI inference and deployment platform blog; confirm reuse terms before full body display.

最新公開文章

待翻譯:Introducing NVIDIA Nemotron 3.5 ASR Streaming

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:AI models Introducing NVIDIA Nemotron 3.5 ASR Streaming Deploy NVIDIA Nemotron 3.5 ASR for low-latency, production-ready speech recognition with 6x higher throughput and multilingual support. Authors Ansel Erol Ian Carr…

  • AI 服務暫時不可用,系統已先保留來源內容與降級後設資料。
  • AI models Introducing NVIDIA Nemotron 3.5 ASR Streaming Deploy NVIDIA Nemotron 3.5 ASR for low-latency, production-ready speech recognition with 6x higher throughput and multiling…
站內正文

待翻譯:Laguna S 2.1 goes Greek: a repository-scale game transformation

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:AI models Laguna S 2.1 goes Greek: a repository-scale game transformation We put Poolside’s new Laguna S 2.1 model to the test, tasking it with a repository-scale transformation of the open-source game Hypersomnia. Auth…

  • AI 服務暫時不可用,系統已先保留來源內容與降級後設資料。
  • AI models Laguna S 2.1 goes Greek: a repository-scale game transformation We put Poolside’s new Laguna S 2.1 model to the test, tasking it with a repository-scale transformation o…
站內正文

微調Qwen3-TTS實現高質量語音克隆

本文介紹如何微調Qwen3-TTS實現高質量語音克隆,對比ICL、僅說話人嵌入和微調三種方式,並給出完整訓練流程。基於約1.5小時LJ Speech資料在單張H100上訓練約1小時,微調模型TTFA約130ms,比ICL快約16%,並省去推理時的參考音訊處理。

  • Qwen3-TTS支援ICL和僅說話人嵌入兩種即時克隆模式,但更豐富的克隆能力需要微調。
  • 微調透過SFT學習更多文本音訊配對,並將說話人嵌入質心烘焙進模型權重,推理時無需參考音訊。
站內正文

22,580:從GPT-2到Kimi K3,解讀其發展歷程

本文追溯了從GPT-2(1.24億引數)到Kimi K3(2.8萬億引數)的架構演進,七年間規模增長22580倍。文章解釋了關鍵創新,包括KV快取、線性注意力和DeltaNet,揭示了基礎機制如何演化以支撐巨大規模。

  • GPT-2有1.24億引數;Kimi K3有2.8萬億引數,增長22580倍。
  • KV快取避免重複計算,但隨序列長度線性增長。
站內正文

如何在任何框架中執行 Kimi K3:使用 Baseten Switch 進行路由

Baseten Switch 是一款本地 Mac 應用,可讓您在流行的人工智慧框架(如 Claude Code 和 Codex)中無縫混合執行開源和閉源模型,只需切換開關即可在 Kimi K3、GLM 5.2 等模型之間切換,並跟蹤成本、效能和使用情況。

  • Baseten Switch 是本地 Mac 應用(Go 編寫),在不同模型之間路由請求。
  • 支援在 Claude Code、Codex 等框架中即時切換開源和閉源模型。
站內正文

Baseten宣佈推出Model Labs平臺

Baseten釋出了專為閉權模型實驗室設計的新平臺Baseten for Model Labs,提供推理基礎設施、模型分發、智慧財產權保護和市場推廣支援,幫助實驗室快速實現模型貨幣化。已有15個合作伙伴如Cartesia、Gradium、Inception、NVIDIA等參與。平臺旨在促進多樣化的模型生態系統發展。

  • Baseten推出Model Labs平臺,為閉權模型實驗室提供推理、分發和貨幣化一站式服務。
  • 平臺包括生產級推理基礎設施、模型庫分發、IP保護和聯合市場推廣支援。
站內正文

將Kimi K3分詞速度提升18倍,用於百萬令牌的代理工作負載

Baseten推出了新的分詞器(Basetenkenizer),將Kimi K3的分詞速度提升多達18倍,適用於百萬令牌的代理工作負載。它結合了基於Rust的最佳化技術,包括專用預分詞、BPE合併、多核分塊和零複製NumPy傳輸,同時保持與tiktoken完全一致的令牌ID。這一改進顯著降低了長輸入序列的首令牌時間,尤其是在字首快取命中率高的情況下。

  • Baseten Tokenizer將Kimi K3百萬令牌序列的分詞速度提升高達18倍。
  • 最佳化包括專用預分詞、棧內BPE合併、多核並行化和零複製NumPy所有權傳輸。
站內正文

如何為Kimi K3構建Day-0 API

Baseten 為 Kimi K3 提供了 Day-0 支援,這是一個 2.8T 引數的新前沿開放模型。本文介紹了在釋出日前執行該模型所需的技術工作,包括硬體配置、權重載入、推理引擎整合、質量驗證、效能最佳化和規模化部署。

  • Kimi K3 是一個 2.8T 引數的開放模型,採用 Kimi Delta Attention 和 Stable LatentMoE 等新技術。
  • Baseten 與 Inferact 和 RadixArk 團隊合作,在 vLLM 和 SGLang 上支援 Kimi K3。
站內正文

推出GLM 5.2 Fast

我們推出了一個新的模型API服務層級——GLM-5.2 Fast,專為即時代理工作負載最佳化,提供與標準GLM-5.2相同的權重,但基礎設施針對每使用者吞吐量進行了調整,以實現低延遲和穩定的效能。

  • GLM-5.2 Fast是獨立的模型API層級,使用相同的GLM-5.2權重,但基礎設施針對即時應用最佳化。
  • 適用於代理工作流,作為主代理協調子任務,減少延遲累積。
站內正文

H100 與 H200 GPU 對比

本文對比了H100和H200 GPU在AI推理中的表現。H100適合中小模型和低流量場景,價效比高;H200憑藉更大的HBM3e視訊記憶體和更高頻寬,更適合大模型、長上下文推理和高KV快取需求。文章還介紹了MIG分割槽和非同步程式設計等技術。

  • H100價效比高,適合中小模型和低流量場景。
  • H200視訊記憶體更大、頻寬更高,適合大模型和長上下文。
站內正文

如何最佳化LLM推理速度並降低生產環境成本

本文介紹了多種最佳化LLM推理延遲和成本的技術,包括連續批處理、推測解碼、KV快取最佳化、量化、核心最佳化、智慧路由、拓撲感知並行以及分離式預填充和解碼。根據工作負載選擇合適的組合。

  • 連續批處理允許在批處理過程中動態新增請求,減少排隊延遲。
  • 推測解碼使用小模型生成候選詞,再由大模型並行驗證,提升吞吐量。
站內正文

如何選擇AI模型:來自Notion和Gamma的教訓

Notion和Gamma的經驗表明,選擇AI模型時應考慮成本、可靠性、任務匹配度,並善用開源模型。不要預設使用最強大的模型,而是根據具體工作流選擇最經濟高效的模型。

  • 不要構建通用的模型框架,每個模型有其原生框架,最佳實踐是針對模型修改框架。
  • 模型切換的成本值得付出,因為它帶來可靠性、成本和快速採用新模型的靈活性。
站內正文

GLM 5.2 具備視覺能力

研究人員透過訓練一個僅5000萬引數的MLP投影器,成功為開源語言模型GLM 5.2新增了視覺功能,使其在MMMU-Pro上達到與Claude 4.5 Haiku相當的效能(55%)。該過程使用Kimi K2.6的視覺塔,僅訓練投影器,並在SFT和RL階段觀察到“頓悟”現象,模型甚至能識別訓練資料中未出現的人物(如史蒂芬·霍金)。

  • 成功為GLM 5.2後訓練視覺能力,僅用50M引數的2層MLP。
  • 視覺效能達到Claude 4.5 Haiku水平(MMMU-Pro 55%),且不損害純文本能力。
站內正文

Baseten 即時影片生成推理:53.6倍加速

Baseten 的模型效能團隊透過時間步蒸餾、自定義核心最佳化和 NVFP4 量化,將 Wan 2.2 影片生成速度提升至每片段 2.75 秒,相比基線實現加速 53.6 倍。

  • Wan 2.2 影片生成從 2 分鐘以上降至 2.75 秒,成本降低 31 倍
  • 採用時間步蒸餾(4 步)、自定義自注意力核心(1.58 倍加速)和 NVFP4 量化(1.5 倍加速)
站內正文

使用 NVIDIA Nemotron 3 Embed 實現快速準確的檢索

NVIDIA 釋出 Nemotron 3 Embed 系列嵌入模型,提供 8B 和 1B 兩種規模,現已在 Baseten 平臺上線。8B 模型在檢索基準測試中領先,1B 模型透過剪枝和蒸餾保留了 95% 的準確率,同時顯著降低延遲和成本。文章還介紹了與 turbopuffer 的合作,以及微調方法。

  • NVIDIA Nemotron 3 Embed 8B 和 1B 模型現已在 Baseten 上可用,分別針對檢索質量和索引速度最佳化。
  • 8B 模型在 RTEB 排行榜上領先,1B 模型保留 95% 準確率,NVFP4 版本在 Blackwell GPU 上吞吐量提升 2 倍。
站內正文

認識 Inkling:Thinking Machines Lab 的新型可定製模型

Thinking Machines Lab 釋出了 Inkling,一個擁有 9750 億引數的開源權重多模態模型,支援文本、影像和音訊輸入,採用混合專家架構,活躍引數為 410 億。Baseten 提供首發支援。

  • Inkling 是一個 975B 引數的 MoE 模型,活躍引數 41B。
  • 支援文本、影像和音訊輸入,上下文視窗達 100 萬 token。
站內正文

介紹 Step 3.7 Flash:大規模多模態推理

StepFun 的 Step 3.7 Flash 是一款 1980 億引數的稀疏 MoE 視覺語言模型,現已在 Baseten 模型庫中以硬體高效配置提供。該模型支援多模態輸入、256k 上下文視窗和靈活推理,專為代理工作流設計。透過 FP8 量化,可在 4 塊 H100 GPU 上部署,大幅降低成本。

  • 198B 引數 MoE 架構,每 token 僅啟用 11B 引數
  • 原生支援影像和影片輸入,256k 上下文視窗
站內正文

使用NVIDIA Nemotron 3 Ultra和LangChain Deep Agents在Baseten上構建智慧體

NVIDIA Nemotron 3 Ultra結合LangChain Deep Agents,在Baseten上以約10倍低的成本實現了頂尖的開放模型智慧體準確率。本文介紹如何設定和使用該組合構建合規性審查智慧體。

  • LangChain為NVIDIA Nemotron 3 Ultra釋出了Deep Agents定製配置檔案,無需微調即可達到頂尖準確率。
  • 透過Baseten的模型API部署,成本僅為封閉替代方案的十分之一。
站內正文

H100 vs H200 vs B200:您應該使用哪款GPU?

H100、H200和B200 GPU在記憶體、計算和成本方面各有不同的權衡。本文幫助您根據模型大小、流量和預算選擇最合適的GPU。

  • H100支援MIG,適合小模型和間歇流量,成本效益高。
  • H200可單節點執行超大型模型如DeepSeek-R1,記憶體高達1.128 TB。
站內正文

AI訓練與推理:有什麼區別?

AI訓練讓模型從資料中學習,而推理則是模型在生產中響應請求。本文詳細解釋了兩者在硬體、成本、最佳化等方面的關鍵差異,並介紹了模型從預訓練到服務的完整生命週期,以及衡量推理效能的四個關鍵指標。

  • 訓練是模型從大量資料中學習並調整權重的過程,通常需要大量計算資源。
  • 推理是訓練後的模型對新輸入生成輸出的過程,每次使用者請求都會觸發推理。
站內正文

如何在任意環境中執行GLM-5.2

GLM-5.2是今年的DeepSeek時刻,效能與閉源模型相當,但速度快4.5倍、成本低5倍。本文詳細介紹如何在Claude Code、Codex和Deep Agents CLI中配置並使用GLM-5.2,整個過程不到5分鐘。

  • GLM-5.2是高效能開源模型,可替代閉源模型如Opus 4.8
  • 在Claude Code中透過修改環境變數即可使用GLM-5.2
站內正文

NVIDIA BioNeMo Agent Toolkit 在 Baseten 上釋出

NVIDIA BioNeMo Agent Toolkit 旨在將通用 AI 智慧體轉變為能夠執行真實生物學和藥物發現任務的科學智慧體。該工具包結合了 BioNeMo Skills、開放模型、NVIDIA NIM 微服務和智慧體基礎設施,支援蛋白質結構預測、蛋白質設計、虛擬篩選、基因組分析和靶點發現等流程。所有 BioNeMo NIM 微服務現已在 Baseten 模型庫中可用,方便開發者部署和擴充套件科學 AI 應用。

  • NVIDIA BioNeMo Agent Toolkit 將通用 AI 智慧體轉化為科學智慧體,用於生物學和藥物發現。
  • 工具包整合了 BioNeMo Skills、開放模型、NVIDIA NIM 微服務和智慧體編排基礎設施。
站內正文

最佳開源大語言模型(LLM)對比

本文比較了8款頂級開源LLM,涵蓋DeepSeek V4 Pro、Gemma 4、GLM 5.1、GPT OSS 120B、Kimi K2.6、MiniMax M3、Nemotron 3 Ultra和Qwen 3.6。針對智慧編碼、長上下文推理、成本和速度等不同需求,提供了選型建議。

  • Kimi K2.6 是最全面的模型;Qwen 3.6 和 GLM 5.1 在智慧編碼方面領先;DeepSeek 和 Nemotron 在長上下文和企業工作負載中表現出色;GPT OSS 120B 在成本和速度上表現優異。
  • DeepSeek V4 Pro 擁有1M token上下文視窗,透過混合注意力機制將KV快取記憶體降至標準模型的2%。
站內正文

滾動部署:實現模型更新的零停機時間

Baseten 推出滾動部署功能,允許團隊逐步更新模型版本,無需停機或加倍 GPU 開銷。該方法在每次替換一個副本,逐步轉移流量,並提供暫停、恢復和回滾控制。使用者報告部署頻率提升 50–60%,無需在非高峰時段手動監控。

  • 滾動部署逐步替換副本,避免藍綠部署的雙倍 GPU 成本和硬切換的全有或全無風險。
  • 支援 max_surge(優先擴新副本)和 max_unavailable(優先縮舊副本)兩種模式,適應延遲或成本敏感場景。
站內正文

首個推理擴散LLM Mercury 2現已登陸Baseten

Inception推出的Mercury 2是目前速度最快的推理LLM,採用擴散架構而非傳統自迴歸方式,在標準NVIDIA GPU上可達到每秒1000 token以上的生成速度,速度是同級模型的5-10倍,成本降低一半以上,質量與Haiku和GPT-5 mini相當。Augment Code在生產環境中使用後,成本降低90%,延遲降低82%。Baseten為其提供企業級推理平臺支援。

  • Mercury 2是首個推理擴散LLM,透過並行生成整個輸出再逐步精煉的方式,突破了自迴歸模型的序列生成瓶頸。
  • 在標準NVIDIA GPU上可達1000+ tokens/秒,無需專用晶片,速度是同類最佳化模型的5-10倍。
站內正文

NVIDIA Nemotron 3 Ultra 釋出:Nemotron 3.x 系列來了!

Nemotron 3 Ultra 是一種混合 Mamba-Transformer 模型,專為長時間執行的代理設計,透過用 Mamba 層替換大部分注意力機制,實現高達 5 倍的推理速度提升和 30% 的成本降低。該模型完全開源,使代理能夠高效完成冗長任務而不會變慢。

  • Nemotron 3 Ultra 採用以 Mamba 層為主的混合架構,在上下文增長時保持恆定推理速度。
  • 與開放前沿模型相比,在長時間執行的代理工作流中可實現高達 5 倍的推理速度提升和 30% 的成本降低。
站內正文

MAI-Thinking-1 即將登陸 Baseten

Baseten 與微軟 AI 宣佈,MAI-Thinking-1 即將在 Baseten 平臺上提供。該模型是微軟 AI 的旗艦推理模型,結合了開源模型的靈活性與閉源模型的管理便利性,具有乾淨資料來源、商業級質量和定製化能力。

  • MAI-Thinking-1 是微軟 AI 的新旗艦推理模型,填補了開源與閉源模型之間的空白。
  • 模型採用無蒸餾的乾淨資料訓練,資料來源可審計且商業安全。
站內正文

Nvidia Cosmos 3:機器人終於要接管世界了嗎?

Nvidia釋出的Cosmos 3是一個專為物理世界構建的基礎模型,旨在幫助開發者訓練機器人、自動駕駛系統和視覺AI代理。與傳統的生成式影片模型不同,Cosmos 3著重於理解物體、動作和因果關係,支援六種互動模式,可作為機器人直接控制器或資料工廠,大幅降低機器人訓練的資料成本。

  • Cosmos 3是面向物理世界的基礎模型,而非簡單的影片生成器。
  • 支援六種模式:文本生成影像、文本生成影片、影像生成影片、前向動力學、逆向動力學和策略生成。
站內正文

為持續學習時代提供推理動力

Baseten與Trajectory合作構建了一個生產級推理流水線,實現模型的持續學習:模型透過生產資料不斷更新,訓練到部署的時間壓縮至約一小時。該流水線融合了LoRA介面卡合併、架構感知驗證、A/B測試路由與來源追蹤,使模型在使用中持續改進。

  • 持續學習使模型能夠從生產使用中持續改進,而非靜態釋出。
  • Baseten和Trajectory開發了涵蓋合併、驗證、A/B路由和來源追蹤的流水線,部署時間從數小時縮短至約一小時。
站內正文

開源AI模型入門指南

本文介紹了開源AI模型的基本概念、工作原理及使用場景。開源模型通常指開放權重的模型,使用者可以對其進行微調和部署,相比閉源模型具有成本低、可定製性強等優勢。文章還討論了開源與閉源模型的比較、適用時機以及未來發展趨勢。

  • 開源模型主要是開放權重的模型,允許使用者微調和部署。
  • 相比閉源模型,開源模型平均成本低87%,並提供更好的控制性和定製化能力。
站內正文

全部來源