待翻譯:Introducing NVIDIA Nemotron 3.5 ASR Streaming 2026-08-05 06:17 UTC+8 AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:AI models Introducing NVIDIA Nemotron 3.5 ASR Streaming Deploy NVIDIA Nemotron 3.5 ASR for low-latency, production-ready speech recognition with 6x higher throughput and multilingual support. Authors Ansel Erol Ian Carr…
AI 服務暫時不可用,系統已先保留來源內容與降級後設資料。 AI models Introducing NVIDIA Nemotron 3.5 ASR Streaming Deploy NVIDIA Nemotron 3.5 ASR for low-latency, production-ready speech recognition with 6x higher throughput and multiling… 待翻譯:Laguna S 2.1 goes Greek: a repository-scale game transformation 2026-08-04 06:14 UTC+8 AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:AI models Laguna S 2.1 goes Greek: a repository-scale game transformation We put Poolside’s new Laguna S 2.1 model to the test, tasking it with a repository-scale transformation of the open-source game Hypersomnia. Auth…
AI 服務暫時不可用,系統已先保留來源內容與降級後設資料。 AI models Laguna S 2.1 goes Greek: a repository-scale game transformation We put Poolside’s new Laguna S 2.1 model to the test, tasking it with a repository-scale transformation o… 微調Qwen3-TTS實現高質量語音克隆 2026-08-01 04:04 UTC+8 本文介紹如何微調Qwen3-TTS實現高質量語音克隆,對比ICL、僅說話人嵌入和微調三種方式,並給出完整訓練流程。基於約1.5小時LJ Speech資料在單張H100上訓練約1小時,微調模型TTFA約130ms,比ICL快約16%,並省去推理時的參考音訊處理。
Qwen3-TTS支援ICL和僅說話人嵌入兩種即時克隆模式,但更豐富的克隆能力需要微調。 微調透過SFT學習更多文本音訊配對,並將說話人嵌入質心烘焙進模型權重,推理時無需參考音訊。 22,580:從GPT-2到Kimi K3,解讀其發展歷程 2026-07-31 00:01 UTC+8 本文追溯了從GPT-2(1.24億引數)到Kimi K3(2.8萬億引數)的架構演進,七年間規模增長22580倍。文章解釋了關鍵創新,包括KV快取、線性注意力和DeltaNet,揭示了基礎機制如何演化以支撐巨大規模。
GPT-2有1.24億引數;Kimi K3有2.8萬億引數,增長22580倍。 KV快取避免重複計算,但隨序列長度線性增長。 如何在任何框架中執行 Kimi K3:使用 Baseten Switch 進行路由 2026-07-30 22:01 UTC+8 Baseten Switch 是一款本地 Mac 應用,可讓您在流行的人工智慧框架(如 Claude Code 和 Codex)中無縫混合執行開源和閉源模型,只需切換開關即可在 Kimi K3、GLM 5.2 等模型之間切換,並跟蹤成本、效能和使用情況。
Baseten Switch 是本地 Mac 應用(Go 編寫),在不同模型之間路由請求。 支援在 Claude Code、Codex 等框架中即時切換開源和閉源模型。 Baseten宣佈推出Model Labs平臺 2026-07-30 01:57 UTC+8 Baseten釋出了專為閉權模型實驗室設計的新平臺Baseten for Model Labs,提供推理基礎設施、模型分發、智慧財產權保護和市場推廣支援,幫助實驗室快速實現模型貨幣化。已有15個合作伙伴如Cartesia、Gradium、Inception、NVIDIA等參與。平臺旨在促進多樣化的模型生態系統發展。
Baseten推出Model Labs平臺,為閉權模型實驗室提供推理、分發和貨幣化一站式服務。 平臺包括生產級推理基礎設施、模型庫分發、IP保護和聯合市場推廣支援。 將Kimi K3分詞速度提升18倍,用於百萬令牌的代理工作負載 2026-07-28 05:52 UTC+8 Baseten推出了新的分詞器(Basetenkenizer),將Kimi K3的分詞速度提升多達18倍,適用於百萬令牌的代理工作負載。它結合了基於Rust的最佳化技術,包括專用預分詞、BPE合併、多核分塊和零複製NumPy傳輸,同時保持與tiktoken完全一致的令牌ID。這一改進顯著降低了長輸入序列的首令牌時間,尤其是在字首快取命中率高的情況下。
Baseten Tokenizer將Kimi K3百萬令牌序列的分詞速度提升高達18倍。 最佳化包括專用預分詞、棧內BPE合併、多核並行化和零複製NumPy所有權傳輸。 如何為Kimi K3構建Day-0 API 2026-07-27 23:52 UTC+8 Baseten 為 Kimi K3 提供了 Day-0 支援,這是一個 2.8T 引數的新前沿開放模型。本文介紹了在釋出日前執行該模型所需的技術工作,包括硬體配置、權重載入、推理引擎整合、質量驗證、效能最佳化和規模化部署。
Kimi K3 是一個 2.8T 引數的開放模型,採用 Kimi Delta Attention 和 Stable LatentMoE 等新技術。 Baseten 與 Inferact 和 RadixArk 團隊合作,在 vLLM 和 SGLang 上支援 Kimi K3。 推出GLM 5.2 Fast 2026-07-24 03:38 UTC+8 我們推出了一個新的模型API服務層級——GLM-5.2 Fast,專為即時代理工作負載最佳化,提供與標準GLM-5.2相同的權重,但基礎設施針對每使用者吞吐量進行了調整,以實現低延遲和穩定的效能。
GLM-5.2 Fast是獨立的模型API層級,使用相同的GLM-5.2權重,但基礎設施針對即時應用最佳化。 適用於代理工作流,作為主代理協調子任務,減少延遲累積。 H100 與 H200 GPU 對比 2026-07-23 09:38 UTC+8 本文對比了H100和H200 GPU在AI推理中的表現。H100適合中小模型和低流量場景,價效比高;H200憑藉更大的HBM3e視訊記憶體和更高頻寬,更適合大模型、長上下文推理和高KV快取需求。文章還介紹了MIG分割槽和非同步程式設計等技術。
H100價效比高,適合中小模型和低流量場景。 H200視訊記憶體更大、頻寬更高,適合大模型和長上下文。 如何最佳化LLM推理速度並降低生產環境成本 2026-07-23 09:37 UTC+8 本文介紹了多種最佳化LLM推理延遲和成本的技術,包括連續批處理、推測解碼、KV快取最佳化、量化、核心最佳化、智慧路由、拓撲感知並行以及分離式預填充和解碼。根據工作負載選擇合適的組合。
連續批處理允許在批處理過程中動態新增請求,減少排隊延遲。 推測解碼使用小模型生成候選詞,再由大模型並行驗證,提升吞吐量。 如何選擇AI模型:來自Notion和Gamma的教訓 2026-07-23 09:36 UTC+8 Notion和Gamma的經驗表明,選擇AI模型時應考慮成本、可靠性、任務匹配度,並善用開源模型。不要預設使用最強大的模型,而是根據具體工作流選擇最經濟高效的模型。
不要構建通用的模型框架,每個模型有其原生框架,最佳實踐是針對模型修改框架。 模型切換的成本值得付出,因為它帶來可靠性、成本和快速採用新模型的靈活性。 GLM 5.2 具備視覺能力 2026-07-22 09:33 UTC+8 研究人員透過訓練一個僅5000萬引數的MLP投影器,成功為開源語言模型GLM 5.2新增了視覺功能,使其在MMMU-Pro上達到與Claude 4.5 Haiku相當的效能(55%)。該過程使用Kimi K2.6的視覺塔,僅訓練投影器,並在SFT和RL階段觀察到“頓悟”現象,模型甚至能識別訓練資料中未出現的人物(如史蒂芬·霍金)。
成功為GLM 5.2後訓練視覺能力,僅用50M引數的2層MLP。 視覺效能達到Claude 4.5 Haiku水平(MMMU-Pro 55%),且不損害純文本能力。 Baseten 即時影片生成推理:53.6倍加速 2026-07-17 07:17 UTC+8 Baseten 的模型效能團隊透過時間步蒸餾、自定義核心最佳化和 NVFP4 量化,將 Wan 2.2 影片生成速度提升至每片段 2.75 秒,相比基線實現加速 53.6 倍。
Wan 2.2 影片生成從 2 分鐘以上降至 2.75 秒,成本降低 31 倍 採用時間步蒸餾(4 步)、自定義自注意力核心(1.58 倍加速)和 NVFP4 量化(1.5 倍加速) 使用 NVIDIA Nemotron 3 Embed 實現快速準確的檢索 2026-07-17 01:16 UTC+8 NVIDIA 釋出 Nemotron 3 Embed 系列嵌入模型,提供 8B 和 1B 兩種規模,現已在 Baseten 平臺上線。8B 模型在檢索基準測試中領先,1B 模型透過剪枝和蒸餾保留了 95% 的準確率,同時顯著降低延遲和成本。文章還介紹了與 turbopuffer 的合作,以及微調方法。
NVIDIA Nemotron 3 Embed 8B 和 1B 模型現已在 Baseten 上可用,分別針對檢索質量和索引速度最佳化。 8B 模型在 RTEB 排行榜上領先,1B 模型保留 95% 準確率,NVFP4 版本在 Blackwell GPU 上吞吐量提升 2 倍。 認識 Inkling:Thinking Machines Lab 的新型可定製模型 2026-07-16 03:13 UTC+8 Thinking Machines Lab 釋出了 Inkling,一個擁有 9750 億引數的開源權重多模態模型,支援文本、影像和音訊輸入,採用混合專家架構,活躍引數為 410 億。Baseten 提供首發支援。
Inkling 是一個 975B 引數的 MoE 模型,活躍引數 41B。 支援文本、影像和音訊輸入,上下文視窗達 100 萬 token。 介紹 Step 3.7 Flash:大規模多模態推理 2026-07-14 11:08 UTC+8 StepFun 的 Step 3.7 Flash 是一款 1980 億引數的稀疏 MoE 視覺語言模型,現已在 Baseten 模型庫中以硬體高效配置提供。該模型支援多模態輸入、256k 上下文視窗和靈活推理,專為代理工作流設計。透過 FP8 量化,可在 4 塊 H100 GPU 上部署,大幅降低成本。
198B 引數 MoE 架構,每 token 僅啟用 11B 引數 原生支援影像和影片輸入,256k 上下文視窗 使用NVIDIA Nemotron 3 Ultra和LangChain Deep Agents在Baseten上構建智慧體 2026-07-09 00:51 UTC+8 NVIDIA Nemotron 3 Ultra結合LangChain Deep Agents,在Baseten上以約10倍低的成本實現了頂尖的開放模型智慧體準確率。本文介紹如何設定和使用該組合構建合規性審查智慧體。
LangChain為NVIDIA Nemotron 3 Ultra釋出了Deep Agents定製配置檔案,無需微調即可達到頂尖準確率。 透過Baseten的模型API部署,成本僅為封閉替代方案的十分之一。 H100 vs H200 vs B200:您應該使用哪款GPU? 2026-07-03 04:33 UTC+8 H100、H200和B200 GPU在記憶體、計算和成本方面各有不同的權衡。本文幫助您根據模型大小、流量和預算選擇最合適的GPU。
H100支援MIG,適合小模型和間歇流量,成本效益高。 H200可單節點執行超大型模型如DeepSeek-R1,記憶體高達1.128 TB。 AI訓練與推理:有什麼區別? 2026-06-26 06:12 UTC+8 AI訓練讓模型從資料中學習,而推理則是模型在生產中響應請求。本文詳細解釋了兩者在硬體、成本、最佳化等方面的關鍵差異,並介紹了模型從預訓練到服務的完整生命週期,以及衡量推理效能的四個關鍵指標。
訓練是模型從大量資料中學習並調整權重的過程,通常需要大量計算資源。 推理是訓練後的模型對新輸入生成輸出的過程,每次使用者請求都會觸發推理。 如何在任意環境中執行GLM-5.2 2026-06-26 06:12 UTC+8 GLM-5.2是今年的DeepSeek時刻,效能與閉源模型相當,但速度快4.5倍、成本低5倍。本文詳細介紹如何在Claude Code、Codex和Deep Agents CLI中配置並使用GLM-5.2,整個過程不到5分鐘。
GLM-5.2是高效能開源模型,可替代閉源模型如Opus 4.8 在Claude Code中透過修改環境變數即可使用GLM-5.2 NVIDIA BioNeMo Agent Toolkit 在 Baseten 上釋出 2026-06-24 04:06 UTC+8 NVIDIA BioNeMo Agent Toolkit 旨在將通用 AI 智慧體轉變為能夠執行真實生物學和藥物發現任務的科學智慧體。該工具包結合了 BioNeMo Skills、開放模型、NVIDIA NIM 微服務和智慧體基礎設施,支援蛋白質結構預測、蛋白質設計、虛擬篩選、基因組分析和靶點發現等流程。所有 BioNeMo NIM 微服務現已在 Baseten 模型庫中可用,方便開發者部署和擴充套件科學 AI 應用。
NVIDIA BioNeMo Agent Toolkit 將通用 AI 智慧體轉化為科學智慧體,用於生物學和藥物發現。 工具包整合了 BioNeMo Skills、開放模型、NVIDIA NIM 微服務和智慧體編排基礎設施。 最佳開源大語言模型(LLM)對比 2026-06-18 16:13 UTC+8 本文比較了8款頂級開源LLM,涵蓋DeepSeek V4 Pro、Gemma 4、GLM 5.1、GPT OSS 120B、Kimi K2.6、MiniMax M3、Nemotron 3 Ultra和Qwen 3.6。針對智慧編碼、長上下文推理、成本和速度等不同需求,提供了選型建議。
Kimi K2.6 是最全面的模型;Qwen 3.6 和 GLM 5.1 在智慧編碼方面領先;DeepSeek 和 Nemotron 在長上下文和企業工作負載中表現出色;GPT OSS 120B 在成本和速度上表現優異。 DeepSeek V4 Pro 擁有1M token上下文視窗,透過混合注意力機制將KV快取記憶體降至標準模型的2%。 滾動部署:實現模型更新的零停機時間 2026-06-13 01:37 UTC+8 Baseten 推出滾動部署功能,允許團隊逐步更新模型版本,無需停機或加倍 GPU 開銷。該方法在每次替換一個副本,逐步轉移流量,並提供暫停、恢復和回滾控制。使用者報告部署頻率提升 50–60%,無需在非高峰時段手動監控。
滾動部署逐步替換副本,避免藍綠部署的雙倍 GPU 成本和硬切換的全有或全無風險。 支援 max_surge(優先擴新副本)和 max_unavailable(優先縮舊副本)兩種模式,適應延遲或成本敏感場景。 首個推理擴散LLM Mercury 2現已登陸Baseten 2026-06-12 22:13 UTC+8 Inception推出的Mercury 2是目前速度最快的推理LLM,採用擴散架構而非傳統自迴歸方式,在標準NVIDIA GPU上可達到每秒1000 token以上的生成速度,速度是同級模型的5-10倍,成本降低一半以上,質量與Haiku和GPT-5 mini相當。Augment Code在生產環境中使用後,成本降低90%,延遲降低82%。Baseten為其提供企業級推理平臺支援。
Mercury 2是首個推理擴散LLM,透過並行生成整個輸出再逐步精煉的方式,突破了自迴歸模型的序列生成瓶頸。 在標準NVIDIA GPU上可達1000+ tokens/秒,無需專用晶片,速度是同類最佳化模型的5-10倍。 NVIDIA Nemotron 3 Ultra 釋出:Nemotron 3.x 系列來了! 2026-06-04 21:50 UTC+8 Nemotron 3 Ultra 是一種混合 Mamba-Transformer 模型,專為長時間執行的代理設計,透過用 Mamba 層替換大部分注意力機制,實現高達 5 倍的推理速度提升和 30% 的成本降低。該模型完全開源,使代理能夠高效完成冗長任務而不會變慢。
Nemotron 3 Ultra 採用以 Mamba 層為主的混合架構,在上下文增長時保持恆定推理速度。 與開放前沿模型相比,在長時間執行的代理工作流中可實現高達 5 倍的推理速度提升和 30% 的成本降低。 MAI-Thinking-1 即將登陸 Baseten 2026-06-03 03:45 UTC+8 Baseten 與微軟 AI 宣佈,MAI-Thinking-1 即將在 Baseten 平臺上提供。該模型是微軟 AI 的旗艦推理模型,結合了開源模型的靈活性與閉源模型的管理便利性,具有乾淨資料來源、商業級質量和定製化能力。
MAI-Thinking-1 是微軟 AI 的新旗艦推理模型,填補了開源與閉源模型之間的空白。 模型採用無蒸餾的乾淨資料訓練,資料來源可審計且商業安全。 Nvidia Cosmos 3:機器人終於要接管世界了嗎? 2026-06-01 13:41 UTC+8 Nvidia釋出的Cosmos 3是一個專為物理世界構建的基礎模型,旨在幫助開發者訓練機器人、自動駕駛系統和視覺AI代理。與傳統的生成式影片模型不同,Cosmos 3著重於理解物體、動作和因果關係,支援六種互動模式,可作為機器人直接控制器或資料工廠,大幅降低機器人訓練的資料成本。
Cosmos 3是面向物理世界的基礎模型,而非簡單的影片生成器。 支援六種模式:文本生成影像、文本生成影片、影像生成影片、前向動力學、逆向動力學和策略生成。 為持續學習時代提供推理動力 2026-05-28 09:32 UTC+8 Baseten與Trajectory合作構建了一個生產級推理流水線,實現模型的持續學習:模型透過生產資料不斷更新,訓練到部署的時間壓縮至約一小時。該流水線融合了LoRA介面卡合併、架構感知驗證、A/B測試路由與來源追蹤,使模型在使用中持續改進。
持續學習使模型能夠從生產使用中持續改進,而非靜態釋出。 Baseten和Trajectory開發了涵蓋合併、驗證、A/B路由和來源追蹤的流水線,部署時間從數小時縮短至約一小時。 開源AI模型入門指南 2026-05-27 21:31 UTC+8 本文介紹了開源AI模型的基本概念、工作原理及使用場景。開源模型通常指開放權重的模型,使用者可以對其進行微調和部署,相比閉源模型具有成本低、可定製性強等優勢。文章還討論了開源與閉源模型的比較、適用時機以及未來發展趨勢。
開源模型主要是開放權重的模型,允許使用者微調和部署。 相比閉源模型,開源模型平均成本低87%,並提供更好的控制性和定製化能力。