待翻譯:Introducing NVIDIA Nemotron 3.5 ASR Streaming 2026-08-05 06:17 UTC+8 AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:AI models Introducing NVIDIA Nemotron 3.5 ASR Streaming Deploy NVIDIA Nemotron 3.5 ASR for low-latency, production-ready speech recognition with 6x higher throughput and multilingual support. Authors Ansel Erol Ian Carr…
AI 服務暫時不可用,系統已先保留來源內容與降級元數據。 AI models Introducing NVIDIA Nemotron 3.5 ASR Streaming Deploy NVIDIA Nemotron 3.5 ASR for low-latency, production-ready speech recognition with 6x higher throughput and multiling… 待翻譯:Laguna S 2.1 goes Greek: a repository-scale game transformation 2026-08-04 06:14 UTC+8 AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:AI models Laguna S 2.1 goes Greek: a repository-scale game transformation We put Poolside’s new Laguna S 2.1 model to the test, tasking it with a repository-scale transformation of the open-source game Hypersomnia. Auth…
AI 服務暫時不可用,系統已先保留來源內容與降級元數據。 AI models Laguna S 2.1 goes Greek: a repository-scale game transformation We put Poolside’s new Laguna S 2.1 model to the test, tasking it with a repository-scale transformation o… 微調Qwen3-TTS實現高質量語音克隆 2026-08-01 04:04 UTC+8 本文介紹如何微調Qwen3-TTS實現高質量語音克隆,對比ICL、僅説話人嵌入和微調三種方式,並給出完整訓練流程。基於約1.5小時LJ Speech數據在單張H100上訓練約1小時,微調模型TTFA約130ms,比ICL快約16%,並省去推理時的參考音頻處理。
Qwen3-TTS支持ICL和僅説話人嵌入兩種即時克隆模式,但更豐富的克隆能力需要微調。 微調通過SFT學習更多文本音頻配對,並將説話人嵌入質心烘焙進模型權重,推理時無需參考音頻。 22,580:從GPT-2到Kimi K3,解讀其發展歷程 2026-07-31 00:01 UTC+8 本文追溯了從GPT-2(1.24億參數)到Kimi K3(2.8萬億參數)的架構演進,七年間規模增長22580倍。文章解釋了關鍵創新,包括KV緩存、線性注意力和DeltaNet,揭示了基礎機制如何演化以支撐巨大規模。
GPT-2有1.24億參數;Kimi K3有2.8萬億參數,增長22580倍。 KV緩存避免重複計算,但隨序列長度線性增長。 如何在任何框架中運行 Kimi K3:使用 Baseten Switch 進行路由 2026-07-30 22:01 UTC+8 Baseten Switch 是一款本地 Mac 應用,可讓您在流行的人工智能框架(如 Claude Code 和 Codex)中無縫混合運行開源和閉源模型,只需切換開關即可在 Kimi K3、GLM 5.2 等模型之間切換,並跟蹤成本、性能和使用情況。
Baseten Switch 是本地 Mac 應用(Go 編寫),在不同模型之間路由請求。 支持在 Claude Code、Codex 等框架中實時切換開源和閉源模型。 Baseten宣佈推出Model Labs平台 2026-07-30 01:57 UTC+8 Baseten發佈了專為閉權模型實驗室設計的新平台Baseten for Model Labs,提供推理基礎設施、模型分發、知識產權保護和市場推廣支持,幫助實驗室快速實現模型貨幣化。已有15個合作伙伴如Cartesia、Gradium、Inception、NVIDIA等參與。平台旨在促進多樣化的模型生態系統發展。
Baseten推出Model Labs平台,為閉權模型實驗室提供推理、分發和貨幣化一站式服務。 平台包括生產級推理基礎設施、模型庫分發、IP保護和聯合市場推廣支持。 將Kimi K3分詞速度提升18倍,用於百萬令牌的代理工作負載 2026-07-28 05:52 UTC+8 Baseten推出了新的分詞器(Basetenkenizer),將Kimi K3的分詞速度提升多達18倍,適用於百萬令牌的代理工作負載。它結合了基於Rust的優化技術,包括專用預分詞、BPE合併、多核分塊和零拷貝NumPy傳輸,同時保持與tiktoken完全一致的令牌ID。這一改進顯著降低了長輸入序列的首令牌時間,尤其是在前綴緩存命中率高的情況下。
Baseten Tokenizer將Kimi K3百萬令牌序列的分詞速度提升高達18倍。 優化包括專用預分詞、棧內BPE合併、多核並行化和零拷貝NumPy所有權傳輸。 如何為Kimi K3構建Day-0 API 2026-07-27 23:52 UTC+8 Baseten 為 Kimi K3 提供了 Day-0 支持,這是一個 2.8T 參數的新前沿開放模型。本文介紹了在發佈日前運行該模型所需的技術工作,包括硬件配置、權重加載、推理引擎集成、質量驗證、性能優化和規模化部署。
Kimi K3 是一個 2.8T 參數的開放模型,採用 Kimi Delta Attention 和 Stable LatentMoE 等新技術。 Baseten 與 Inferact 和 RadixArk 團隊合作,在 vLLM 和 SGLang 上支持 Kimi K3。 推出GLM 5.2 Fast 2026-07-24 03:38 UTC+8 我們推出了一個新的模型API服務層級——GLM-5.2 Fast,專為實時代理工作負載優化,提供與標準GLM-5.2相同的權重,但基礎設施針對每用户吞吐量進行了調整,以實現低延遲和穩定的性能。
GLM-5.2 Fast是獨立的模型API層級,使用相同的GLM-5.2權重,但基礎設施針對實時應用優化。 適用於代理工作流,作為主代理協調子任務,減少延遲累積。 H100 與 H200 GPU 對比 2026-07-23 09:38 UTC+8 本文對比了H100和H200 GPU在AI推理中的表現。H100適合中小模型和低流量場景,性價比高;H200憑藉更大的HBM3e顯存和更高帶寬,更適合大模型、長上下文推理和高KV緩存需求。文章還介紹了MIG分區和異步編程等技術。
H100性價比高,適合中小模型和低流量場景。 H200顯存更大、帶寬更高,適合大模型和長上下文。 如何優化LLM推理速度並降低生產環境成本 2026-07-23 09:37 UTC+8 本文介紹了多種優化LLM推理延遲和成本的技術,包括連續批處理、推測解碼、KV緩存優化、量化、內核優化、智能路由、拓撲感知並行以及分離式預填充和解碼。根據工作負載選擇合適的組合。
連續批處理允許在批處理過程中動態添加請求,減少排隊延遲。 推測解碼使用小模型生成候選詞,再由大模型並行驗證,提升吞吐量。 如何選擇AI模型:來自Notion和Gamma的教訓 2026-07-23 09:36 UTC+8 Notion和Gamma的經驗表明,選擇AI模型時應考慮成本、可靠性、任務匹配度,並善用開源模型。不要默認使用最強大的模型,而是根據具體工作流選擇最經濟高效的模型。
不要構建通用的模型框架,每個模型有其原生框架,最佳實踐是針對模型修改框架。 模型切換的成本值得付出,因為它帶來可靠性、成本和快速採用新模型的靈活性。 GLM 5.2 具備視覺能力 2026-07-22 09:33 UTC+8 研究人員通過訓練一個僅5000萬參數的MLP投影器,成功為開源語言模型GLM 5.2添加了視覺功能,使其在MMMU-Pro上達到與Claude 4.5 Haiku相當的性能(55%)。該過程使用Kimi K2.6的視覺塔,僅訓練投影器,並在SFT和RL階段觀察到“頓悟”現象,模型甚至能識別訓練數據中未出現的人物(如史蒂芬·霍金)。
成功為GLM 5.2後訓練視覺能力,僅用50M參數的2層MLP。 視覺性能達到Claude 4.5 Haiku水平(MMMU-Pro 55%),且不損害純文本能力。 Baseten 實時視頻生成推理:53.6倍加速 2026-07-17 07:17 UTC+8 Baseten 的模型性能團隊通過時間步蒸餾、自定義內核優化和 NVFP4 量化,將 Wan 2.2 視頻生成速度提升至每片段 2.75 秒,相比基線實現加速 53.6 倍。
Wan 2.2 視頻生成從 2 分鐘以上降至 2.75 秒,成本降低 31 倍 採用時間步蒸餾(4 步)、自定義自注意力內核(1.58 倍加速)和 NVFP4 量化(1.5 倍加速) 使用 NVIDIA Nemotron 3 Embed 實現快速準確的檢索 2026-07-17 01:16 UTC+8 NVIDIA 發佈 Nemotron 3 Embed 系列嵌入模型,提供 8B 和 1B 兩種規模,現已在 Baseten 平台上線。8B 模型在檢索基準測試中領先,1B 模型通過剪枝和蒸餾保留了 95% 的準確率,同時顯著降低延遲和成本。文章還介紹了與 turbopuffer 的合作,以及微調方法。
NVIDIA Nemotron 3 Embed 8B 和 1B 模型現已在 Baseten 上可用,分別針對檢索質量和索引速度優化。 8B 模型在 RTEB 排行榜上領先,1B 模型保留 95% 準確率,NVFP4 版本在 Blackwell GPU 上吞吐量提升 2 倍。 認識 Inkling:Thinking Machines Lab 的新型可定製模型 2026-07-16 03:13 UTC+8 Thinking Machines Lab 發佈了 Inkling,一個擁有 9750 億參數的開源權重多模態模型,支持文本、圖像和音頻輸入,採用混合專家架構,活躍參數為 410 億。Baseten 提供首發支持。
Inkling 是一個 975B 參數的 MoE 模型,活躍參數 41B。 支持文本、圖像和音頻輸入,上下文窗口達 100 萬 token。 介紹 Step 3.7 Flash:大規模多模態推理 2026-07-14 11:08 UTC+8 StepFun 的 Step 3.7 Flash 是一款 1980 億參數的稀疏 MoE 視覺語言模型,現已在 Baseten 模型庫中以硬件高效配置提供。該模型支持多模態輸入、256k 上下文窗口和靈活推理,專為代理工作流設計。通過 FP8 量化,可在 4 塊 H100 GPU 上部署,大幅降低成本。
198B 參數 MoE 架構,每 token 僅激活 11B 參數 原生支持圖像和視頻輸入,256k 上下文窗口 使用NVIDIA Nemotron 3 Ultra和LangChain Deep Agents在Baseten上構建智能體 2026-07-09 00:51 UTC+8 NVIDIA Nemotron 3 Ultra結合LangChain Deep Agents,在Baseten上以約10倍低的成本實現了頂尖的開放模型智能體準確率。本文介紹如何設置和使用該組合構建合規性審查智能體。
LangChain為NVIDIA Nemotron 3 Ultra發佈了Deep Agents定製配置文件,無需微調即可達到頂尖準確率。 通過Baseten的模型API部署,成本僅為封閉替代方案的十分之一。 H100 vs H200 vs B200:您應該使用哪款GPU? 2026-07-03 04:33 UTC+8 H100、H200和B200 GPU在內存、計算和成本方面各有不同的權衡。本文幫助您根據模型大小、流量和預算選擇最合適的GPU。
H100支持MIG,適合小模型和間歇流量,成本效益高。 H200可單節點運行超大型模型如DeepSeek-R1,內存高達1.128 TB。 AI訓練與推理:有什麼區別? 2026-06-26 06:12 UTC+8 AI訓練讓模型從數據中學習,而推理則是模型在生產中響應請求。本文詳細解釋了兩者在硬件、成本、優化等方面的關鍵差異,並介紹了模型從預訓練到服務的完整生命週期,以及衡量推理性能的四個關鍵指標。
訓練是模型從大量數據中學習並調整權重的過程,通常需要大量計算資源。 推理是訓練後的模型對新輸入生成輸出的過程,每次用户請求都會觸發推理。 如何在任意環境中運行GLM-5.2 2026-06-26 06:12 UTC+8 GLM-5.2是今年的DeepSeek時刻,性能與閉源模型相當,但速度快4.5倍、成本低5倍。本文詳細介紹如何在Claude Code、Codex和Deep Agents CLI中配置並使用GLM-5.2,整個過程不到5分鐘。
GLM-5.2是高性能開源模型,可替代閉源模型如Opus 4.8 在Claude Code中通過修改環境變量即可使用GLM-5.2 NVIDIA BioNeMo Agent Toolkit 在 Baseten 上發佈 2026-06-24 04:06 UTC+8 NVIDIA BioNeMo Agent Toolkit 旨在將通用 AI 智能體轉變為能夠執行真實生物學和藥物發現任務的科學智能體。該工具包結合了 BioNeMo Skills、開放模型、NVIDIA NIM 微服務和智能體基礎設施,支持蛋白質結構預測、蛋白質設計、虛擬篩選、基因組分析和靶點發現等流程。所有 BioNeMo NIM 微服務現已在 Baseten 模型庫中可用,方便開發者部署和擴展科學 AI 應用。
NVIDIA BioNeMo Agent Toolkit 將通用 AI 智能體轉化為科學智能體,用於生物學和藥物發現。 工具包整合了 BioNeMo Skills、開放模型、NVIDIA NIM 微服務和智能體編排基礎設施。 最佳開源大語言模型(LLM)對比 2026-06-18 16:13 UTC+8 本文比較了8款頂級開源LLM,涵蓋DeepSeek V4 Pro、Gemma 4、GLM 5.1、GPT OSS 120B、Kimi K2.6、MiniMax M3、Nemotron 3 Ultra和Qwen 3.6。針對智能編碼、長上下文推理、成本和速度等不同需求,提供了選型建議。
Kimi K2.6 是最全面的模型;Qwen 3.6 和 GLM 5.1 在智能編碼方面領先;DeepSeek 和 Nemotron 在長上下文和企業工作負載中表現出色;GPT OSS 120B 在成本和速度上表現優異。 DeepSeek V4 Pro 擁有1M token上下文窗口,通過混合注意力機制將KV緩存內存降至標準模型的2%。 滾動部署:實現模型更新的零停機時間 2026-06-13 01:37 UTC+8 Baseten 推出滾動部署功能,允許團隊逐步更新模型版本,無需停機或加倍 GPU 開銷。該方法在每次替換一個副本,逐步轉移流量,並提供暫停、恢復和回滾控制。用户報告部署頻率提升 50–60%,無需在非高峯時段手動監控。
滾動部署逐步替換副本,避免藍綠部署的雙倍 GPU 成本和硬切換的全有或全無風險。 支持 max_surge(優先擴新副本)和 max_unavailable(優先縮舊副本)兩種模式,適應延遲或成本敏感場景。 首個推理擴散LLM Mercury 2現已登陸Baseten 2026-06-12 22:13 UTC+8 Inception推出的Mercury 2是目前速度最快的推理LLM,採用擴散架構而非傳統自迴歸方式,在標準NVIDIA GPU上可達到每秒1000 token以上的生成速度,速度是同級模型的5-10倍,成本降低一半以上,質量與Haiku和GPT-5 mini相當。Augment Code在生產環境中使用後,成本降低90%,延遲降低82%。Baseten為其提供企業級推理平台支持。
Mercury 2是首個推理擴散LLM,通過並行生成整個輸出再逐步精煉的方式,突破了自迴歸模型的序列生成瓶頸。 在標準NVIDIA GPU上可達1000+ tokens/秒,無需專用芯片,速度是同類優化模型的5-10倍。 NVIDIA Nemotron 3 Ultra 發佈:Nemotron 3.x 系列來了! 2026-06-04 21:50 UTC+8 Nemotron 3 Ultra 是一種混合 Mamba-Transformer 模型,專為長時間運行的代理設計,通過用 Mamba 層替換大部分注意力機制,實現高達 5 倍的推理速度提升和 30% 的成本降低。該模型完全開源,使代理能夠高效完成冗長任務而不會變慢。
Nemotron 3 Ultra 採用以 Mamba 層為主的混合架構,在上下文增長時保持恆定推理速度。 與開放前沿模型相比,在長時間運行的代理工作流中可實現高達 5 倍的推理速度提升和 30% 的成本降低。 MAI-Thinking-1 即將登陸 Baseten 2026-06-03 03:45 UTC+8 Baseten 與微軟 AI 宣佈,MAI-Thinking-1 即將在 Baseten 平台上提供。該模型是微軟 AI 的旗艦推理模型,結合了開源模型的靈活性與閉源模型的管理便利性,具有乾淨數據來源、商業級質量和定製化能力。
MAI-Thinking-1 是微軟 AI 的新旗艦推理模型,填補了開源與閉源模型之間的空白。 模型採用無蒸餾的乾淨數據訓練,數據來源可審計且商業安全。 Nvidia Cosmos 3:機器人終於要接管世界了嗎? 2026-06-01 13:41 UTC+8 Nvidia發佈的Cosmos 3是一個專為物理世界構建的基礎模型,旨在幫助開發者訓練機器人、自動駕駛系統和視覺AI代理。與傳統的生成式視頻模型不同,Cosmos 3着重於理解物體、動作和因果關係,支持六種交互模式,可作為機器人直接控制器或數據工廠,大幅降低機器人訓練的數據成本。
Cosmos 3是面向物理世界的基礎模型,而非簡單的視頻生成器。 支持六種模式:文本生成圖像、文本生成視頻、圖像生成視頻、前向動力學、逆向動力學和策略生成。 為持續學習時代提供推理動力 2026-05-28 09:32 UTC+8 Baseten與Trajectory合作構建了一個生產級推理流水線,實現模型的持續學習:模型通過生產數據不斷更新,訓練到部署的時間壓縮至約一小時。該流水線融合了LoRA適配器合併、架構感知驗證、A/B測試路由與來源追蹤,使模型在使用中持續改進。
持續學習使模型能夠從生產使用中持續改進,而非靜態發佈。 Baseten和Trajectory開發了涵蓋合併、驗證、A/B路由和來源追蹤的流水線,部署時間從數小時縮短至約一小時。 開源AI模型入門指南 2026-05-27 21:31 UTC+8 本文介紹了開源AI模型的基本概念、工作原理及使用場景。開源模型通常指開放權重的模型,用户可以對其進行微調和部署,相比閉源模型具有成本低、可定製性強等優勢。文章還討論了開源與閉源模型的比較、適用時機以及未來發展趨勢。
開源模型主要是開放權重的模型,允許用户微調和部署。 相比閉源模型,開源模型平均成本低87%,並提供更好的控制性和定製化能力。