AI News HubLIVE
公開文章 28採集文章 33可信度 82刷新頻率 120 分鐘
健康狀態 健康來源類型 官方原文權限 官方原文最近入庫 2026-08-04ID modal-blog運行狀態 已啟用

Official AI infrastructure blog; confirm reuse terms before full body display.

最新公開文章

待翻譯:Bringing serverless functions closer to the speed of wire

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Modal’s Function Call data path is now >50ms faster. Our new routing layer is geographically distributed, so you can further reduce your network overhead.

  • AI 服務暫時不可用,系統已先保留來源內容與降級後設資料。
  • Modal’s Function Call data path is now >50ms faster. Our new routing layer is geographically distributed, so you can further reduce your network overhead.
站內正文

關於Hugging Face智慧體事件的通知

Hugging Face公佈了近期一起智慧體入侵事件的技術時間線,其中提到Modal作為第三方基礎設施。Modal表示其平臺和隔離機制未受影響。

  • Hugging Face釋出了智慧體入侵的技術時間線,指出Modal是所涉第三方基礎設施。
  • Modal的平臺和隔離未受到任何形式的入侵。
站內正文

月之暗面Kimi K3現已在Modal上可用

月之暗面釋出了2.8萬億引數的多模態模型Kimi K3,並可在Modal上以每秒460個token的速度執行。該模型採用混合專家架構,支援100萬token上下文視窗和原生視覺。Modal提供了自定義DFlash推測解碼器,大幅提升推理速度。

  • Kimi K3是月之暗面最新發布的2.8萬億引數多模態模型,在Artificial Analysis智慧指數中排名第四。
  • 模型採用混合專家架構,每token啟用16/896專家,支援100萬token上下文視窗。
站內正文

Modal 上的 Devin Outposts

Cognition 開發的 AI 軟體工程師 Devin 現可透過 Devin Outposts 在 Modal 沙盒中執行,支援自定義環境(如 GPU)和快速冷啟動。

  • Devin Outposts 讓 Devin 在使用者控制的環境中執行,而推理仍在 Cognition 雲端。
  • Modal 作為啟動合作伙伴,提供開源整合 modal-devin。
站內正文

Thinking Machines 的 Inkling 現已在 Modal 上可用

Thinking Machines 釋出了通用多模態模型 Inkling,支援文本、影像和音訊輸入並生成文本輸出,現可透過 Modal 託管端點使用,採用基於令牌的定價。文章還討論了其獨特的區域性注意力架構和 DFlash 推測解碼技術的優勢。

  • Thinking Machines 釋出 Inkling,一個 975B 總引數(41B 活躍)的多模態專家混合模型,支援 1M 令牌上下文視窗。
  • Inkling 採用區域性注意力佈局,每六層中有五層使用滑動視窗注意力,提高計算效率。
站內正文

如何為無伺服器GPU定價

比較無伺服器和預留GPU的費率時,需關注應用的峰值與平均需求比。本文透過一個成本模型,解釋了當峰值-平均比超過預留折扣率時,無伺服器GPU更經濟,並討論了模型的假設和侷限性。

  • 無伺服器GPU按需付費,預留GPU需長期合同,兩者成本差異取決於峰值-平均比。
  • 當峰值-平均比大於預留折扣率時,無伺服器GPU總成本更低。
站內正文

多令牌殘差預測

多令牌殘差預測(MRP)是一種針對擴散語言模型的輕量級模組,透過預測相鄰去噪步驟之間的殘差而非完整分佈,實現了在靜態和動態兩種推理場景下的效能提升。靜態模式下可實現無質量損失的加速(高達1.56倍),動態模式下可恢復因激進閾值解碼而損失的高達+16個百分點的準確率。

  • MRP透過預測殘差而非完整分佈,使小型模組能夠準確預測多個去噪步驟。
  • 在靜態去噪中,MRP支援無損推測解碼和有損直接解碼,速度提升可達1.89倍。
站內正文

Anthropic與Modal整合,為Claude Science帶來可擴充套件計算能力

Anthropic推出Claude Science,這是一個面向生命科學研究人員的AI工作臺,整合了Modal的彈性計算基礎設施,使研究人員能在對話中直接執行從資料處理到分子設計的計算密集型工作負載。

  • Claude Science是Anthropic為科學家打造的AI工作臺,支援在對話中直接執行計算任務
  • 整合Modal提供可擴充套件的計算能力,自動處理GPU和CPU密集型工作負載
站內正文

基於Pingora、Envoy和Spanner的無伺服器伺服器路由

Modal團隊深入介紹了其新型超低延遲Serverless Servers的設計原理和實現細節,該服務針對LLM推理等對延遲敏感的應用進行了最佳化。文章解釋了為何選擇構建自己的代理層fprs,以及如何透過Pingora庫、Envoy邊緣代理和Spanner全域性資料庫實現無網路呼叫熱路徑、動態域名關聯和自動縮放。

  • Modal推出Serverless Servers,專為超低延遲HTTP/WebSocket/gRPC流量設計。
  • 與Web Functions不同,Servers犧牲了排隊和重試以換取更低延遲。
站內正文

透過推測解碼實現最先進的推理延遲

Modal與Decagon合作,利用推測解碼將推理延遲降低100毫秒,超越了專有推理提供商。本文詳細介紹了透過最佳化通訊延遲、主機開銷、預填充延遲和解碼延遲來實現低延遲的完整策略,並重點展示了為特定應用定製推測模型(DFlash技術)如何帶來顯著效能提升。

  • Modal Auto Endpoints透過推測解碼實現低延遲推理,關鍵最佳化是使用Blackwell GPU、SGLang引擎和Modal伺服器。
  • 推測解碼透過並行處理多個推測令牌來減少解碼階段延遲,且效率主要取決於接受長度。
站內正文

Modal Auto Endpoints 釋出:最佳化推理,真正擁有

Modal 推出 Auto Endpoints,一個自服務的生產級 LLM 推理入口,讓使用者透過單一命令列即可部署前沿開放模型,並完全掌控推理程式碼、指標和基礎設施。該服務基於 Modal 的 AI 基礎設施平臺,提供高效能自動擴縮、自定義容器執行時和全球 GPU 資源,並透過 Modal Servers 實現超低延遲路由(5ms 開銷)。預調優的推理方案源自與頂級團隊的合作經驗,並採用 DFlash 投機解碼加速。未來將實現推理工程全自動化。

  • Auto Endpoints 支援一鍵部署開放模型(如 GLM 5.2),使用者擁有完整推理棧。
  • 提供引擎級可觀測性指標,包括伺服器和推理指標。
站內正文

投機解碼:一切皆是推測

Modal團隊全面推崇投機解碼技術,認為它是當前最關鍵的高互動推理最佳化手段,能帶來2-3倍甚至更高的加速效果。他們與Z Lab合作訓練了針對Qwen系列模型的最先進DFlash投機解碼器,額外提升5-20%的速度,並強調了投機解碼在長上下文任務中的優勢。本文詳細解釋了投機解碼的原理、與傳統最佳化的對比,以及透過模擬和數學模型展示的加速效果。

  • 投機解碼是目前唯一重要的推理引擎最佳化,能實現數倍加速而非微小百分比提升。
  • Modal與Z Lab合作釋出了多款Qwen模型的DFlash投機解碼器,額外提速5-20%。
站內正文

強化學習是一個基礎設施問題

本文探討了強化學習在大型語言模型後訓練中的實際應用,指出當前的瓶頸並非演算法而是基礎設施。Modal分享了大規模執行RL後訓練的經驗,介紹了其開源庫如何幫助團隊解決多節點訓練、環境管理和GPU利用率等關鍵問題。

  • 強化學習後訓練LLM的瓶頸是基礎設施,包括訓練引擎、推理沙箱和環境隔離。
  • 多節點訓練中,權重同步耗時巨大,RDMA和增量壓縮顯著降低延遲。
站內正文

面向人類和智慧體的基於角色的訪問控制

Modal 為 Teams 和 Enterprise 使用者推出了基於角色的訪問控制(RBAC),圍繞環境(Environments)構建,支援精細許可權管理,確保智慧體和人類的安全協作。

  • RBAC 現已面向所有 Team 和 Enterprise 計劃使用者開放,基於環境(Environments)實現安全邊界。
  • 受限環境(Restricted Environments)可精確控制誰能在其中部署和管理資源。
站內正文

Modal C輪融資:以46.5億美元估值籌集3.55億美元

Modal 公司宣佈完成3.55億美元C輪融資,估值達46.5億美元,由 General Catalyst 和 Redpoint 領投。自去年9月以來,公司收入增長五倍,年化收入突破3億美元。Modal 是為AI工作負載量身打造的雲平臺,提供低延遲彈性推理、動態智慧體執行時、強化學習和大規模批處理等原生能力。本輪融資將用於進一步投資低延遲推理、訓練-推理閉環以及智慧體計算層。

  • Modal 以46.5億美元估值籌集3.55億美元C輪融資,General Catalyst 和 Redpoint 領投,現有投資者全部跟投。
  • 自2025年9月以來,公司收入增長五倍,年化收入超過3億美元。
站內正文

在Applied Compute擴充套件強化學習

Applied Compute 使用強化學習為企業(如 DoorDash、Cognition、Mercor)訓練定製 AI 代理,並在 Modal 上執行。其核心理念是“特定智慧”:透過專有資料訓練,每次使用都能改進。本文介紹了他們的 RL 訓練迴圈、基礎設施選擇以及 Modal 如何提供靈活性、效能和可靠性。

  • Applied Compute 專注於後訓練階段,認為這是企業 AI 競爭的關鍵。
  • 他們使用強化學習訓練具有“特定智慧”的代理,例如為 DoorDash 最佳化商家入駐模型。
站內正文

推出結合Modal Sandboxes的Claude託管代理

Anthropic與Modal宣佈推出Claude託管代理與Modal Sandboxes的整合,允許開發者在自己託管的可定製沙盒中執行工具呼叫,具有快速啟動、成本效益和可擴充套件性。早期採用者包括Mason AI、DoorDash和Blend。

  • Claude託管代理現在與Modal Sandboxes整合,支援自定義、可擴充套件的代理執行。
  • Modal提供快速啟動、自定義映象、持久化選項和成本高效的爆發定價。
站內正文

如何實現真正的無伺服器GPU

Modal 透過四項關鍵技術最佳化,將 GPU 推理伺服器例項的啟動時間從數十分鐘縮短到幾十秒,實現了真正的無伺服器 GPU。

  • 維護空閒 GPU 緩衝池,消除例項分配延遲
  • 自定義內容定址檔案系統,實現容器映象按需載入
站內正文

用一個簡單的Python字典將多模態推理效能提升超10%

Modal團隊透過分析SGLang排程器的效能瓶頸,發現頻繁的CUDA IPC池控制代碼重新開啟操作導致主機開銷過高。他們透過一個簡單的Python字典快取替換了重複操作,在Qwen2.5-VL-3B模型上實現了吞吐量提升16.2%、延遲降低超10%的效果。該最佳化已合併至SGLang v0.5.10版本。

  • SGLang排程器在處理多模態輸入時,因重複開啟CUDA IPC池控制代碼造成主機開銷瓶頸。
  • 透過一個Python字典快取池控制代碼,避免了冗餘的_shared_cuda呼叫,減少排程器CPU時間。
站內正文

在Modal上構建強化學習定理證明工作流

AE Studio利用Modal平臺,透過進化策略(ES)和GRPO兩種強化學習方法訓練語言模型進行數學定理證明。他們使用Lean驗證器,並藉助Modal的並行GPU、沙盒隔離和卷儲存功能高效執行實驗。結果顯示ES在某些場景下媲美甚至超越GRPO,且成本顯著降低。

  • AE Studio在Modal上實現了進化策略(ES)用於定理證明,並與GRPO進行了對比。
  • 利用Modal的.map()並行GPU推斷、沙盒隔離驗證和卷儲存,大幅簡化了基礎設施搭建。
站內正文

使用Modal和OpenAI Agents SDK構建

Modal成為OpenAI Agents SDK的官方沙箱提供商。本文展示瞭如何從零開始構建自定義的編碼代理框架,整合Modal沙箱以實現安全、並行和可擴充套件的自動化任務,以Parameter Golf挑戰為例。

  • Modal是OpenAI Agents SDK的官方沙箱提供商,提供隔離、可擴充套件的執行環境。
  • 文章逐步演示了構建代理框架,包括基礎代理、沙箱化、記憶、子代理、非同步並行和快照功能。
站內正文

自動縮放自動研究:在Modal上為您的智慧體提供彈性GPU

Modal與Autoresearch整合,提供彈性GPU擴充套件,使AI智慧體能夠動態調配計算資源。在Parameter Golf挑戰中,一個智慧體在238個GPU小時內執行了113個實驗,與單個工作站相比實現了5倍加速,同時僅使用了專用叢集資源的一小部分。

  • Modal使智慧體能夠無縫地從單個GPU擴充套件到數十個H100,適應工作負載需求。
  • Parameter Golf智慧體在完成核心訓練執行時比單個工作站快5倍,資源利用率高效。
站內正文

Butter 加入 Modal

Modal 宣佈收購 AI 沙箱技術公司 Butter,其創始人 Erik Dunteman 和研究員 Raymond Tana 將加入 Modal 沙箱團隊。Butter 在代理工程領域經驗豐富,最近用 Zig 語言開發了輕量級臨時沙箱 bVisor。此次收購旨在加強 Modal 沙箱產品的能力。

  • Butter 團隊加入 Modal,專注代理工程和沙箱產品升級。
  • Butter 創始人 Erik Dunteman 曾共同創辦 Banana,與 Modal 有長期合作關係。
站內正文

Physical Intelligence 的機器人即時推理

Physical Intelligence 使用 Modal 平臺,透過基於 QUIC 的專業傳輸協議,實現了低延遲的機器人遠端即時推理,僅增加 10-15 毫秒網路開銷,並能靈活擴充套件至更大模型。

  • Physical Intelligence 開發了視覺-語言-動作(VLA)模型,用於通用機器人智慧。
  • Modal 的隧道服務透過 TCP 提供低延遲,但機器人控制迴路要求更穩定的通訊。
站內正文

產品更新:RTX Pro 6000 Blackwell、Command K、Sandbox FS API 等

Modal 釋出多項產品更新,包括 NVIDIA RTX Pro 6000 Blackwell GPU 支援、Dashboard 命令面板 Command K、Sandbox 檔案系統 API Beta、SDK 改進以及多個客戶案例與社群內容。

  • RTX Pro 6000 Blackwell 上線,96GB VRAM,適合推理和微調。
  • Command K 快捷鍵提供導航和物件跳轉功能。
站內正文

Runway 選擇 Modal 為 Runway Characters 提供即時推理支援

Runway 與 Modal 合作,利用 Modal 的無伺服器計算平臺為 Runway Characters 提供即時影片推理。Runway Characters 是一個即時影片代理 API,可從單張影像生成可定製的數字角色,無需微調。該技術已應用於多個領域,包括客戶支援、內部培訓等。Modal 的基礎設施使 Runway 能夠在 30 天內從概念驗證到生產,並支援全球低延遲部署。

  • Runway 與 Modal 合作,用於 Runway Characters 的即時推理。
  • Runway Characters 是基於 GWM-1 模型的即時影片代理 API。
站內正文

Doppel如何利用Modal消除機器學習基礎設施負擔

Doppel是一家AI網路安全平臺,透過遷移至Modal,顯著提升了模型訓練和推理的效率。訓練方面,實現了並行實驗,縮短了反饋迴圈;推理方面,簡化了部署流程,實現了自動伸縮,降低了運維成本。

  • Doppel利用Modal實現了訓練實驗的並行化,加速了模型迭代。
  • Modal的映象層快取和持久卷將模型部署構建時間縮短了10倍。
站內正文

產品更新:目錄快照、GLM-5、計費更新等等

二月份產品更新摘要:推出目錄快照功能,提供免費GLM-5端點,改進了計費可見性(新UI和API),SDK更新(變更日誌命令、儀表板URL等),以及關於Sandbox的網路研討會和AI研究案例。

  • 目錄快照允許對特定目錄進行快照,獨立於基礎映象,分離系統依賴與應用程式碼。
  • 與Z.ai合作提供免費GLM-5端點,截止4月底,適用於編碼代理。
站內正文

全部來源