待翻譯:Bringing serverless functions closer to the speed of wire 2026-08-04 08:00 UTC+8 AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Modal’s Function Call data path is now >50ms faster. Our new routing layer is geographically distributed, so you can further reduce your network overhead.
AI 服務暫時不可用,系統已先保留來源內容與降級元數據。 Modal’s Function Call data path is now >50ms faster. Our new routing layer is geographically distributed, so you can further reduce your network overhead. 關於Hugging Face智能體事件的通知 2026-07-29 08:00 UTC+8 Hugging Face公佈了近期一起智能體入侵事件的技術時間線,其中提到Modal作為第三方基礎設施。Modal表示其平台和隔離機制未受影響。
Hugging Face發佈了智能體入侵的技術時間線,指出Modal是所涉第三方基礎設施。 Modal的平台和隔離未受到任何形式的入侵。 月之暗面Kimi K3現已在Modal上可用 2026-07-27 08:00 UTC+8 月之暗面發佈了2.8萬億參數的多模態模型Kimi K3,並可在Modal上以每秒460個token的速度運行。該模型採用混合專家架構,支持100萬token上下文窗口和原生視覺。Modal提供了自定義DFlash推測解碼器,大幅提升推理速度。
Kimi K3是月之暗面最新發布的2.8萬億參數多模態模型,在Artificial Analysis智能指數中排名第四。 模型採用混合專家架構,每token激活16/896專家,支持100萬token上下文窗口。 Modal 上的 Devin Outposts 2026-07-21 08:00 UTC+8 Cognition 開發的 AI 軟件工程師 Devin 現可通過 Devin Outposts 在 Modal 沙盒中運行,支持自定義環境(如 GPU)和快速冷啓動。
Devin Outposts 讓 Devin 在用户控制的環境中執行,而推理仍在 Cognition 雲端。 Modal 作為啓動合作伙伴,提供開源集成 modal-devin。 Thinking Machines 的 Inkling 現已在 Modal 上可用 2026-07-15 08:00 UTC+8 Thinking Machines 發佈了通用多模態模型 Inkling,支持文本、圖像和音頻輸入並生成文本輸出,現可通過 Modal 託管端點使用,採用基於令牌的定價。文章還討論了其獨特的局部注意力架構和 DFlash 推測解碼技術的優勢。
Thinking Machines 發佈 Inkling,一個 975B 總參數(41B 活躍)的多模態專家混合模型,支持 1M 令牌上下文窗口。 Inkling 採用局部注意力佈局,每六層中有五層使用滑動窗口注意力,提高計算效率。 如何為無服務器GPU定價 2026-07-06 20:00 UTC+8 比較無服務器和預留GPU的費率時,需關注應用的峯值與平均需求比。本文通過一個成本模型,解釋了當峯值-平均比超過預留折扣率時,無服務器GPU更經濟,並討論了模型的假設和侷限性。
無服務器GPU按需付費,預留GPU需長期合同,兩者成本差異取決於峯值-平均比。 當峯值-平均比大於預留折扣率時,無服務器GPU總成本更低。 多令牌殘差預測 2026-07-01 08:00 UTC+8 多令牌殘差預測(MRP)是一種針對擴散語言模型的輕量級模塊,通過預測相鄰去噪步驟之間的殘差而非完整分佈,實現了在靜態和動態兩種推理場景下的性能提升。靜態模式下可實現無質量損失的加速(高達1.56倍),動態模式下可恢復因激進閾值解碼而損失的高達+16個百分點的準確率。
MRP通過預測殘差而非完整分佈,使小型模塊能夠準確預測多個去噪步驟。 在靜態去噪中,MRP支持無損推測解碼和有損直接解碼,速度提升可達1.89倍。 Anthropic與Modal集成,為Claude Science帶來可擴展計算能力 2026-06-30 08:00 UTC+8 Anthropic推出Claude Science,這是一個面向生命科學研究人員的AI工作台,集成了Modal的彈性計算基礎設施,使研究人員能在對話中直接運行從數據處理到分子設計的計算密集型工作負載。
Claude Science是Anthropic為科學家打造的AI工作台,支持在對話中直接運行計算任務 集成Modal提供可擴展的計算能力,自動處理GPU和CPU密集型工作負載 基於Pingora、Envoy和Spanner的無服務器服務器路由 2026-06-25 08:00 UTC+8 Modal團隊深入介紹了其新型超低延遲Serverless Servers的設計原理和實現細節,該服務針對LLM推理等對延遲敏感的應用進行了優化。文章解釋了為何選擇構建自己的代理層fprs,以及如何通過Pingora庫、Envoy邊緣代理和Spanner全局數據庫實現無網絡調用熱路徑、動態域名關聯和自動縮放。
Modal推出Serverless Servers,專為超低延遲HTTP/WebSocket/gRPC流量設計。 與Web Functions不同,Servers犧牲了排隊和重試以換取更低延遲。 通過推測解碼實現最先進的推理延遲 2026-06-24 08:00 UTC+8 Modal與Decagon合作,利用推測解碼將推理延遲降低100毫秒,超越了專有推理提供商。本文詳細介紹了通過優化通信延遲、主機開銷、預填充延遲和解碼延遲來實現低延遲的完整策略,並重點展示了為特定應用定製推測模型(DFlash技術)如何帶來顯著性能提升。
Modal Auto Endpoints通過推測解碼實現低延遲推理,關鍵優化是使用Blackwell GPU、SGLang引擎和Modal服務器。 推測解碼通過並行處理多個推測令牌來減少解碼階段延遲,且效率主要取決於接受長度。 Modal Auto Endpoints 發佈:優化推理,真正擁有 2026-06-23 08:00 UTC+8 Modal 推出 Auto Endpoints,一個自服務的生產級 LLM 推理入口,讓用户通過單一命令行即可部署前沿開放模型,並完全掌控推理代碼、指標和基礎設施。該服務基於 Modal 的 AI 基礎設施平台,提供高性能自動擴縮、自定義容器運行時和全球 GPU 資源,並通過 Modal Servers 實現超低延遲路由(5ms 開銷)。預調優的推理方案源自與頂級團隊的合作經驗,並採用 DFlash 投機解碼加速。未來將實現推理工程全自動化。
Auto Endpoints 支持一鍵部署開放模型(如 GLM 5.2),用户擁有完整推理棧。 提供引擎級可觀測性指標,包括服務器和推理指標。 投機解碼:一切皆是推測 2026-06-19 08:00 UTC+8 Modal團隊全面推崇投機解碼技術,認為它是當前最關鍵的高交互推理優化手段,能帶來2-3倍甚至更高的加速效果。他們與Z Lab合作訓練了針對Qwen系列模型的最先進DFlash投機解碼器,額外提升5-20%的速度,並強調了投機解碼在長上下文任務中的優勢。本文詳細解釋了投機解碼的原理、與傳統優化的對比,以及通過模擬和數學模型展示的加速效果。
投機解碼是目前唯一重要的推理引擎優化,能實現數倍加速而非微小百分比提升。 Modal與Z Lab合作發佈了多款Qwen模型的DFlash投機解碼器,額外提速5-20%。 強化學習是一個基礎設施問題 2026-05-29 08:00 UTC+8 本文探討了強化學習在大型語言模型後訓練中的實際應用,指出當前的瓶頸並非算法而是基礎設施。Modal分享了大規模運行RL後訓練的經驗,介紹了其開源庫如何幫助團隊解決多節點訓練、環境管理和GPU利用率等關鍵問題。
強化學習後訓練LLM的瓶頸是基礎設施,包括訓練引擎、推理沙箱和環境隔離。 多節點訓練中,權重同步耗時巨大,RDMA和增量壓縮顯著降低延遲。 面向人類和智能體的基於角色的訪問控制 2026-05-27 08:00 UTC+8 Modal 為 Teams 和 Enterprise 用户推出了基於角色的訪問控制(RBAC),圍繞環境(Environments)構建,支持精細權限管理,確保智能體和人類的安全協作。
RBAC 現已面向所有 Team 和 Enterprise 計劃用户開放,基於環境(Environments)實現安全邊界。 受限環境(Restricted Environments)可精確控制誰能在其中部署和管理資源。 Modal C輪融資:以46.5億美元估值籌集3.55億美元 2026-05-21 08:00 UTC+8 Modal 公司宣佈完成3.55億美元C輪融資,估值達46.5億美元,由 General Catalyst 和 Redpoint 領投。自去年9月以來,公司收入增長五倍,年化收入突破3億美元。Modal 是為AI工作負載量身打造的雲平台,提供低延遲彈性推理、動態智能體運行時、強化學習和大規模批處理等原生能力。本輪融資將用於進一步投資低延遲推理、訓練-推理閉環以及智能體計算層。
Modal 以46.5億美元估值籌集3.55億美元C輪融資,General Catalyst 和 Redpoint 領投,現有投資者全部跟投。 自2025年9月以來,公司收入增長五倍,年化收入超過3億美元。 在Applied Compute擴展強化學習 2026-05-20 08:00 UTC+8 Applied Compute 使用強化學習為企業(如 DoorDash、Cognition、Mercor)訓練定製 AI 代理,並在 Modal 上運行。其核心理念是“特定智能”:通過專有數據訓練,每次使用都能改進。本文介紹了他們的 RL 訓練循環、基礎設施選擇以及 Modal 如何提供靈活性、性能和可靠性。
Applied Compute 專注於後訓練階段,認為這是企業 AI 競爭的關鍵。 他們使用強化學習訓練具有“特定智能”的代理,例如為 DoorDash 優化商家入駐模型。 推出結合Modal Sandboxes的Claude託管代理 2026-05-19 08:00 UTC+8 Anthropic與Modal宣佈推出Claude託管代理與Modal Sandboxes的集成,允許開發者在自己託管的可定製沙盒中運行工具調用,具有快速啓動、成本效益和可擴展性。早期採用者包括Mason AI、DoorDash和Blend。
Claude託管代理現在與Modal Sandboxes集成,支持自定義、可擴展的代理執行。 Modal提供快速啓動、自定義鏡像、持久化選項和成本高效的爆發定價。 如何實現真正的無服務器GPU 2026-05-12 20:00 UTC+8 Modal 通過四項關鍵技術優化,將 GPU 推理服務器實例的啓動時間從數十分鐘縮短到幾十秒,實現了真正的無服務器 GPU。
維護空閒 GPU 緩衝池,消除實例分配延遲 自定義內容尋址文件系統,實現容器鏡像按需加載 用一個簡單的Python字典將多模態推理性能提升超10% 2026-05-04 08:00 UTC+8 Modal團隊通過分析SGLang調度器的性能瓶頸,發現頻繁的CUDA IPC池句柄重新打開操作導致主機開銷過高。他們通過一個簡單的Python字典緩存替換了重複操作,在Qwen2.5-VL-3B模型上實現了吞吐量提升16.2%、延遲降低超10%的效果。該優化已合併至SGLang v0.5.10版本。
SGLang調度器在處理多模態輸入時,因重複打開CUDA IPC池句柄造成主機開銷瓶頸。 通過一個Python字典緩存池句柄,避免了冗餘的_shared_cuda調用,減少調度器CPU時間。 在Modal上構建強化學習定理證明工作流 2026-04-29 08:00 UTC+8 AE Studio利用Modal平台,通過進化策略(ES)和GRPO兩種強化學習方法訓練語言模型進行數學定理證明。他們使用Lean驗證器,並藉助Modal的並行GPU、沙盒隔離和卷存儲功能高效運行實驗。結果顯示ES在某些場景下媲美甚至超越GRPO,且成本顯著降低。
AE Studio在Modal上實現了進化策略(ES)用於定理證明,並與GRPO進行了對比。 利用Modal的.map()並行GPU推斷、沙盒隔離驗證和卷存儲,大幅簡化了基礎設施搭建。 使用Modal和OpenAI Agents SDK構建 2026-04-15 08:00 UTC+8 Modal成為OpenAI Agents SDK的官方沙箱提供商。本文展示瞭如何從零開始構建自定義的編碼代理框架,集成Modal沙箱以實現安全、並行和可擴展的自動化任務,以Parameter Golf挑戰為例。
Modal是OpenAI Agents SDK的官方沙箱提供商,提供隔離、可擴展的運行環境。 文章逐步演示了構建代理框架,包括基礎代理、沙箱化、記憶、子代理、異步並行和快照功能。 自動縮放自動研究:在Modal上為您的智能體提供彈性GPU 2026-04-14 08:00 UTC+8 Modal與Autoresearch集成,提供彈性GPU擴展,使AI智能體能夠動態調配計算資源。在Parameter Golf挑戰中,一個智能體在238個GPU小時內運行了113個實驗,與單個工作站相比實現了5倍加速,同時僅使用了專用集羣資源的一小部分。
Modal使智能體能夠無縫地從單個GPU擴展到數十個H100,適應工作負載需求。 Parameter Golf智能體在完成核心訓練運行時比單個工作站快5倍,資源利用率高效。 Butter 加入 Modal 2026-04-10 08:00 UTC+8 Modal 宣佈收購 AI 沙箱技術公司 Butter,其創始人 Erik Dunteman 和研究員 Raymond Tana 將加入 Modal 沙箱團隊。Butter 在代理工程領域經驗豐富,最近用 Zig 語言開發了輕量級臨時沙箱 bVisor。此次收購旨在加強 Modal 沙箱產品的能力。
Butter 團隊加入 Modal,專注代理工程和沙箱產品升級。 Butter 創始人 Erik Dunteman 曾共同創辦 Banana,與 Modal 有長期合作關係。 Physical Intelligence 的機器人實時推理 2026-04-08 08:00 UTC+8 Physical Intelligence 使用 Modal 平台,通過基於 QUIC 的專業傳輸協議,實現了低延遲的機器人遠程實時推理,僅增加 10-15 毫秒網絡開銷,並能靈活擴展至更大模型。
Physical Intelligence 開發了視覺-語言-動作(VLA)模型,用於通用機器人智能。 Modal 的隧道服務通過 TCP 提供低延遲,但機器人控制迴路要求更穩定的通信。 產品更新:RTX Pro 6000 Blackwell、Command K、Sandbox FS API 等 2026-04-07 08:00 UTC+8 Modal 發佈多項產品更新,包括 NVIDIA RTX Pro 6000 Blackwell GPU 支持、Dashboard 命令面板 Command K、Sandbox 文件系統 API Beta、SDK 改進以及多個客户案例與社區內容。
RTX Pro 6000 Blackwell 上線,96GB VRAM,適合推理和微調。 Command K 快捷鍵提供導航和對象跳轉功能。 Runway 選擇 Modal 為 Runway Characters 提供實時推理支持 2026-03-26 08:00 UTC+8 Runway 與 Modal 合作,利用 Modal 的無服務器計算平台為 Runway Characters 提供實時視頻推理。Runway Characters 是一個實時視頻代理 API,可從單張圖像生成可定製的數字角色,無需微調。該技術已應用於多個領域,包括客户支持、內部培訓等。Modal 的基礎設施使 Runway 能夠在 30 天內從概念驗證到生產,並支持全球低延遲部署。
Runway 與 Modal 合作,用於 Runway Characters 的實時推理。 Runway Characters 是基於 GWM-1 模型的實時視頻代理 API。 Doppel如何利用Modal消除機器學習基礎設施負擔 2026-03-25 08:00 UTC+8 Doppel是一家AI網絡安全平台,通過遷移至Modal,顯著提升了模型訓練和推理的效率。訓練方面,實現了並行實驗,縮短了反饋循環;推理方面,簡化了部署流程,實現了自動伸縮,降低了運維成本。
Doppel利用Modal實現了訓練實驗的並行化,加速了模型迭代。 Modal的鏡像層緩存和持久卷將模型部署構建時間縮短了10倍。 產品更新:目錄快照、GLM-5、計費更新等等 2026-03-04 08:00 UTC+8 二月份產品更新摘要:推出目錄快照功能,提供免費GLM-5端點,改進了計費可見性(新UI和API),SDK更新(變更日誌命令、儀表板URL等),以及關於Sandbox的網絡研討會和AI研究案例。
目錄快照允許對特定目錄進行快照,獨立於基礎鏡像,分離系統依賴與應用代碼。 與Z.ai合作提供免費GLM-5端點,截止4月底,適用於編碼代理。