待翻譯:Hitting a billion tokens per minute on one GPU by combining a query planner and an inference engine
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Maximizing perf on AI-SQL queries with the KV-optimal left-deep join
Official AI infrastructure blog; confirm reuse terms before full body display.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Maximizing perf on AI-SQL queries with the KV-optimal left-deep join
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Learn how we optimized performance and efficiency serving the workload that is changing software engineering forever — and you can too.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Recent product updates from Modal and news from around the community.
Botika為全球時尚品牌打造自動化視覺生產平台,其自研模型訓練、百TB級數據管道和約15個生產推理服務全部運行在Modal上。CEO Eran Dagan表示,Modal顯著降低了雲基礎設施負擔,讓研究迭代和彈性擴展變得更快。
Modal 宣佈在倫敦開設新辦公室,作為其在歐洲擴張的重要一步。公司已在斯德哥爾摩擁有近20人的工程團隊,現正擴展至倫敦,以加強銷售和市場團隊,並計劃逐步擴展至工程等其他職能。歐洲的AI初創企業如Black Forest Labs和Legora已在使用Modal,DoorDash等全球平台也在用。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Qwen3.8-2.4T-A95B by Alibaba, with a 1M token context window, is now available via Modal Auto Endpoints.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Modal’s Function Call data path is now >50ms faster. Our new routing layer is geographically distributed, so you can further reduce your network overhead.
Hugging Face公佈了近期一起智能體入侵事件的技術時間線,其中提到Modal作為第三方基礎設施。Modal表示其平台和隔離機制未受影響。
月之暗面發佈了2.8萬億參數的多模態模型Kimi K3,並可在Modal上以每秒460個token的速度運行。該模型採用混合專家架構,支持100萬token上下文窗口和原生視覺。Modal提供了自定義DFlash推測解碼器,大幅提升推理速度。
Cognition 開發的 AI 軟件工程師 Devin 現可通過 Devin Outposts 在 Modal 沙盒中運行,支持自定義環境(如 GPU)和快速冷啓動。
Thinking Machines 發佈了通用多模態模型 Inkling,支持文本、圖像和音頻輸入並生成文本輸出,現可通過 Modal 託管端點使用,採用基於令牌的定價。文章還討論了其獨特的局部注意力架構和 DFlash 推測解碼技術的優勢。
比較無服務器和預留GPU的費率時,需關注應用的峯值與平均需求比。本文通過一個成本模型,解釋了當峯值-平均比超過預留折扣率時,無服務器GPU更經濟,並討論了模型的假設和侷限性。
多令牌殘差預測(MRP)是一種針對擴散語言模型的輕量級模塊,通過預測相鄰去噪步驟之間的殘差而非完整分佈,實現了在靜態和動態兩種推理場景下的性能提升。靜態模式下可實現無質量損失的加速(高達1.56倍),動態模式下可恢復因激進閾值解碼而損失的高達+16個百分點的準確率。
Anthropic推出Claude Science,這是一個面向生命科學研究人員的AI工作台,集成了Modal的彈性計算基礎設施,使研究人員能在對話中直接運行從數據處理到分子設計的計算密集型工作負載。
Modal團隊深入介紹了其新型超低延遲Serverless Servers的設計原理和實現細節,該服務針對LLM推理等對延遲敏感的應用進行了優化。文章解釋了為何選擇構建自己的代理層fprs,以及如何通過Pingora庫、Envoy邊緣代理和Spanner全局數據庫實現無網絡調用熱路徑、動態域名關聯和自動縮放。
Modal與Decagon合作,利用推測解碼將推理延遲降低100毫秒,超越了專有推理提供商。本文詳細介紹了通過優化通信延遲、主機開銷、預填充延遲和解碼延遲來實現低延遲的完整策略,並重點展示了為特定應用定製推測模型(DFlash技術)如何帶來顯著性能提升。
Modal 推出 Auto Endpoints,一個自服務的生產級 LLM 推理入口,讓用户通過單一命令行即可部署前沿開放模型,並完全掌控推理代碼、指標和基礎設施。該服務基於 Modal 的 AI 基礎設施平台,提供高性能自動擴縮、自定義容器運行時和全球 GPU 資源,並通過 Modal Servers 實現超低延遲路由(5ms 開銷)。預調優的推理方案源自與頂級團隊的合作經驗,並採用 DFlash 投機解碼加速。未來將實現推理工程全自動化。
Modal團隊全面推崇投機解碼技術,認為它是當前最關鍵的高交互推理優化手段,能帶來2-3倍甚至更高的加速效果。他們與Z Lab合作訓練了針對Qwen系列模型的最先進DFlash投機解碼器,額外提升5-20%的速度,並強調了投機解碼在長上下文任務中的優勢。本文詳細解釋了投機解碼的原理、與傳統優化的對比,以及通過模擬和數學模型展示的加速效果。
本文探討了強化學習在大型語言模型後訓練中的實際應用,指出當前的瓶頸並非算法而是基礎設施。Modal分享了大規模運行RL後訓練的經驗,介紹了其開源庫如何幫助團隊解決多節點訓練、環境管理和GPU利用率等關鍵問題。
Modal 為 Teams 和 Enterprise 用户推出了基於角色的訪問控制(RBAC),圍繞環境(Environments)構建,支持精細權限管理,確保智能體和人類的安全協作。
Modal 公司宣佈完成3.55億美元C輪融資,估值達46.5億美元,由 General Catalyst 和 Redpoint 領投。自去年9月以來,公司收入增長五倍,年化收入突破3億美元。Modal 是為AI工作負載量身打造的雲平台,提供低延遲彈性推理、動態智能體運行時、強化學習和大規模批處理等原生能力。本輪融資將用於進一步投資低延遲推理、訓練-推理閉環以及智能體計算層。
Applied Compute 使用強化學習為企業(如 DoorDash、Cognition、Mercor)訓練定製 AI 代理,並在 Modal 上運行。其核心理念是“特定智能”:通過專有數據訓練,每次使用都能改進。本文介紹了他們的 RL 訓練循環、基礎設施選擇以及 Modal 如何提供靈活性、性能和可靠性。
Anthropic與Modal宣佈推出Claude託管代理與Modal Sandboxes的集成,允許開發者在自己託管的可定製沙盒中運行工具調用,具有快速啓動、成本效益和可擴展性。早期採用者包括Mason AI、DoorDash和Blend。
Modal 通過四項關鍵技術優化,將 GPU 推理服務器實例的啓動時間從數十分鐘縮短到幾十秒,實現了真正的無服務器 GPU。
Modal團隊通過分析SGLang調度器的性能瓶頸,發現頻繁的CUDA IPC池句柄重新打開操作導致主機開銷過高。他們通過一個簡單的Python字典緩存替換了重複操作,在Qwen2.5-VL-3B模型上實現了吞吐量提升16.2%、延遲降低超10%的效果。該優化已合併至SGLang v0.5.10版本。
AE Studio利用Modal平台,通過進化策略(ES)和GRPO兩種強化學習方法訓練語言模型進行數學定理證明。他們使用Lean驗證器,並藉助Modal的並行GPU、沙盒隔離和卷存儲功能高效運行實驗。結果顯示ES在某些場景下媲美甚至超越GRPO,且成本顯著降低。
Modal成為OpenAI Agents SDK的官方沙箱提供商。本文展示瞭如何從零開始構建自定義的編碼代理框架,集成Modal沙箱以實現安全、並行和可擴展的自動化任務,以Parameter Golf挑戰為例。
Modal與Autoresearch集成,提供彈性GPU擴展,使AI智能體能夠動態調配計算資源。在Parameter Golf挑戰中,一個智能體在238個GPU小時內運行了113個實驗,與單個工作站相比實現了5倍加速,同時僅使用了專用集羣資源的一小部分。
Modal 宣佈收購 AI 沙箱技術公司 Butter,其創始人 Erik Dunteman 和研究員 Raymond Tana 將加入 Modal 沙箱團隊。Butter 在代理工程領域經驗豐富,最近用 Zig 語言開發了輕量級臨時沙箱 bVisor。此次收購旨在加強 Modal 沙箱產品的能力。
Physical Intelligence 使用 Modal 平台,通過基於 QUIC 的專業傳輸協議,實現了低延遲的機器人遠程實時推理,僅增加 10-15 毫秒網絡開銷,並能靈活擴展至更大模型。