待翻譯:Hitting a billion tokens per minute on one GPU by combining a query planner and an inference engine
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Maximizing perf on AI-SQL queries with the KV-optimal left-deep join
Official AI infrastructure blog; confirm reuse terms before full body display.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Maximizing perf on AI-SQL queries with the KV-optimal left-deep join
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Learn how we optimized performance and efficiency serving the workload that is changing software engineering forever — and you can too.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Recent product updates from Modal and news from around the community.
Botika為全球時尚品牌打造自動化視覺生產平臺,其自研模型訓練、百TB級資料管道和約15個生產推理服務全部執行在Modal上。CEO Eran Dagan表示,Modal顯著降低了雲基礎設施負擔,讓研究迭代和彈性擴充套件變得更快。
Modal 宣佈在倫敦開設新辦公室,作為其在歐洲擴張的重要一步。公司已在斯德哥爾摩擁有近20人的工程團隊,現正擴充套件至倫敦,以加強銷售和市場團隊,並計劃逐步擴充套件至工程等其他職能。歐洲的AI初創企業如Black Forest Labs和Legora已在使用Modal,DoorDash等全球平臺也在用。
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Qwen3.8-2.4T-A95B by Alibaba, with a 1M token context window, is now available via Modal Auto Endpoints.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Modal’s Function Call data path is now >50ms faster. Our new routing layer is geographically distributed, so you can further reduce your network overhead.
Hugging Face公佈了近期一起智慧體入侵事件的技術時間線,其中提到Modal作為第三方基礎設施。Modal表示其平臺和隔離機制未受影響。
月之暗面釋出了2.8萬億引數的多模態模型Kimi K3,並可在Modal上以每秒460個token的速度執行。該模型採用混合專家架構,支援100萬token上下文視窗和原生視覺。Modal提供了自定義DFlash推測解碼器,大幅提升推理速度。
Cognition 開發的 AI 軟體工程師 Devin 現可透過 Devin Outposts 在 Modal 沙盒中執行,支援自定義環境(如 GPU)和快速冷啟動。
Thinking Machines 釋出了通用多模態模型 Inkling,支援文本、影像和音訊輸入並生成文本輸出,現可透過 Modal 託管端點使用,採用基於令牌的定價。文章還討論了其獨特的區域性注意力架構和 DFlash 推測解碼技術的優勢。
比較無伺服器和預留GPU的費率時,需關注應用的峰值與平均需求比。本文透過一個成本模型,解釋了當峰值-平均比超過預留折扣率時,無伺服器GPU更經濟,並討論了模型的假設和侷限性。
多令牌殘差預測(MRP)是一種針對擴散語言模型的輕量級模組,透過預測相鄰去噪步驟之間的殘差而非完整分佈,實現了在靜態和動態兩種推理場景下的效能提升。靜態模式下可實現無質量損失的加速(高達1.56倍),動態模式下可恢復因激進閾值解碼而損失的高達+16個百分點的準確率。
Anthropic推出Claude Science,這是一個面向生命科學研究人員的AI工作臺,整合了Modal的彈性計算基礎設施,使研究人員能在對話中直接執行從資料處理到分子設計的計算密集型工作負載。
Modal團隊深入介紹了其新型超低延遲Serverless Servers的設計原理和實現細節,該服務針對LLM推理等對延遲敏感的應用進行了最佳化。文章解釋了為何選擇構建自己的代理層fprs,以及如何透過Pingora庫、Envoy邊緣代理和Spanner全域性資料庫實現無網路呼叫熱路徑、動態域名關聯和自動縮放。
Modal與Decagon合作,利用推測解碼將推理延遲降低100毫秒,超越了專有推理提供商。本文詳細介紹了透過最佳化通訊延遲、主機開銷、預填充延遲和解碼延遲來實現低延遲的完整策略,並重點展示了為特定應用定製推測模型(DFlash技術)如何帶來顯著效能提升。
Modal 推出 Auto Endpoints,一個自服務的生產級 LLM 推理入口,讓使用者透過單一命令列即可部署前沿開放模型,並完全掌控推理程式碼、指標和基礎設施。該服務基於 Modal 的 AI 基礎設施平臺,提供高效能自動擴縮、自定義容器執行時和全球 GPU 資源,並透過 Modal Servers 實現超低延遲路由(5ms 開銷)。預調優的推理方案源自與頂級團隊的合作經驗,並採用 DFlash 投機解碼加速。未來將實現推理工程全自動化。
Modal團隊全面推崇投機解碼技術,認為它是當前最關鍵的高互動推理最佳化手段,能帶來2-3倍甚至更高的加速效果。他們與Z Lab合作訓練了針對Qwen系列模型的最先進DFlash投機解碼器,額外提升5-20%的速度,並強調了投機解碼在長上下文任務中的優勢。本文詳細解釋了投機解碼的原理、與傳統最佳化的對比,以及透過模擬和數學模型展示的加速效果。
本文探討了強化學習在大型語言模型後訓練中的實際應用,指出當前的瓶頸並非演算法而是基礎設施。Modal分享了大規模執行RL後訓練的經驗,介紹了其開源庫如何幫助團隊解決多節點訓練、環境管理和GPU利用率等關鍵問題。
Modal 為 Teams 和 Enterprise 使用者推出了基於角色的訪問控制(RBAC),圍繞環境(Environments)構建,支援精細許可權管理,確保智慧體和人類的安全協作。
Modal 公司宣佈完成3.55億美元C輪融資,估值達46.5億美元,由 General Catalyst 和 Redpoint 領投。自去年9月以來,公司收入增長五倍,年化收入突破3億美元。Modal 是為AI工作負載量身打造的雲平臺,提供低延遲彈性推理、動態智慧體執行時、強化學習和大規模批處理等原生能力。本輪融資將用於進一步投資低延遲推理、訓練-推理閉環以及智慧體計算層。
Applied Compute 使用強化學習為企業(如 DoorDash、Cognition、Mercor)訓練定製 AI 代理,並在 Modal 上執行。其核心理念是“特定智慧”:透過專有資料訓練,每次使用都能改進。本文介紹了他們的 RL 訓練迴圈、基礎設施選擇以及 Modal 如何提供靈活性、效能和可靠性。
Anthropic與Modal宣佈推出Claude託管代理與Modal Sandboxes的整合,允許開發者在自己託管的可定製沙盒中執行工具呼叫,具有快速啟動、成本效益和可擴充套件性。早期採用者包括Mason AI、DoorDash和Blend。
Modal 透過四項關鍵技術最佳化,將 GPU 推理伺服器例項的啟動時間從數十分鐘縮短到幾十秒,實現了真正的無伺服器 GPU。
Modal團隊透過分析SGLang排程器的效能瓶頸,發現頻繁的CUDA IPC池控制代碼重新開啟操作導致主機開銷過高。他們透過一個簡單的Python字典快取替換了重複操作,在Qwen2.5-VL-3B模型上實現了吞吐量提升16.2%、延遲降低超10%的效果。該最佳化已合併至SGLang v0.5.10版本。
AE Studio利用Modal平臺,透過進化策略(ES)和GRPO兩種強化學習方法訓練語言模型進行數學定理證明。他們使用Lean驗證器,並藉助Modal的並行GPU、沙盒隔離和卷儲存功能高效執行實驗。結果顯示ES在某些場景下媲美甚至超越GRPO,且成本顯著降低。
Modal成為OpenAI Agents SDK的官方沙箱提供商。本文展示瞭如何從零開始構建自定義的編碼代理框架,整合Modal沙箱以實現安全、並行和可擴充套件的自動化任務,以Parameter Golf挑戰為例。
Modal與Autoresearch整合,提供彈性GPU擴充套件,使AI智慧體能夠動態調配計算資源。在Parameter Golf挑戰中,一個智慧體在238個GPU小時內執行了113個實驗,與單個工作站相比實現了5倍加速,同時僅使用了專用叢集資源的一小部分。
Modal 宣佈收購 AI 沙箱技術公司 Butter,其創始人 Erik Dunteman 和研究員 Raymond Tana 將加入 Modal 沙箱團隊。Butter 在代理工程領域經驗豐富,最近用 Zig 語言開發了輕量級臨時沙箱 bVisor。此次收購旨在加強 Modal 沙箱產品的能力。
Physical Intelligence 使用 Modal 平臺,透過基於 QUIC 的專業傳輸協議,實現了低延遲的機器人遠端即時推理,僅增加 10-15 毫秒網路開銷,並能靈活擴充套件至更大模型。