跳到主要內容
AI News HubLIVE
公開文章 34採集文章 39可信度 82刷新頻率 120 分鐘
健康狀態 健康來源類型 官方原文權限 官方原文最近入庫 2026-09-26ID modal-blog運行狀態 已啟用

Official AI infrastructure blog; confirm reuse terms before full body display.

最新公開文章

待翻譯:How to serve trillions of tokens for trillion-parameter coding agents

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Learn how we optimized performance and efficiency serving the workload that is changing software engineering forever — and you can too.

Modal Blog站內正文待翻譯:How to serve trillions of tokens for trillion-parameter coding agents

Botika如何在Modal上執行全棧生成式AI

Botika為全球時尚品牌打造自動化視覺生產平臺,其自研模型訓練、百TB級資料管道和約15個生產推理服務全部執行在Modal上。CEO Eran Dagan表示,Modal顯著降低了雲基礎設施負擔,讓研究迭代和彈性擴充套件變得更快。

Modal Blog站內正文Botika如何在Modal上執行全棧生成式AI

Modal 擴張歐洲版圖,新設倫敦辦公室

Modal 宣佈在倫敦開設新辦公室,作為其在歐洲擴張的重要一步。公司已在斯德哥爾摩擁有近20人的工程團隊,現正擴充套件至倫敦,以加強銷售和市場團隊,並計劃逐步擴充套件至工程等其他職能。歐洲的AI初創企業如Black Forest Labs和Legora已在使用Modal,DoorDash等全球平臺也在用。

Modal Blog站內正文Modal 擴張歐洲版圖,新設倫敦辦公室

待翻譯:Qwen3.8-2.4T-A95B now available on Modal

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Qwen3.8-2.4T-A95B by Alibaba, with a 1M token context window, is now available via Modal Auto Endpoints.

Modal Blog站內正文待翻譯:Qwen3.8-2.4T-A95B now available on Modal

待翻譯:Bringing serverless functions closer to the speed of wire

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Modal’s Function Call data path is now >50ms faster. Our new routing layer is geographically distributed, so you can further reduce your network overhead.

Modal Blog站內正文待翻譯:Bringing serverless functions closer to the speed of wire

關於Hugging Face智慧體事件的通知

Hugging Face公佈了近期一起智慧體入侵事件的技術時間線,其中提到Modal作為第三方基礎設施。Modal表示其平臺和隔離機制未受影響。

Modal Blog站內正文關於Hugging Face智慧體事件的通知

月之暗面Kimi K3現已在Modal上可用

月之暗面釋出了2.8萬億引數的多模態模型Kimi K3,並可在Modal上以每秒460個token的速度執行。該模型採用混合專家架構,支援100萬token上下文視窗和原生視覺。Modal提供了自定義DFlash推測解碼器,大幅提升推理速度。

Modal Blog站內正文月之暗面Kimi K3現已在Modal上可用

Modal 上的 Devin Outposts

Cognition 開發的 AI 軟體工程師 Devin 現可透過 Devin Outposts 在 Modal 沙盒中執行,支援自定義環境(如 GPU)和快速冷啟動。

Modal Blog站內正文Modal 上的 Devin Outposts

Thinking Machines 的 Inkling 現已在 Modal 上可用

Thinking Machines 釋出了通用多模態模型 Inkling,支援文本、影像和音訊輸入並生成文本輸出,現可透過 Modal 託管端點使用,採用基於令牌的定價。文章還討論了其獨特的區域性注意力架構和 DFlash 推測解碼技術的優勢。

Modal Blog站內正文Thinking Machines 的 Inkling 現已在 Modal 上可用

如何為無伺服器GPU定價

比較無伺服器和預留GPU的費率時,需關注應用的峰值與平均需求比。本文透過一個成本模型,解釋了當峰值-平均比超過預留折扣率時,無伺服器GPU更經濟,並討論了模型的假設和侷限性。

Modal Blog站內正文如何為無伺服器GPU定價

多令牌殘差預測

多令牌殘差預測(MRP)是一種針對擴散語言模型的輕量級模組,透過預測相鄰去噪步驟之間的殘差而非完整分佈,實現了在靜態和動態兩種推理場景下的效能提升。靜態模式下可實現無質量損失的加速(高達1.56倍),動態模式下可恢復因激進閾值解碼而損失的高達+16個百分點的準確率。

Modal Blog站內正文多令牌殘差預測

Anthropic與Modal整合,為Claude Science帶來可擴充套件計算能力

Anthropic推出Claude Science,這是一個面向生命科學研究人員的AI工作臺,整合了Modal的彈性計算基礎設施,使研究人員能在對話中直接執行從資料處理到分子設計的計算密集型工作負載。

Modal Blog站內正文Anthropic與Modal整合,為Claude Science帶來可擴充套件計算能力

基於Pingora、Envoy和Spanner的無伺服器伺服器路由

Modal團隊深入介紹了其新型超低延遲Serverless Servers的設計原理和實現細節,該服務針對LLM推理等對延遲敏感的應用進行了最佳化。文章解釋了為何選擇構建自己的代理層fprs,以及如何透過Pingora庫、Envoy邊緣代理和Spanner全域性資料庫實現無網路呼叫熱路徑、動態域名關聯和自動縮放。

Modal Blog站內正文基於Pingora、Envoy和Spanner的無伺服器伺服器路由

透過推測解碼實現最先進的推理延遲

Modal與Decagon合作,利用推測解碼將推理延遲降低100毫秒,超越了專有推理提供商。本文詳細介紹了透過最佳化通訊延遲、主機開銷、預填充延遲和解碼延遲來實現低延遲的完整策略,並重點展示了為特定應用定製推測模型(DFlash技術)如何帶來顯著效能提升。

Modal Blog站內正文透過推測解碼實現最先進的推理延遲

Modal Auto Endpoints 釋出:最佳化推理,真正擁有

Modal 推出 Auto Endpoints,一個自服務的生產級 LLM 推理入口,讓使用者透過單一命令列即可部署前沿開放模型,並完全掌控推理程式碼、指標和基礎設施。該服務基於 Modal 的 AI 基礎設施平臺,提供高效能自動擴縮、自定義容器執行時和全球 GPU 資源,並透過 Modal Servers 實現超低延遲路由(5ms 開銷)。預調優的推理方案源自與頂級團隊的合作經驗,並採用 DFlash 投機解碼加速。未來將實現推理工程全自動化。

Modal Blog站內正文Modal Auto Endpoints 釋出:最佳化推理,真正擁有

投機解碼:一切皆是推測

Modal團隊全面推崇投機解碼技術,認為它是當前最關鍵的高互動推理最佳化手段,能帶來2-3倍甚至更高的加速效果。他們與Z Lab合作訓練了針對Qwen系列模型的最先進DFlash投機解碼器,額外提升5-20%的速度,並強調了投機解碼在長上下文任務中的優勢。本文詳細解釋了投機解碼的原理、與傳統最佳化的對比,以及透過模擬和數學模型展示的加速效果。

Modal Blog站內正文投機解碼:一切皆是推測

強化學習是一個基礎設施問題

本文探討了強化學習在大型語言模型後訓練中的實際應用,指出當前的瓶頸並非演算法而是基礎設施。Modal分享了大規模執行RL後訓練的經驗,介紹了其開源庫如何幫助團隊解決多節點訓練、環境管理和GPU利用率等關鍵問題。

Modal Blog站內正文強化學習是一個基礎設施問題

面向人類和智慧體的基於角色的訪問控制

Modal 為 Teams 和 Enterprise 使用者推出了基於角色的訪問控制(RBAC),圍繞環境(Environments)構建,支援精細許可權管理,確保智慧體和人類的安全協作。

Modal Blog站內正文面向人類和智慧體的基於角色的訪問控制

Modal C輪融資:以46.5億美元估值籌集3.55億美元

Modal 公司宣佈完成3.55億美元C輪融資,估值達46.5億美元,由 General Catalyst 和 Redpoint 領投。自去年9月以來,公司收入增長五倍,年化收入突破3億美元。Modal 是為AI工作負載量身打造的雲平臺,提供低延遲彈性推理、動態智慧體執行時、強化學習和大規模批處理等原生能力。本輪融資將用於進一步投資低延遲推理、訓練-推理閉環以及智慧體計算層。

Modal Blog站內正文Modal C輪融資:以46.5億美元估值籌集3.55億美元

在Applied Compute擴充套件強化學習

Applied Compute 使用強化學習為企業(如 DoorDash、Cognition、Mercor)訓練定製 AI 代理,並在 Modal 上執行。其核心理念是“特定智慧”:透過專有資料訓練,每次使用都能改進。本文介紹了他們的 RL 訓練迴圈、基礎設施選擇以及 Modal 如何提供靈活性、效能和可靠性。

Modal Blog站內正文在Applied Compute擴充套件強化學習

推出結合Modal Sandboxes的Claude託管代理

Anthropic與Modal宣佈推出Claude託管代理與Modal Sandboxes的整合,允許開發者在自己託管的可定製沙盒中執行工具呼叫,具有快速啟動、成本效益和可擴充套件性。早期採用者包括Mason AI、DoorDash和Blend。

Modal Blog站內正文推出結合Modal Sandboxes的Claude託管代理

如何實現真正的無伺服器GPU

Modal 透過四項關鍵技術最佳化,將 GPU 推理伺服器例項的啟動時間從數十分鐘縮短到幾十秒,實現了真正的無伺服器 GPU。

Modal Blog站內正文如何實現真正的無伺服器GPU

用一個簡單的Python字典將多模態推理效能提升超10%

Modal團隊透過分析SGLang排程器的效能瓶頸,發現頻繁的CUDA IPC池控制代碼重新開啟操作導致主機開銷過高。他們透過一個簡單的Python字典快取替換了重複操作,在Qwen2.5-VL-3B模型上實現了吞吐量提升16.2%、延遲降低超10%的效果。該最佳化已合併至SGLang v0.5.10版本。

Modal Blog站內正文用一個簡單的Python字典將多模態推理效能提升超10%

在Modal上構建強化學習定理證明工作流

AE Studio利用Modal平臺,透過進化策略(ES)和GRPO兩種強化學習方法訓練語言模型進行數學定理證明。他們使用Lean驗證器,並藉助Modal的並行GPU、沙盒隔離和卷儲存功能高效執行實驗。結果顯示ES在某些場景下媲美甚至超越GRPO,且成本顯著降低。

Modal Blog站內正文在Modal上構建強化學習定理證明工作流

使用Modal和OpenAI Agents SDK構建

Modal成為OpenAI Agents SDK的官方沙箱提供商。本文展示瞭如何從零開始構建自定義的編碼代理框架,整合Modal沙箱以實現安全、並行和可擴充套件的自動化任務,以Parameter Golf挑戰為例。

Modal Blog站內正文使用Modal和OpenAI Agents SDK構建

自動縮放自動研究:在Modal上為您的智慧體提供彈性GPU

Modal與Autoresearch整合,提供彈性GPU擴充套件,使AI智慧體能夠動態調配計算資源。在Parameter Golf挑戰中,一個智慧體在238個GPU小時內執行了113個實驗,與單個工作站相比實現了5倍加速,同時僅使用了專用叢集資源的一小部分。

Modal Blog站內正文自動縮放自動研究:在Modal上為您的智慧體提供彈性GPU

Butter 加入 Modal

Modal 宣佈收購 AI 沙箱技術公司 Butter,其創始人 Erik Dunteman 和研究員 Raymond Tana 將加入 Modal 沙箱團隊。Butter 在代理工程領域經驗豐富,最近用 Zig 語言開發了輕量級臨時沙箱 bVisor。此次收購旨在加強 Modal 沙箱產品的能力。

Modal Blog站內正文Butter 加入 Modal

Physical Intelligence 的機器人即時推理

Physical Intelligence 使用 Modal 平臺,透過基於 QUIC 的專業傳輸協議,實現了低延遲的機器人遠端即時推理,僅增加 10-15 毫秒網路開銷,並能靈活擴充套件至更大模型。

Modal Blog站內正文Physical Intelligence 的機器人即時推理

全部來源