待翻译:Hitting a billion tokens per minute on one GPU by combining a query planner and an inference engine
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Maximizing perf on AI-SQL queries with the KV-optimal left-deep join
Official AI infrastructure blog; confirm reuse terms before full body display.
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Maximizing perf on AI-SQL queries with the KV-optimal left-deep join
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Learn how we optimized performance and efficiency serving the workload that is changing software engineering forever — and you can too.
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Recent product updates from Modal and news from around the community.
Botika为全球时尚品牌打造自动化视觉生产平台,其自研模型训练、百TB级数据管道和约15个生产推理服务全部运行在Modal上。CEO Eran Dagan表示,Modal显著降低了云基础设施负担,让研究迭代和弹性扩展变得更快。
Modal 宣布在伦敦开设新办公室,作为其在欧洲扩张的重要一步。公司已在斯德哥尔摩拥有近20人的工程团队,现正扩展至伦敦,以加强销售和市场团队,并计划逐步扩展至工程等其他职能。欧洲的AI初创企业如Black Forest Labs和Legora已在使用Modal,DoorDash等全球平台也在用。
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Qwen3.8-2.4T-A95B by Alibaba, with a 1M token context window, is now available via Modal Auto Endpoints.
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Modal’s Function Call data path is now >50ms faster. Our new routing layer is geographically distributed, so you can further reduce your network overhead.
Hugging Face公布了近期一起智能体入侵事件的技术时间线,其中提到Modal作为第三方基础设施。Modal表示其平台和隔离机制未受影响。
月之暗面发布了2.8万亿参数的多模态模型Kimi K3,并可在Modal上以每秒460个token的速度运行。该模型采用混合专家架构,支持100万token上下文窗口和原生视觉。Modal提供了自定义DFlash推测解码器,大幅提升推理速度。
Cognition 开发的 AI 软件工程师 Devin 现可通过 Devin Outposts 在 Modal 沙盒中运行,支持自定义环境(如 GPU)和快速冷启动。
Thinking Machines 发布了通用多模态模型 Inkling,支持文本、图像和音频输入并生成文本输出,现可通过 Modal 托管端点使用,采用基于令牌的定价。文章还讨论了其独特的局部注意力架构和 DFlash 推测解码技术的优势。
比较无服务器和预留GPU的费率时,需关注应用的峰值与平均需求比。本文通过一个成本模型,解释了当峰值-平均比超过预留折扣率时,无服务器GPU更经济,并讨论了模型的假设和局限性。
多令牌残差预测(MRP)是一种针对扩散语言模型的轻量级模块,通过预测相邻去噪步骤之间的残差而非完整分布,实现了在静态和动态两种推理场景下的性能提升。静态模式下可实现无质量损失的加速(高达1.56倍),动态模式下可恢复因激进阈值解码而损失的高达+16个百分点的准确率。
Anthropic推出Claude Science,这是一个面向生命科学研究人员的AI工作台,集成了Modal的弹性计算基础设施,使研究人员能在对话中直接运行从数据处理到分子设计的计算密集型工作负载。
Modal团队深入介绍了其新型超低延迟Serverless Servers的设计原理和实现细节,该服务针对LLM推理等对延迟敏感的应用进行了优化。文章解释了为何选择构建自己的代理层fprs,以及如何通过Pingora库、Envoy边缘代理和Spanner全局数据库实现无网络调用热路径、动态域名关联和自动缩放。
Modal与Decagon合作,利用推测解码将推理延迟降低100毫秒,超越了专有推理提供商。本文详细介绍了通过优化通信延迟、主机开销、预填充延迟和解码延迟来实现低延迟的完整策略,并重点展示了为特定应用定制推测模型(DFlash技术)如何带来显著性能提升。
Modal 推出 Auto Endpoints,一个自服务的生产级 LLM 推理入口,让用户通过单一命令行即可部署前沿开放模型,并完全掌控推理代码、指标和基础设施。该服务基于 Modal 的 AI 基础设施平台,提供高性能自动扩缩、自定义容器运行时和全球 GPU 资源,并通过 Modal Servers 实现超低延迟路由(5ms 开销)。预调优的推理方案源自与顶级团队的合作经验,并采用 DFlash 投机解码加速。未来将实现推理工程全自动化。
Modal团队全面推崇投机解码技术,认为它是当前最关键的高交互推理优化手段,能带来2-3倍甚至更高的加速效果。他们与Z Lab合作训练了针对Qwen系列模型的最先进DFlash投机解码器,额外提升5-20%的速度,并强调了投机解码在长上下文任务中的优势。本文详细解释了投机解码的原理、与传统优化的对比,以及通过模拟和数学模型展示的加速效果。
本文探讨了强化学习在大型语言模型后训练中的实际应用,指出当前的瓶颈并非算法而是基础设施。Modal分享了大规模运行RL后训练的经验,介绍了其开源库如何帮助团队解决多节点训练、环境管理和GPU利用率等关键问题。
Modal 为 Teams 和 Enterprise 用户推出了基于角色的访问控制(RBAC),围绕环境(Environments)构建,支持精细权限管理,确保智能体和人类的安全协作。
Modal 公司宣布完成3.55亿美元C轮融资,估值达46.5亿美元,由 General Catalyst 和 Redpoint 领投。自去年9月以来,公司收入增长五倍,年化收入突破3亿美元。Modal 是为AI工作负载量身打造的云平台,提供低延迟弹性推理、动态智能体运行时、强化学习和大规模批处理等原生能力。本轮融资将用于进一步投资低延迟推理、训练-推理闭环以及智能体计算层。
Applied Compute 使用强化学习为企业(如 DoorDash、Cognition、Mercor)训练定制 AI 代理,并在 Modal 上运行。其核心理念是“特定智能”:通过专有数据训练,每次使用都能改进。本文介绍了他们的 RL 训练循环、基础设施选择以及 Modal 如何提供灵活性、性能和可靠性。
Anthropic与Modal宣布推出Claude托管代理与Modal Sandboxes的集成,允许开发者在自己托管的可定制沙盒中运行工具调用,具有快速启动、成本效益和可扩展性。早期采用者包括Mason AI、DoorDash和Blend。
Modal 通过四项关键技术优化,将 GPU 推理服务器实例的启动时间从数十分钟缩短到几十秒,实现了真正的无服务器 GPU。
Modal团队通过分析SGLang调度器的性能瓶颈,发现频繁的CUDA IPC池句柄重新打开操作导致主机开销过高。他们通过一个简单的Python字典缓存替换了重复操作,在Qwen2.5-VL-3B模型上实现了吞吐量提升16.2%、延迟降低超10%的效果。该优化已合并至SGLang v0.5.10版本。
AE Studio利用Modal平台,通过进化策略(ES)和GRPO两种强化学习方法训练语言模型进行数学定理证明。他们使用Lean验证器,并借助Modal的并行GPU、沙盒隔离和卷存储功能高效运行实验。结果显示ES在某些场景下媲美甚至超越GRPO,且成本显著降低。
Modal成为OpenAI Agents SDK的官方沙箱提供商。本文展示了如何从零开始构建自定义的编码代理框架,集成Modal沙箱以实现安全、并行和可扩展的自动化任务,以Parameter Golf挑战为例。
Modal与Autoresearch集成,提供弹性GPU扩展,使AI智能体能够动态调配计算资源。在Parameter Golf挑战中,一个智能体在238个GPU小时内运行了113个实验,与单个工作站相比实现了5倍加速,同时仅使用了专用集群资源的一小部分。
Modal 宣布收购 AI 沙箱技术公司 Butter,其创始人 Erik Dunteman 和研究员 Raymond Tana 将加入 Modal 沙箱团队。Butter 在代理工程领域经验丰富,最近用 Zig 语言开发了轻量级临时沙箱 bVisor。此次收购旨在加强 Modal 沙箱产品的能力。
Physical Intelligence 使用 Modal 平台,通过基于 QUIC 的专业传输协议,实现了低延迟的机器人远程实时推理,仅增加 10-15 毫秒网络开销,并能灵活扩展至更大模型。