跳到主要内容
AI News HubLIVE
公开文章 34采集文章 39可信度 82刷新频率 120 分钟
健康状态 健康来源类型 官方原文权限 官方原文最近入库 2026-09-26ID modal-blog运行状态 已启用

Official AI infrastructure blog; confirm reuse terms before full body display.

最新公开文章

待翻译:How to serve trillions of tokens for trillion-parameter coding agents

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Learn how we optimized performance and efficiency serving the workload that is changing software engineering forever — and you can too.

Modal Blog站内正文待翻译:How to serve trillions of tokens for trillion-parameter coding agents

Botika如何在Modal上运行全栈生成式AI

Botika为全球时尚品牌打造自动化视觉生产平台,其自研模型训练、百TB级数据管道和约15个生产推理服务全部运行在Modal上。CEO Eran Dagan表示,Modal显著降低了云基础设施负担,让研究迭代和弹性扩展变得更快。

Modal Blog站内正文Botika如何在Modal上运行全栈生成式AI

Modal 扩张欧洲版图,新设伦敦办公室

Modal 宣布在伦敦开设新办公室,作为其在欧洲扩张的重要一步。公司已在斯德哥尔摩拥有近20人的工程团队,现正扩展至伦敦,以加强销售和市场团队,并计划逐步扩展至工程等其他职能。欧洲的AI初创企业如Black Forest Labs和Legora已在使用Modal,DoorDash等全球平台也在用。

Modal Blog站内正文Modal 扩张欧洲版图,新设伦敦办公室

待翻译:Qwen3.8-2.4T-A95B now available on Modal

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Qwen3.8-2.4T-A95B by Alibaba, with a 1M token context window, is now available via Modal Auto Endpoints.

Modal Blog站内正文待翻译:Qwen3.8-2.4T-A95B now available on Modal

待翻译:Bringing serverless functions closer to the speed of wire

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Modal’s Function Call data path is now >50ms faster. Our new routing layer is geographically distributed, so you can further reduce your network overhead.

Modal Blog站内正文待翻译:Bringing serverless functions closer to the speed of wire

关于Hugging Face智能体事件的通知

Hugging Face公布了近期一起智能体入侵事件的技术时间线,其中提到Modal作为第三方基础设施。Modal表示其平台和隔离机制未受影响。

Modal Blog站内正文关于Hugging Face智能体事件的通知

月之暗面Kimi K3现已在Modal上可用

月之暗面发布了2.8万亿参数的多模态模型Kimi K3,并可在Modal上以每秒460个token的速度运行。该模型采用混合专家架构,支持100万token上下文窗口和原生视觉。Modal提供了自定义DFlash推测解码器,大幅提升推理速度。

Modal Blog站内正文月之暗面Kimi K3现已在Modal上可用

Modal 上的 Devin Outposts

Cognition 开发的 AI 软件工程师 Devin 现可通过 Devin Outposts 在 Modal 沙盒中运行,支持自定义环境(如 GPU)和快速冷启动。

Modal Blog站内正文Modal 上的 Devin Outposts

Thinking Machines 的 Inkling 现已在 Modal 上可用

Thinking Machines 发布了通用多模态模型 Inkling,支持文本、图像和音频输入并生成文本输出,现可通过 Modal 托管端点使用,采用基于令牌的定价。文章还讨论了其独特的局部注意力架构和 DFlash 推测解码技术的优势。

Modal Blog站内正文Thinking Machines 的 Inkling 现已在 Modal 上可用

如何为无服务器GPU定价

比较无服务器和预留GPU的费率时,需关注应用的峰值与平均需求比。本文通过一个成本模型,解释了当峰值-平均比超过预留折扣率时,无服务器GPU更经济,并讨论了模型的假设和局限性。

Modal Blog站内正文如何为无服务器GPU定价

多令牌残差预测

多令牌残差预测(MRP)是一种针对扩散语言模型的轻量级模块,通过预测相邻去噪步骤之间的残差而非完整分布,实现了在静态和动态两种推理场景下的性能提升。静态模式下可实现无质量损失的加速(高达1.56倍),动态模式下可恢复因激进阈值解码而损失的高达+16个百分点的准确率。

Modal Blog站内正文多令牌残差预测

Anthropic与Modal集成,为Claude Science带来可扩展计算能力

Anthropic推出Claude Science,这是一个面向生命科学研究人员的AI工作台,集成了Modal的弹性计算基础设施,使研究人员能在对话中直接运行从数据处理到分子设计的计算密集型工作负载。

Modal Blog站内正文Anthropic与Modal集成,为Claude Science带来可扩展计算能力

基于Pingora、Envoy和Spanner的无服务器服务器路由

Modal团队深入介绍了其新型超低延迟Serverless Servers的设计原理和实现细节,该服务针对LLM推理等对延迟敏感的应用进行了优化。文章解释了为何选择构建自己的代理层fprs,以及如何通过Pingora库、Envoy边缘代理和Spanner全局数据库实现无网络调用热路径、动态域名关联和自动缩放。

Modal Blog站内正文基于Pingora、Envoy和Spanner的无服务器服务器路由

通过推测解码实现最先进的推理延迟

Modal与Decagon合作,利用推测解码将推理延迟降低100毫秒,超越了专有推理提供商。本文详细介绍了通过优化通信延迟、主机开销、预填充延迟和解码延迟来实现低延迟的完整策略,并重点展示了为特定应用定制推测模型(DFlash技术)如何带来显著性能提升。

Modal Blog站内正文通过推测解码实现最先进的推理延迟

Modal Auto Endpoints 发布:优化推理,真正拥有

Modal 推出 Auto Endpoints,一个自服务的生产级 LLM 推理入口,让用户通过单一命令行即可部署前沿开放模型,并完全掌控推理代码、指标和基础设施。该服务基于 Modal 的 AI 基础设施平台,提供高性能自动扩缩、自定义容器运行时和全球 GPU 资源,并通过 Modal Servers 实现超低延迟路由(5ms 开销)。预调优的推理方案源自与顶级团队的合作经验,并采用 DFlash 投机解码加速。未来将实现推理工程全自动化。

Modal Blog站内正文Modal Auto Endpoints 发布:优化推理,真正拥有

投机解码:一切皆是推测

Modal团队全面推崇投机解码技术,认为它是当前最关键的高交互推理优化手段,能带来2-3倍甚至更高的加速效果。他们与Z Lab合作训练了针对Qwen系列模型的最先进DFlash投机解码器,额外提升5-20%的速度,并强调了投机解码在长上下文任务中的优势。本文详细解释了投机解码的原理、与传统优化的对比,以及通过模拟和数学模型展示的加速效果。

Modal Blog站内正文投机解码:一切皆是推测

强化学习是一个基础设施问题

本文探讨了强化学习在大型语言模型后训练中的实际应用,指出当前的瓶颈并非算法而是基础设施。Modal分享了大规模运行RL后训练的经验,介绍了其开源库如何帮助团队解决多节点训练、环境管理和GPU利用率等关键问题。

Modal Blog站内正文强化学习是一个基础设施问题

面向人类和智能体的基于角色的访问控制

Modal 为 Teams 和 Enterprise 用户推出了基于角色的访问控制(RBAC),围绕环境(Environments)构建,支持精细权限管理,确保智能体和人类的安全协作。

Modal Blog站内正文面向人类和智能体的基于角色的访问控制

Modal C轮融资:以46.5亿美元估值筹集3.55亿美元

Modal 公司宣布完成3.55亿美元C轮融资,估值达46.5亿美元,由 General Catalyst 和 Redpoint 领投。自去年9月以来,公司收入增长五倍,年化收入突破3亿美元。Modal 是为AI工作负载量身打造的云平台,提供低延迟弹性推理、动态智能体运行时、强化学习和大规模批处理等原生能力。本轮融资将用于进一步投资低延迟推理、训练-推理闭环以及智能体计算层。

Modal Blog站内正文Modal C轮融资:以46.5亿美元估值筹集3.55亿美元

在Applied Compute扩展强化学习

Applied Compute 使用强化学习为企业(如 DoorDash、Cognition、Mercor)训练定制 AI 代理,并在 Modal 上运行。其核心理念是“特定智能”:通过专有数据训练,每次使用都能改进。本文介绍了他们的 RL 训练循环、基础设施选择以及 Modal 如何提供灵活性、性能和可靠性。

Modal Blog站内正文在Applied Compute扩展强化学习

推出结合Modal Sandboxes的Claude托管代理

Anthropic与Modal宣布推出Claude托管代理与Modal Sandboxes的集成,允许开发者在自己托管的可定制沙盒中运行工具调用,具有快速启动、成本效益和可扩展性。早期采用者包括Mason AI、DoorDash和Blend。

Modal Blog站内正文推出结合Modal Sandboxes的Claude托管代理

如何实现真正的无服务器GPU

Modal 通过四项关键技术优化,将 GPU 推理服务器实例的启动时间从数十分钟缩短到几十秒,实现了真正的无服务器 GPU。

Modal Blog站内正文如何实现真正的无服务器GPU

用一个简单的Python字典将多模态推理性能提升超10%

Modal团队通过分析SGLang调度器的性能瓶颈,发现频繁的CUDA IPC池句柄重新打开操作导致主机开销过高。他们通过一个简单的Python字典缓存替换了重复操作,在Qwen2.5-VL-3B模型上实现了吞吐量提升16.2%、延迟降低超10%的效果。该优化已合并至SGLang v0.5.10版本。

Modal Blog站内正文用一个简单的Python字典将多模态推理性能提升超10%

在Modal上构建强化学习定理证明工作流

AE Studio利用Modal平台,通过进化策略(ES)和GRPO两种强化学习方法训练语言模型进行数学定理证明。他们使用Lean验证器,并借助Modal的并行GPU、沙盒隔离和卷存储功能高效运行实验。结果显示ES在某些场景下媲美甚至超越GRPO,且成本显著降低。

Modal Blog站内正文在Modal上构建强化学习定理证明工作流

使用Modal和OpenAI Agents SDK构建

Modal成为OpenAI Agents SDK的官方沙箱提供商。本文展示了如何从零开始构建自定义的编码代理框架,集成Modal沙箱以实现安全、并行和可扩展的自动化任务,以Parameter Golf挑战为例。

Modal Blog站内正文使用Modal和OpenAI Agents SDK构建

自动缩放自动研究:在Modal上为您的智能体提供弹性GPU

Modal与Autoresearch集成,提供弹性GPU扩展,使AI智能体能够动态调配计算资源。在Parameter Golf挑战中,一个智能体在238个GPU小时内运行了113个实验,与单个工作站相比实现了5倍加速,同时仅使用了专用集群资源的一小部分。

Modal Blog站内正文自动缩放自动研究:在Modal上为您的智能体提供弹性GPU

Butter 加入 Modal

Modal 宣布收购 AI 沙箱技术公司 Butter,其创始人 Erik Dunteman 和研究员 Raymond Tana 将加入 Modal 沙箱团队。Butter 在代理工程领域经验丰富,最近用 Zig 语言开发了轻量级临时沙箱 bVisor。此次收购旨在加强 Modal 沙箱产品的能力。

Modal Blog站内正文Butter 加入 Modal

Physical Intelligence 的机器人实时推理

Physical Intelligence 使用 Modal 平台,通过基于 QUIC 的专业传输协议,实现了低延迟的机器人远程实时推理,仅增加 10-15 毫秒网络开销,并能灵活扩展至更大模型。

Modal Blog站内正文Physical Intelligence 的机器人实时推理

全部来源