AI News HubLIVE
站内改写2 分钟阅读

Botika如何在Modal上运行全栈生成式AI

Botika为全球时尚品牌打造自动化视觉生产平台,其自研模型训练、百TB级数据管道和约15个生产推理服务全部运行在Modal上。CEO Eran Dagan表示,Modal显著降低了云基础设施负担,让研究迭代和弹性扩展变得更快。

Botika为全球时尚品牌打造“Agentic电商团队”,负责从4K图像生成到大规模实时个性化的整个视觉生产流程。公司在内部研究和训练自有定制模型,并以一套完整AI技术栈支撑:包含数十亿参数的专有基础模型、处理100TB图像数据集的数据管道,以及约15个承担生产推理的模型。这些全部运行在Modal上。联合创始人兼CEO Eran Dagan表示,“如果没有Modal,我认为Botika不会以现在这种形态存在”,团队很可能需要增加一倍人手。

2018年,Dagan和另一位联合创始人开始投入生成式AI时,相关工具尚未成熟,于是他们自行搭建了节点自动扩缩容、冷启动缓解、Docker镜像优化、GPU集群管理等能力。但传统云和Kubernetes的维护成本很高,光是排查节点故障就可能消耗数周。2023年他重新评估各大GPU云平台,看到Modal后立刻申请了beta访问。“我输入modal run,没想到就直接跑通了。当时感觉就是:这一下帮我省了一周时间。”如今,从数据管道到生产推理,Botika已经在Modal上完成端到端运行。

Botika的图像数据管道需要执行特征生成、过滤、打标签、聚类、聚合等数十道工序,同时运行约十二种AI模型,其中包括开源VLM和自研分类器,每种模型都使用自己的环境与GPU类型。此前管道跑在GCP Batch上,端到端迁移数据往往需要数周时间,手动调整缩放参数;用Airflow这类完整编排器又会背上沉重的DevOps负担。而Modal让“这个任务完成后执行下一个”的逻辑变得非常简单。团队只需要普通应用代码,就能以数千个并发容器处理100TB数据集,错误率控制在1%以下,并且几乎用上了Modal支持的所有GPU类型。

训练基础模型需要频繁实验。过去一位研究员一天只能启动一两组实验;现在借助Claude和Modal,研究员可以同时启动约50组短实验,筛选出有效方案再放大规模。研究人员自建Modal工作站,后台运行任务的同时让agent处理其他工作,实验吞吐量已接近前沿实验室。对于需要多GPU连续运行数周的4K图像生成基础模型训练,Botika在Modal的多节点训练还处于实验阶段时便已采用,并从第一天就获得跨GPU通信和RDMA网络支持。最近,团队仅用Modal原生原语不到一天就搭好强化学习基础设施:奖励服务器以Modal函数形式生成,训练任务中途可以再派生新任务,完成迭代奖励建模和rollout。

在生产推理端,Botika同时运行约15个模型,涵盖L4、L40S、A100、H100等GPU,Modal负责排队、自动扩缩容和冷启动处理,无需在每个服务前再接Redis队列。AI流量的伸缩模式与传统应用不同,因此Modal按需弹性扩缩的能力尤为关键。Dagan说,“即使流量在几秒内翻倍甚至增至三倍,也不会有人注意到。从技术角度看,公司里没人需要担心,因为我们知道Modal会自己搞定。”传统云正变得多余:“所有计算相关的业务——对我们来说大约占99%——都运行在Modal上。”更重要的是,Botika的用法并非依赖某个专有黑盒,而是使用标准函数编写应用,改造很少;团队里每位新入职工程师最后都会得到同样结论:再也回不去Kubernetes那套方式了。