AI News HubLIVE
站內改寫2 分鐘閱讀

Botika如何在Modal上運行全棧生成式AI

Botika為全球時尚品牌打造自動化視覺生產平台,其自研模型訓練、百TB級數據管道和約15個生產推理服務全部運行在Modal上。CEO Eran Dagan表示,Modal顯著降低了雲基礎設施負擔,讓研究迭代和彈性擴展變得更快。

Botika為全球時尚品牌打造“Agentic電商團隊”,負責從4K圖像生成到大規模實時個性化的整個視覺生產流程。公司在內部研究和訓練自有定製模型,並以一套完整AI技術棧支撐:包含數十億參數的專有基礎模型、處理100TB圖像數據集的數據管道,以及約15個承擔生產推理的模型。這些全部運行在Modal上。聯合創始人兼CEO Eran Dagan表示,“如果沒有Modal,我認為Botika不會以現在這種形態存在”,團隊很可能需要增加一倍人手。

2018年,Dagan和另一位聯合創始人開始投入生成式AI時,相關工具尚未成熟,於是他們自行搭建了節點自動擴縮容、冷啓動緩解、Docker鏡像優化、GPU集羣管理等能力。但傳統雲和Kubernetes的維護成本很高,光是排查節點故障就可能消耗數週。2023年他重新評估各大GPU雲平台,看到Modal後立刻申請了beta訪問。“我輸入modal run,沒想到就直接跑通了。當時感覺就是:這一下幫我省了一週時間。”如今,從數據管道到生產推理,Botika已經在Modal上完成端到端運行。

Botika的圖像數據管道需要執行特徵生成、過濾、打標籤、聚類、聚合等數十道工序,同時運行約十二種AI模型,其中包括開源VLM和自研分類器,每種模型都使用自己的環境與GPU類型。此前管道跑在GCP Batch上,端到端遷移數據往往需要數週時間,手動調整縮放參數;用Airflow這類完整編排器又會背上沉重的DevOps負擔。而Modal讓“這個任務完成後執行下一個”的邏輯變得非常簡單。團隊只需要普通應用代碼,就能以數千個併發容器處理100TB數據集,錯誤率控制在1%以下,並且幾乎用上了Modal支持的所有GPU類型。

訓練基礎模型需要頻繁實驗。過去一位研究員一天只能啓動一兩組實驗;現在藉助Claude和Modal,研究員可以同時啓動約50組短實驗,篩選出有效方案再放大規模。研究人員自建Modal工作站,後台運行任務的同時讓agent處理其他工作,實驗吞吐量已接近前沿實驗室。對於需要多GPU連續運行數週的4K圖像生成基礎模型訓練,Botika在Modal的多節點訓練還處於實驗階段時便已採用,並從第一天就獲得跨GPU通信和RDMA網絡支持。最近,團隊僅用Modal原生原語不到一天就搭好強化學習基礎設施:獎勵服務器以Modal函數形式生成,訓練任務中途可以再派生新任務,完成迭代獎勵建模和rollout。

在生產推理端,Botika同時運行約15個模型,涵蓋L4、L40S、A100、H100等GPU,Modal負責排隊、自動擴縮容和冷啓動處理,無需在每個服務前再接Redis隊列。AI流量的伸縮模式與傳統應用不同,因此Modal按需彈性擴縮的能力尤為關鍵。Dagan説,“即使流量在幾秒內翻倍甚至增至三倍,也不會有人注意到。從技術角度看,公司裏沒人需要擔心,因為我們知道Modal會自己搞定。”傳統雲正變得多餘:“所有計算相關的業務——對我們來説大約佔99%——都運行在Modal上。”更重要的是,Botika的用法並非依賴某個專有黑盒,而是使用標準函數編寫應用,改造很少;團隊裏每位新入職工程師最後都會得到同樣結論:再也回不去Kubernetes那套方式了。