智慧體叢集對本地AI大有益處
本文分析了本地AI開發的成本困境,指出單個智慧體執行時效能有限且成本高昂。然而,透過使用智慧體叢集(agent swarms),可以並行處理大量任務,充分利用本地GPU資源,從而大幅降低每Token的成本。文章透過具體資料對比,展示了在本地硬體上執行叢集相比API服務的顯著成本優勢,並預測隨著智慧體模式的流行,本地AI將迎來新的發展機遇。
近年來,本地AI開發面臨一個嚴峻問題:Token經濟模型極為不利。要執行一個效能尚可的編碼智慧體,需要足夠大的視訊記憶體來容納模型和上下文,這導致硬體成本非常高昂。例如,執行Qwen3.6-35B-A3B模型,理想配置是NVIDIA 5090或兩塊3090顯示卡。測試顯示,單流開發時輸入速度僅約2000 Token/秒,輸出速度約150 Token/秒。如果每天以150 Token/秒的速度執行一小時,大約只能處理720萬輸入Token(80%快取)和54萬輸出Token。按OpenRouter上Qwen 3.6的API價格(輸入0.13美元/百萬Token,輸出1.00美元/百萬Token,快取Token按輸入價格的十分之一計費),這樣一小時的費用僅為0.80美元。由此可見,花費5000美元購置的本地計算機,其價效比還不如一臺Chromebook。
然而,智慧體叢集(Agent Swarms)的出現徹底改變了Token經濟模型。上述例子是單併發會話,即傳統的“vibecoding”方式。但如今,新的正規化正在興起:將任務委派並分發給大量智慧體並行處理。大型AI實驗室非常青睞這種方式,因為它能大幅增加Token消耗量。但更重要的是,這使得本地LLM硬體終於有了用武之地。
假設在一小時的會話中,平均有32個後臺智慧體同時執行不同任務,每個智慧體的輸入速度為20000 Token/秒(其中14000 Token來自快取,6000 Token為新讀取),輸出速度為1000 Token/秒——這是在雙3090機器上常見的速度。按OpenRouter上Qwen 3.6的API價格計算,這樣一小時的叢集工程費用約為7.06美元。
下表對比了單智慧體與32個智慧體叢集的Token消耗和成本:
- 一小時內,單智慧體處理720萬輸入Token(80%快取)和54萬輸出Token;叢集處理7200萬輸入Token(70%快取)和360萬輸出Token。
- 按API價格,單智慧體成本0.80美元,叢集成本7.06美元。
- 若使用更昂貴的Sonnet 5模型,單智慧體成本約9.40美元,叢集成本約89美元。
- 而在本地硬體上,單智慧體電力成本僅約0.08美元,叢集約0.11美元。
若按每天8小時、每月工作22天計算,單智慧體使用API的年成本約192美元,叢集約1700美元;使用Sonnet 5則分別高達2260美元和21400美元;而本地硬體的電費僅為19美元和26美元。
隨著智慧體迴圈和智慧體圖模式日益流行,本地AI將從中獲益,而非被削弱。因為本地AI首次擁有了一種高效利用GPU的方法:透過大規模並行任務來飽和GPU計算能力。