Colibrì概念驗證:用25GB內存運行1.5TB的AI模型
意大利工程師Vincenzo(又名JustVugg)創建了Colibrì,這是一個概念驗證項目,能夠在僅25GB RAM和1GB/s NVMe的CPU上運行7440億參數的GLM-5.2模型(1.5TB)。儘管速度極慢(每0.05-0.1秒一個token),但利用混合專家(MoE)架構按token加載專家,實現了前沿水平的回答質量。項目開源,旨在探索在消費級硬件上運行大型模型的可行性。
隨着AI訂閲成本上升和數據隱私問題日益突出,在家庭實驗室中運行大型語言模型(LLM)和代理逐漸流行。然而,Nvidia NVL72機架對於大多數人來説遙不可及,愛好者們只能選擇能在有限內存中運行的模型。意大利工程師Vincenzo(又名JustVugg)似乎想要兩全其美,因此他創建了Colibrì,在一個適中的CPU、僅25GB RAM和1GB/s的虛擬NVMe驅動器上運行了7440億參數、1.5TB大小的GLM-5.2模型。Colibrì的速度在Vincenzo的設置下平均僅0.05到0.1 token/秒,這意味着一個問題可能需要數小時才能回答,遠不及實時所需的20-30 token/秒。儘管如此,GLM-5.2是一個混合專家(MoE)模型,具有前沿水平的能力,與Anthropic、OpenAI等公司的頂級產品不相上下。回答質量優秀,Vincenzo的有限測試結果令人印象深刻。Colibrì的工作原理簡單但實現困難:將模型分片加載到RAM中。MoE模型如GLM-5.2包含數百個專家子模型,它們按token而不是按查詢選擇。對於每個token,模型激活最適合的專家。通常模型的大部分或全部會加載到互連的數據中心GPU上,而Colibrì利用MoE架構,反覆加載/卸載每個token所需的專家,使廉價機器也能使用大型模型,儘管性能代價高昂。為速度和簡單起見,Colibrì的專家選擇代碼是單一的C文件,依賴很少。GLM-5.2模型還經過量化壓縮以減少空間。這種加載/卸載方式對存儲I/O和內存帶寬造成巨大壓力。NVMe存儲速度是首要瓶頸,但瓶頸因配置而異。Colibrì目前是概念驗證,尚不支持GPU,即使支持,數據在GPU間傳輸也會是主要限制。該項目剛剛發佈,已頗受歡迎。Vincenzo正在收集基準數據並運行修復程序,歡迎訪問倉庫貢獻。未來或許能在高端消費硬件上以可接受的速度運行真正聰明的模型。