AI News HubLIVE
站內改寫1 分鐘閱讀

Colibrì概念驗證:用25GB記憶體執行1.5TB的AI模型

義大利工程師Vincenzo(又名JustVugg)建立了Colibrì,這是一個概念驗證專案,能夠在僅25GB RAM和1GB/s NVMe的CPU上執行7440億引數的GLM-5.2模型(1.5TB)。儘管速度極慢(每0.05-0.1秒一個token),但利用混合專家(MoE)架構按token載入專家,實現了前沿水平的回答質量。專案開源,旨在探索在消費級硬體上執行大型模型的可行性。

來源Hacker News AI作者: smoyer

隨著AI訂閱成本上升和資料隱私問題日益突出,在家庭實驗室中執行大型語言模型(LLM)和代理逐漸流行。然而,Nvidia NVL72機架對於大多數人來說遙不可及,愛好者們只能選擇能在有限記憶體中執行的模型。義大利工程師Vincenzo(又名JustVugg)似乎想要兩全其美,因此他建立了Colibrì,在一個適中的CPU、僅25GB RAM和1GB/s的虛擬NVMe驅動器上執行了7440億引數、1.5TB大小的GLM-5.2模型。Colibrì的速度在Vincenzo的設定下平均僅0.05到0.1 token/秒,這意味著一個問題可能需要數小時才能回答,遠不及即時所需的20-30 token/秒。儘管如此,GLM-5.2是一個混合專家(MoE)模型,具有前沿水平的能力,與Anthropic、OpenAI等公司的頂級產品不相上下。回答質量優秀,Vincenzo的有限測試結果令人印象深刻。Colibrì的工作原理簡單但實現困難:將模型分片載入到RAM中。MoE模型如GLM-5.2包含數百個專家子模型,它們按token而不是按查詢選擇。對於每個token,模型啟用最適合的專家。通常模型的大部分或全部會載入到互連的資料中心GPU上,而Colibrì利用MoE架構,反覆載入/解除安裝每個token所需的專家,使廉價機器也能使用大型模型,儘管效能代價高昂。為速度和簡單起見,Colibrì的專家選擇程式碼是單一的C檔案,依賴很少。GLM-5.2模型還經過量化壓縮以減少空間。這種載入/解除安裝方式對儲存I/O和記憶體頻寬造成巨大壓力。NVMe儲存速度是首要瓶頸,但瓶頸因配置而異。Colibrì目前是概念驗證,尚不支援GPU,即使支援,資料在GPU間傳輸也會是主要限制。該專案剛剛釋出,已頗受歡迎。Vincenzo正在收集基準資料並執行修復程式,歡迎訪問倉庫貢獻。未來或許能在高階消費硬體上以可接受的速度執行真正聰明的模型。