Colibrì概念验证:用25GB内存运行1.5TB的AI模型
意大利工程师Vincenzo(又名JustVugg)创建了Colibrì,这是一个概念验证项目,能够在仅25GB RAM和1GB/s NVMe的CPU上运行7440亿参数的GLM-5.2模型(1.5TB)。尽管速度极慢(每0.05-0.1秒一个token),但利用混合专家(MoE)架构按token加载专家,实现了前沿水平的回答质量。项目开源,旨在探索在消费级硬件上运行大型模型的可行性。
随着AI订阅成本上升和数据隐私问题日益突出,在家庭实验室中运行大型语言模型(LLM)和代理逐渐流行。然而,Nvidia NVL72机架对于大多数人来说遥不可及,爱好者们只能选择能在有限内存中运行的模型。意大利工程师Vincenzo(又名JustVugg)似乎想要两全其美,因此他创建了Colibrì,在一个适中的CPU、仅25GB RAM和1GB/s的虚拟NVMe驱动器上运行了7440亿参数、1.5TB大小的GLM-5.2模型。Colibrì的速度在Vincenzo的设置下平均仅0.05到0.1 token/秒,这意味着一个问题可能需要数小时才能回答,远不及实时所需的20-30 token/秒。尽管如此,GLM-5.2是一个混合专家(MoE)模型,具有前沿水平的能力,与Anthropic、OpenAI等公司的顶级产品不相上下。回答质量优秀,Vincenzo的有限测试结果令人印象深刻。Colibrì的工作原理简单但实现困难:将模型分片加载到RAM中。MoE模型如GLM-5.2包含数百个专家子模型,它们按token而不是按查询选择。对于每个token,模型激活最适合的专家。通常模型的大部分或全部会加载到互连的数据中心GPU上,而Colibrì利用MoE架构,反复加载/卸载每个token所需的专家,使廉价机器也能使用大型模型,尽管性能代价高昂。为速度和简单起见,Colibrì的专家选择代码是单一的C文件,依赖很少。GLM-5.2模型还经过量化压缩以减少空间。这种加载/卸载方式对存储I/O和内存带宽造成巨大压力。NVMe存储速度是首要瓶颈,但瓶颈因配置而异。Colibrì目前是概念验证,尚不支持GPU,即使支持,数据在GPU间传输也会是主要限制。该项目刚刚发布,已颇受欢迎。Vincenzo正在收集基准数据并运行修复程序,欢迎访问仓库贡献。未来或许能在高端消费硬件上以可接受的速度运行真正聪明的模型。