在16GB RAM的消费级电脑上运行GLM-4.5-Air (110B) 模型
Quantprobe 项目通过研究大语言模型在内存层级中的位放置策略,提出了四条经验定律,并开发了一套工具,使得在低端硬件(如2016年的GTX 1060 6GB显卡和16GB DDR4内存)上运行高达110B参数的大型模型成为可能。项目通过预注册预测和实际测量验证了其方法的有效性,例如在16GB RAM下从SATA硬盘流式运行GLM-4.5-Air 110B达到0.19 tok/s,以及通过混合放置实现Qwen3-30B-A3B 19.3 tok/s的速度。
Quantprobe 是一个由 Federico 开发的开源项目,旨在通过优化大型语言模型(LLM)在内存层次中的位放置,使得在低端消费级硬件上也能运行大规模模型。该项目基于详尽的实验,提出了四条可证伪的定律,分别为:旋转的秩条件性、网络的密集性、可测量的脆弱性以及分层解码定律。这些定律通过预注册预测和实际测量得到严格验证。
实验在一台2016年的旧式台式机上进行,配置为GTX 1060 6GB显卡、16GB DDR4内存和SATA SSD。令人惊讶的是,仅通过优化位放置(而非增加硬件投入),就能实现显著性能提升。例如,在字节相同的GGUF文件中,仅因放置不同导致困惑度相差2.25分。内存超频(从2133 MT/s到3000 MT/s)带来了52%的密集解码速度提升,预注册预测值为41%以上,测量值52%完全符合预期。
Quantprobe 工具支持探针量化、深度感知量化、运行和基准测试等功能。用户可以在30分钟内对任意GGUF模型进行探针量化,生成深度感知的量化配方。交互式计算器还能预测不同模型在不同硬件上的运行速度和内存占用,帮助用户规划最经济的升级方案。项目还提供了详细的文档和示例,强调可重复性,所有测量结果均附有日志和硬体验证。
这项工作的意义在于,它挑战了“运行大模型必须依赖昂贵硬件”的传统观念。通过智能地管理位放置,即便是六年前的硬件也能运行110B参数的模型(尽管速度较慢),而混合放置策略则能让30B模型达到接近实用的速度。对于想在不升级硬件的情况下尝试更大模型的用户,quantprobe 提供了一条切实可行的路径,尤其适合资源受限的环境。