AI News HubLIVE
站内改写1 分钟阅读

TurboQuant:压缩与性能是否名副其实?

TurboQuant是Google最新推出的算法套件,通过先进的量化压缩技术,在不牺牲准确率的情况下大幅提升大型语言模型和向量搜索引擎的效率。本文介绍其工作原理,并提供Python代码示例评估其性能。

来源KDnuggets作者: Iván Palomares Carrascosa

TurboQuant是Google最近发布的一套创新算法库,旨在通过高级量化和压缩技术,显著提升大型语言模型(LLM)和向量搜索引擎的效率——这些是检索增强生成(RAG)系统中不可或缺的组成部分。该技术已被证明能够将缓存内存消耗降至仅3比特,同时无需重新训练模型或牺牲准确性。

TurboQuant的工作原理分为两个互补阶段:首先,PolarQuant通过将向量坐标映射到极坐标系来压缩高质量数据,简化数据几何结构并消除存储额外量化常数的需要——这是内存开销的主要来源。然后,QJL(量化Johnson-Lindenstrauss)作为第二阶段,通过微小的单比特压缩消除前一阶段可能引入的偏差。

根据实验结果,TurboQuant在H100 GPU加速器上实现了相比32位未量化键的8倍性能提升。尽管在短序列场景下速度提升不明显,但随着上下文长度和硬件规模的扩大,其优势愈发显著。例如,在企业级H100集群中处理超过32K令牌的长文RAG提示时,吞吐量可提升高达8倍。

本文还提供了一个Python示例,使用TinyLlama模型对比有无TurboQuant的性能和内存占用。在测试中,3比特量化将KV缓存从42.45 MB压缩至7.86 MB,节省了34.59 MB内存,压缩比达5.4倍。但速度提升仅为0.61倍,这是因为测试序列较短。放大输入后,内存节省更为可观,但速度提升仍然有限,强调了大上下文场景下TurboQuant的真正价值。

总之,TurboQuant通过维持高精度的同时实现3比特级别的系统效率,证明了其在大型AI模型中的变革性性能。本文由Iván Palomares Carrascosa撰写,他是AI、机器学习、深度学习及LLM领域的领导者、作家、演讲者和顾问。