专家感知量化:接近Q4质量,达到近乎Q2的大小?
本文探讨了一种称为“专家感知量化”(Expert-aware Quantisation)的新型模型压缩技术。该方法通过识别和保留模型中关键专家(expert)的精度,同时大幅压缩非关键部分,旨在实现接近4比特量化(Q4)的模型质量,而存储空间却接近2比特量化(Q2)的水平。文章分析了这种技术在平衡模型性能与存储效率方面的潜力与挑战。
背景速读
- 这篇文章讨论的是大语言模型(LLM)的一种新型量化技术。量化(Quantisation)是用更低精度的数值(比如4位整数,即Q4)来代替模型原本的高精度参数(通常为16位浮点数),从而大幅减小模型体积、降低运行显存和计算成本。代价通常是性能损失(准确度下降)。
- 当前主流量化方法(如GPTQ、AWQ)对每个权重矩阵做"一刀切"式的处理,而本文提出的"专家感知量化"(Expert-aware quantisation)针对的是MoE(混合专家)架构模型——即把模型拆成多个"专家"子网络,每次推理只激活其中一部分。核心思路是:不同专家对量化精度的敏感度不同,敏感度高的专家保留更高精度(Q4或更高),敏感度低的专家可以压到很低的精度(Q2甚至更低),从而在整体压缩率上接近Q2,但性能上接近Q4。
- MoE模型目前是LLM领域的主流方向之一(如Mixtral 8×7B、DeepSeek系列),因为它在保持推理效率的同时可以扩充分数。量化对MoE模型尤为重要,因为它们的参数量虽大但每个token只激活部分参数,显存占用依然是瓶颈。
- 作者Martin Alderson是AI基础设施方向的独立研究者/工程师,之前发表过关于MoE模型量化、稀疏性等主题的技术博客。这篇文章不是学术论文,而是实验性技术探索,包含具体的算法设计和初步实验结果。