SingleQuant: Efficient Quantization of Large Language Models in a Single Pass
文章总结与翻译一、主要内容本文聚焦大语言模型(LLMs)量化部署中的核心问题,提出了一种单遍量化框架SingleQuant,旨在解决现有量化方法中梯度优化与量化截断不兼容导致的收敛异常、量化耗时久及性能退化等问题。核心问题:现有基于梯度的量化方法(如SpinQuant)依赖Stiefel流形上的Cayley SGD优化,结合直通估计器(STE)会引入梯度噪声和非光滑性,违反收敛的Lipschitz条件,导致优化振荡、无法收敛,且量化耗时显著;同时,LLM激活值中的大量异常值(MO)和普通异常值(NO)会降低量化空间利用率,进一步影响量化精度。技术方案:设计两种基于Givens旋转的变换组件:对齐旋转变换(ART)针对稀疏但极值显著的MO,通过闭式最优旋转平滑极端值,提升量化空间覆盖率;均匀性旋转变换(URT)针对分布广泛的NO,通过几何映射将其重塑为均匀分布,打破量化瓶颈。采用Kronecker矩阵分解构建轻量旋转矩阵,将计算复杂度从O(n2)O(n^2)