Extreme Compression of Large Language Models via Additive Quantization
Vage Egiazarian, Andrei Panferov, Denis Kuznedelev, Elias Frantar, Artem Babenko, Dan Alistarh
January, 2024
Abstract
AQLM compresses language model weights through additive quantization, targeting accurate inference at very low bit widths.

PhD Candidate in Computer Science
I work on efficient large language models, with a focus on low-precision training, quantization, and scaling laws.