Extreme Compression of Large Language Models via Additive Quantization

Abstract

AQLM compresses language model weights through additive quantization, targeting accurate inference at very low bit widths.

Publication
ICML 2024
Andrei Panferov
Andrei Panferov
PhD Candidate in Computer Science

I work on efficient large language models, with a focus on low-precision training, quantization, and scaling laws.