Технология AWQ (Activation-aware Weight Quantization) занимает заметное место среди современных подходов к сжатию больших языковых моделей. Метод был предложен исследователями из MIT и быстро привлёк внимание сообщества, поскольку позволил запускать многомиллиардные модели на потребительском оборудовании без ощутимой потери качества. По сути, AWQ относится к семейству методов посттренировочной квантизации, которые работают уже с обученной моделью и не требуют повторного дорогостоящего обучения. Главная идея AWQ заключается в том, что не все веса модели одинаково важны. Анализ активаций показывает: лишь небольшая доля весов оказывает существенное влияние на итоговые предсказания. Авторы метода предложили выявлять такие значимые веса по статистике активаций на калибровочном наборе данных и защищать их от агрессивного сжатия. Менее важные параметры можно квантовать до 4 бит без заметных последствий, а критичные масштабируются специальным коэффициентом, что сохраняет точность вычислений. Такой избирательный подход отличает AWQ от более ранних методов вроде GPTQ, где все веса обрабатываются по схожей схеме. С практической точки зрения AWQ даёт несколько ощутимых преимуществ. Размер модели сокращается примерно в четыре раза по сравнению с представлением в формате FP16, что особенно важно при работе на видеокартах с ограниченной памятью. Скорость инференса заметно возрастает благодаря оптимизированным ядрам, написанным под современные графические процессоры. Кроме того, метод не требует обратного распространения ошибки во время квантизации, что делает процесс быстрым: сжатие модели на десятки миллиардов параметров занимает считанные часы, а иногда и меньше. Экосистема вокруг AWQ развивается активно. Существует библиотека AutoAWQ, которая упрощает применение метода к моделям из репозитория Hugging Face. Поддержка реализована в популярных инференс-движках, включая vLLM и TensorRT-LLM, а также в проектах для локального запуска моделей. Благодаря этому энтузиасты получили возможность работать с моделями уровня Llama, Mistral, Qwen и многими другими прямо на домашних компьютерах с одной потребительской видеокартой. Стоит упомянуть и ограничения подхода. AWQ ориентирован прежде всего на 4-битное представление, и при попытках перейти к более агрессивному сжатию, например к 3 или 2 битам, потери качества становятся заметнее. Калибровочный набор данных также влияет на итоговый результат: неудачно подобранные примеры могут привести к деградации модели на специфичных задачах. Помимо этого, не все архитектуры одинаково хорошо поддаются квантизации, и для свежих моделей иногда приходится ждать обновлений библиотек.