Quantization в нейросетях обычно обсуждают как способ уменьшить модель и ускорить её работу, но в реальных системах это прежде всего инженерный компромисс между точностью, стоимостью и доступностью вычислений. Метод связан с переводом чисел, которыми представлены веса и активации модели, из более точных форматов в менее точные. Вместо 32-битных чисел с плавающей точкой могут использоваться 16, 8, 4 бита или даже более компактные представления. Для современных моделей машинного обучения это особенно важно из-за роста их размера. Большие языковые модели, генераторы изображений и рекомендательные системы требуют значительных объёмов памяти и высокой пропускной способности оборудования. Quantization позволяет хранить параметры компактнее, снижать нагрузку на память и выполнять вычисления быстрее, если аппаратная платформа поддерживает такие форматы. В результате модель может работать не только в дата-центре, но и на локальных устройствах, включая ноутбуки, смартфоны и встраиваемые системы. Существует несколько подходов к quantization. Посттренировочная квантизация применяется уже после обучения и не требует полного пересчёта модели. Это удобно для внедрения, но качество может просесть, особенно у чувствительных архитектур. Quantization-aware training учитывает будущую низкую точность ещё во время обучения, поэтому часто даёт более стабильный результат, но требует больше ресурсов и времени. В больших языковых моделях также распространены методы, которые квантизируют веса выборочно, сохраняя часть параметров в более точном формате. Главный риск quantization — деградация качества. Нейросеть может хуже различать близкие значения, чаще ошибаться в редких случаях или терять устойчивость на сложных запросах. Для языковых моделей это проявляется в менее точных ответах, нарушении логики рассуждения или снижении качества генерации кода. Поэтому квантизацию оценивают не только по синтетическим бенчмаркам, но и по задачам, где модель будет использоваться в продукте. Практическая ценность quantization особенно заметна в инференсе. Компании могут обслуживать больше запросов на том же оборудовании, уменьшать задержку ответа и снижать расходы на GPU. Для открытых моделей это ещё и способ сделать запуск доступнее для исследователей и разработчиков без дорогой инфраструктуры. Именно поэтому многие популярные LLM распространяются в нескольких вариантах точности, чтобы пользователь мог выбрать баланс между скоростью, памятью и качеством.