Современные нейронные сети становятся всё крупнее, и вместе с их размером растут требования к памяти, вычислительным ресурсам и энергопотреблению. На фоне этой тенденции квантизация нейронных сетей превратилась в один из наиболее востребованных инструментов оптимизации, позволяющий запускать тяжёлые модели на устройствах с ограниченными возможностями — от смартфонов до встраиваемых систем и одноплатных компьютеров. Суть подхода заключается в снижении точности представления весов и активаций модели. Если изначально параметры хранятся в формате с плавающей точкой на 32 битах, то после квантизации они переводятся в формат с меньшей разрядностью — чаще всего 8 бит, а в ряде случаев 4 бита или даже ниже. Подобное преобразование уменьшает объём занимаемой памяти в несколько раз и ускоряет инференс за счёт более эффективных целочисленных операций, поддерживаемых современными процессорами и специализированными ускорителями. В практике сложились два основных направления. Первое — посттренировочная квантизация, при которой уже обученная модель преобразуется без дополнительного обучения. Этот вариант прост в применении и часто используется в продакшене, однако при агрессивном снижении разрядности может приводить к заметной потере качества. Второе направление — квантизация с учётом обучения, когда модель тренируется или дообучается с имитацией пониженной точности. Такой подход требует больше ресурсов на этапе подготовки, но позволяет сохранить качество, близкое к исходному, даже при переходе к низкобитным форматам. Особый интерес квантизация представляет для больших языковых моделей. Методы вроде GPTQ, AWQ и SmoothQuant дали возможность запускать модели с десятками миллиардов параметров на пользовательских видеокартах, что ещё несколько лет назад казалось технически невыполнимой задачей. Параллельно развиваются форматы хранения, ориентированные на локальный инференс, среди которых заметное место занимает семейство GGUF, активно используемое в открытых проектах. Не обходится и без ограничений. Чувствительность к квантизации заметно различается у разных архитектур и даже у разных слоёв одной модели. Внимание и нормализация, как правило, переносят снижение точности хуже свёрточных и линейных слоёв, поэтому на практике применяются смешанные схемы, где критичные участки сохраняют более высокую разрядность. Дополнительные сложности возникают при работе с длинным контекстом и кэшем ключей-значений, которые также становятся объектом отдельных методов сжатия.