State space model представляет собой класс математических моделей, описывающих поведение динамических систем через скрытые состояния, которые изменяются во времени. Изначально этот подход применялся в теории управления, обработке сигналов и эконометрике, где требовалось отслеживать эволюцию системы на основе входных данных и предыдущих состояний. В последние годы концепция получила второе дыхание в области машинного обучения, где её адаптировали для обработки последовательностей произвольной длины. Суть модели заключается в том, что она поддерживает внутреннее представление состояния, через которое пропускается входной сигнал. На каждом шаге система обновляет это состояние с помощью набора линейных уравнений, а затем формирует выходные значения. Такая формулировка позволяет описывать связи между удалёнными элементами последовательности без необходимости хранить всю историю целиком, что выгодно отличает подход от ряда классических методов. Особый интерес к этим моделям возник на фоне ограничений трансформеров, чья вычислительная сложность растёт квадратично относительно длины входа. State space model предлагают альтернативу с линейной сложностью, что делает их привлекательными для задач, где требуется обрабатывать тысячи или десятки тысяч токенов. Среди заметных представителей этого семейства выделяют архитектуру S4 и её последующие модификации, которые продемонстрировали конкурентоспособные результаты на ряде эталонных наборов данных. Развитием идеи стала модель Mamba, в которой параметры состояния зависят от входных данных. Этот механизм избирательности позволяет системе динамически решать, какую информацию сохранять, а какую игнорировать, что приближает её гибкость к механизму внимания. При этом сохраняется высокая скорость работы, поскольку вычисления остаются эффективными как при обучении, так и при формировании прогнозов в реальном времени. Сфера применения подобных моделей довольно широка. Они показывают хорошие результаты в обработке аудио, анализе временных рядов, геномных данных и текстовых последовательностях. Способность учитывать длинные зависимости делает их полезными там, где контекст растягивается далеко за пределы привычных окон обработки. Исследователи также рассматривают гибридные конструкции, объединяющие свойства состояния с элементами других архитектур. Несмотря на достоинства, направление пока остаётся предметом активных исследований. Открытыми вопросами остаются устойчивость обучения, поведение на разнообразных типах данных и сравнение с устоявшимися решениями в промышленных условиях. Тем не менее накопленный объём экспериментов показывает, что подход имеет под собой прочный теоретический фундамент и заслуживает внимания.