Архитектура Mamba 2 продолжает направление исследований, связанное с моделями состояний (SSM), и предлагает альтернативный взгляд на построение языковых моделей по сравнению с классическими трансформерами. Если первая версия Mamba привлекла внимание сообщества за счёт линейной сложности по длине последовательности, то вторая итерация развивает эту идею, делая упор на эффективность вычислений, масштабируемость и более глубокую теоретическую связь с механизмом внимания. Главная особенность Mamba 2 заключается в концепции структурированной двойственности пространств состояний, которую авторы обозначили как SSD (State Space Duality). Эта идея показывает, что определённый класс моделей состояний и линейные варианты внимания фактически описывают одно и то же семейство операций, только с разных сторон. Благодаря такому взгляду удалось переписать вычислительное ядро так, чтобы оно эффективно использовало матричные умножения и хорошо ложилось на современные ускорители. На практике это даёт заметный прирост скорости обучения по сравнению с первой Mamba при сопоставимом или лучшем качестве. С точки зрения архитектуры Mamba 2 упрощает блок селективного SSM, делая параметризацию более регулярной. Размер скрытого состояния увеличен, а сами проекции организованы так, чтобы можно было запускать вычисления крупными блоками. Это сближает модель с привычной логикой работы тензорных ядер GPU и снижает накладные расходы, которые в первой версии частично нивелировали теоретическое преимущество линейной сложности. Авторы также экспериментируют с гибридными конфигурациями, где блоки SSD чередуются со слоями полноценного внимания, что позволяет сочетать сильные стороны обеих парадигм. В экспериментах Mamba 2 демонстрирует конкурентные результаты на стандартных языковых бенчмарках, задачах ассоциативного поиска и работе с длинным контекстом. Особенно заметно преимущество на последовательностях большой длины, где квадратичная сложность трансформеров становится практическим ограничением. При этом модель сохраняет постоянный объём памяти при инференсе, что делает её привлекательной для сценариев генерации длинных текстов и потоковой обработки данных. Интерес сообщества к Mamba 2 связан не только с метриками, но и с тем, что она предлагает более ясную теоретическую рамку для понимания, почему модели состояний работают и где проходит граница между ними и вниманием. Появление SSD-формулировки облегчает дальнейшие исследования: становится проще переносить наработки из области эффективного внимания в мир SSM и наоборот.