Аббревиатура MoE расшифровывается как Mixture of Experts, что в переводе с английского означает «смесь экспертов». Это архитектурный подход в области машинного обучения и нейронных сетей, при котором единая большая модель состоит из множества специализированных подсетей, называемых экспертами. В нужный момент задействуется только часть из них, а не вся структура целиком. Такой принцип позволяет значительно увеличить общее количество параметров модели без пропорционального роста вычислительных затрат. Идея архитектуры была предложена ещё в начале 1990-х годов исследователями Робертом Якобсом и Джеффри Хинтоном, однако массовое признание она получила лишь в последние годы, когда крупные языковые модели столкнулись с проблемой эффективного масштабирования. Современные разработчики обратили внимание на MoE, поскольку классические плотные модели требовали колоссальных ресурсов для обучения и инференса. Подход со смесью экспертов предложил элегантное решение этой проблемы. Принцип работы такой архитектуры построен вокруг специального компонента, называемого маршрутизатором или роутером. Именно он принимает решение о том, какие именно эксперты должны обработать поступающий запрос или конкретный токен. Обычно активируется лишь два или четыре эксперта из десятков, а иногда и сотен доступных. В результате модель с сотнями миллиардов параметров может работать так же быстро, как значительно меньшая по размеру плотная сеть, при этом сохраняя высокое качество ответов. Среди известных реализаций можно выделить Mixtral от французской компании Mistral AI, который продемонстрировал конкурентоспособные результаты при умеренных требованиях к оборудованию. Также архитектура активно используется в продуктах китайских разработчиков, включая модели семейства DeepSeek и Qwen. По слухам, схожий подход применяется и в проприетарных решениях крупнейших западных лабораторий, хотя официальных подтверждений тому немного. Преимущества MoE очевидны: возможность хранить огромное количество знаний, экономия вычислительных ресурсов при работе модели, а также гибкость в специализации отдельных экспертов на разных типах задач. Один эксперт может лучше справляться с математикой, другой с программированием, третий с обработкой естественного языка на редких языках. Однако у подхода есть и недостатки. Тренировка таких моделей сложнее, чем у обычных, требуется тщательная балансировка нагрузки между экспертами, иначе часть из них останется недообученной. Кроме того, для запуска MoE всё равно нужен значительный объём оперативной памяти, поскольку все веса должны находиться в доступности.