Подход mixture of experts давно перестал быть нишевой идеей и превратился в один из ключевых инженерных приёмов при построении крупных языковых моделей. Суть концепции в том, что вместо единой плотной сети, где все параметры активируются при обработке каждого входного токена, модель разбивается на множество специализированных подсетей — экспертов. Для каждого фрагмента данных активируется лишь небольшая их часть, а остальные остаются незадействованными. Так достигается рост общего числа параметров без пропорционального увеличения затрат на вычисления. Центральным элементом такой архитектуры выступает маршрутизатор, или гейтинговая сеть. Именно он решает, каким экспертам передать конкретный токен. Обычно выбирается два или четыре эксперта из десятков или даже сотен доступных. Благодаря этому модель с триллионом параметров может на практике использовать лишь несколько десятков миллиардов при каждом проходе. Подобная разреженная активация и составляет главное преимущество подхода перед традиционными плотными моделями сопоставимого масштаба. История метода уходит в начало девяностых годов, однако настоящий интерес к нему пришёл вместе с эпохой трансформеров. Работы исследователей Google, в частности архитектуры Switch Transformer и GLaM, показали, что разреженные модели способны конкурировать с плотными при значительно меньших вычислительных бюджетах. Позднее принцип лёг в основу ряда известных открытых и закрытых систем, включая модели семейства Mixtral, где идея смешивания экспертов получила широкое практическое подтверждение. Несмотря на привлекательность, метод сопряжён с заметными трудностями. Одна из них — балансировка нагрузки между экспертами. Без специальных мер маршрутизатор склонен отправлять большую часть токенов к ограниченному кругу подсетей, оставляя прочие почти без работы. Для борьбы с этим вводят вспомогательные функции потерь, поощряющие равномерное распределение. Другая сложность связана с инфраструктурой: эксперты часто размещаются на разных вычислительных устройствах, что порождает интенсивный обмен данными между ними и требует продуманной организации параллелизма. Отдельного внимания заслуживает вопрос обучения и дообучения подобных систем. Разреженные модели нередко оказываются капризнее плотных, чувствительны к выбору гиперпараметров и могут демонстрировать нестабильность на ранних этапах. Тем не менее накопленный опыт постепенно сглаживает эти острые углы, а сообщество вырабатывает устойчивые рецепты настройки.