В мире искусственного интеллекта сейчас на слуху мета-обучение — это когда мы тренируем не одну нейросеть, а сразу две. Одна из них обычная, а вторая (мета-модель) учится управлять процессом обучения первой. Вся суть в том, что мета-модель в процессе подбирает параметры, алгоритмы и правила, которые помогают базовой модели учиться эффективнее. Такая схема делает весь процесс гибче — система постоянно совершенствует понимание того, как ей учиться. В исследовании из Nature учёные взяли эту схему и применили её для обучения с подкреплением (RL). Здесь всё идёт двумя слоями: Чтобы мета-модель стала умнее, запускают сразу десятки агентов с разными наборами правил и в разных условиях. Их опыт — это пища для обучения мета-модели. Чем больше ситуаций она увидит, тем лучше оптимизирует обновление поведения агентов. В итоге учёные вывели новый алгоритм, который на практике оказался круче лучших ручных решений. В бенчмарке Atari агент, натренированный такой схемой, установил рекорд. Понятно, что для этого нужна огромная вычислительная мощность, и пока непонятно, получится ли так же в других областях. Но идея реально необычная — один ИИ теперь может учить другой ИИ настолько, что уже перестаёт быть нужен человек!