Группа исследователей из МФТИ придумала два новых способа, которые помогают точно понять, сколько данных нужно для качественного обучения искусственного интеллекта. Статью опубликовали в журнале Computational Mathematics and Mathematical Physics. В машинном обучении всегда есть проблемы. Если данных слишком мало — ИИ будет ошибаться, а если слишком много — зря тратить ресурсы на сбор и обработку. Что придумали в МФТИ Учёные предложили два критерия, чтобы понять, достаточно ли данных. Оба основаны на анализе функции правдоподобия с помощью бутстрэпа — это такой способ, когда много раз случайно собирают разные “мини-наборы” из всех доступных данных. Первый критерий — D-достаточность. Смотрят, похожи ли результаты разных моделей, обученных на одинаковых по размеру поднаборах. Если разброс между ними невелик, значит выборка считается достаточной. Второй критерий — M-достаточность. Здесь оценивают. Если добавить к данным ещё одну строчку, станет ли модель заметно лучше? Если показатель почти не меняется, данных уже хватает. — Определить идеальный объём данных — всегда баланс между бюджетом и качеством, — объясняет один из авторов, Андрей Грабовой. — Мы хотели найти простой, но научно обоснованный подход. Смотрим на то, насколько правдоподобие модели стабилизируется, когда увеличиваем объём выборки. Учёные проверили свои методы на разных наборах данных. Как синтетических, так и реальных. Эксперименты и теория показали, что подход работает, особенно для линейной регрессии (где доказана корректность M-достаточности). Зачем это нужно Метод МФТИ пригодится везде, где важно заранее узнать, сколько данных потребуется. Медицина (например, для планирования клинических испытаний), финансы, маркетинг, социология, биоинформатика. Кстати, по словам Никиты Киселева, одного из авторов и студента МФТИ, команда уже разрабатывает новые подходы, которые подойдут даже для современных сложных нейросетей и генеративных моделей. Ожидается, что скоро о них можно будет узнать подробнее в новых публикациях.