Исследовательница Технического университета Эйндховена Юди Чжан предложила методы, которые помогают агентам понять, какие решения привели к успеху или ошибке в длинной задаче. Разработка рассчитана на одиночные и коллективные ИИ-системы. Исследовательница Технического университета Эйндховена Юди Чжан разработала новые методы обучения ИИ-агентов в ситуациях, когда результат появляется только после длинной последовательности действий. Такая проблема называется распределением ответственности за результат. Если агент получил награду или потерпел неудачу в самом конце задания, ему сложно понять, какие именно решения по пути оказались полезными. Чжан предложила перераспределять итоговый результат между отдельными шагами. Система анализирует, какие действия и элементы наблюдаемой обстановки повлияли на успех или провал. В задачах с изображениями метод помогает отделять важные признаки от лишней информации. Агент получает более понятную обратную связь и может быстрее сосредоточиться на том, что действительно влияет на результат. Исследовательница также изучила командную работу нескольких агентов. Когда группа получает одну общую награду, обычная система не показывает вклад каждого участника. Новый подход распределяет результат между отдельными агентами и их решениями. Метод применим и к агентам на базе языковых моделей. Они могут извлекать из прошлого опыта понятные правила и использовать их при выполнении следующих задач без детальной ручной разметки каждого промежуточного шага.