Actor critic — это семейство методов обучения с подкреплением, где агент учится принимать решения через сочетание двух компонентов: actor и critic. Такой подход особенно важен в задачах, где нейросеть должна выбирать действия в среде, получать обратную связь и постепенно улучшать стратегию поведения. Его используют в робототехнике, игровых агентах, управлении ресурсами, симуляциях и системах оптимизации. Компонент actor отвечает за политику, то есть за выбор действия. Он получает состояние среды и определяет, что агент должен сделать дальше. В нейросетевых реализациях actor обычно представлен моделью, которая выдает распределение вероятностей по действиям или конкретное непрерывное действие. Это делает метод удобным не только для дискретных задач, но и для сценариев с непрерывным управлением, например движением манипулятора или балансировкой автономной системы. Critic оценивает качество действий actor. Он не выбирает действие напрямую, а прогнозирует ценность состояния или пары состояние-действие. Такая оценка помогает понять, насколько выбранное поведение приближает агента к долгосрочной награде. Благодаря critic обучение становится более устойчивым по сравнению с чистыми policy gradient методами, где обновления могут сильно колебаться из-за высокой дисперсии оценок. Главная идея actor critic заключается в разделении ролей. Actor исследует пространство действий и обновляет политику, а critic предоставляет сигнал, который делает эти обновления более информативными. В современных алгоритмах это выражается через advantage-функцию, оценку преимущества выбранного действия относительно ожидаемого результата. Такой механизм позволяет усиливать полезные решения и ослаблять менее удачные без необходимости полностью перебирать все варианты поведения. На базе actor critic построено несколько известных алгоритмов. A2C и A3C применяются для параллельного обучения агентов и стабилизации обновлений. DDPG ориентирован на непрерывные действия и использует детерминированную политику. PPO стал популярным благодаря ограничению слишком резких изменений политики, что повышает надежность обучения. SAC добавляет энтропийную регуляризацию, поощряя исследование среды и снижая риск преждевременного закрепления неудачной стратегии. Несмотря на преимущества, actor critic остается чувствительным к настройкам. Качество обучения зависит от архитектуры нейросетей, выбора функции награды, нормализации данных, скорости обучения и баланса между исследованием и эксплуатацией. Ошибки critic могут направлять actor в неверную сторону, а нестабильная политика способна ухудшить качество оценок. Поэтому практические реализации часто включают буферы опыта, целевые сети, обрезку градиентов и другие методы стабилизации.