Policy gradient — один из ключевых подходов в обучении с подкреплением, где агент учится выбирать действия в среде и получает за них вознаграждение. В отличие от методов, которые сначала оценивают ценность состояний или действий, policy gradient напрямую оптимизирует стратегию поведения. Это делает его особенно важным для задач, где пространство действий большое, непрерывное или плохо подходит для перебора. В основе метода лежит идея параметризованной политики. Обычно ее задает нейросеть, которая по наблюдению среды выдает распределение вероятностей действий или конкретное действие. Затем параметры этой нейросети изменяются так, чтобы увеличить ожидаемую награду. Такой подход хорошо сочетается с современными архитектурами глубокого обучения, поскольку политика может учитывать сложные визуальные, текстовые или сенсорные данные. Policy gradient получил широкое применение в робототехнике, игровых системах, управлении ресурсами, оптимизации диалоговых агентов и обучении больших языковых моделей с обратной связью. В робототехнике он помогает работать с непрерывными действиями, например с углами поворота суставов или силой движения. В игровых задачах метод позволяет обучать агентов стратегиям, которые зависят от длинной последовательности решений. В системах ИИ, связанных с человеческими предпочтениями, policy gradient используется для подстройки поведения модели под заданные критерии качества. Важное преимущество policy gradient состоит в гибкости. Метод не требует заранее строить точную модель среды и может работать с вероятностными стратегиями. Это полезно там, где одно и то же состояние не должно всегда приводить к одному действию. Стохастическая политика помогает агенту исследовать разные варианты поведения и находить решения, которые не очевидны при жестко заданных правилах. У подхода есть и ограничения. Оценка градиента часто получается шумной, поэтому обучение может быть нестабильным и требовать большого количества взаимодействий со средой. Для уменьшения разброса применяются базовые функции, advantage-оценки и комбинированные actor-critic методы. Именно такие гибридные варианты сегодня чаще встречаются в практических системах, чем чистый policy gradient в его простейшей форме. Отдельное значение имеет связь policy gradient с современными методами выравнивания нейросетей. Например, при обучении моделей на основе предпочтений человека политика может рассматриваться как генератор ответов, а награда — как оценка их качества. В этом контексте policy gradient становится инструментом настройки поведения модели, хотя на практике обычно используются модифицированные алгоритмы с ограничениями на слишком резкие изменения политики.