Как сегодня обучают AI-агентов?
Agent Reinforcement Learning: как сегодня обучают AI-агентов
Первые LLM-агенты обучались преимущественно на заранее подготовленных примерах. Исследователи показывали модели, как нужно рассуждать, когда вызывать инструменты и как должна выглядеть правильная последовательность действий. Такие подходы, как ReAct, Tree of Thoughts и Reflexion, значительно расширили возможности языковых моделей, позволив им строить более сложные цепочки рассуждений, анализировать свои ошибки и эффективнее взаимодействовать со внешними инструментами.
Но у всех методов было общее ограничение: агент копировал уже существующие стратегии, но практически не учился искать новые.
Поэтому сегодня интерес исследователей постепенно смещается в сторону Agent Reinforcement Learning (Agent RL) — обучения, где агент сам взаимодействует со средой и постепенно находит наиболее эффективную стратегию решения задачи.
Давайте разберём, чем Agent RL отличается от классического Reinforcement Learning, и какие идеи лежат в основе современных методов.
Почему RLHF недостаточно?
Классический RLHF (Reinforcement Learning from Human Feedback) оптимизирует качество одного ответа модели.
Схематично этот процесс выглядит так:
Запрос -> Ответ -> Награда
Если ответ оказался хорошим, модель получает положительную награду. Если плохим — отрицательную. В случае задач «вопрос-ответ», где работают чат-боты, этого достаточно, но агент редко решает задачу одним сообщением.
Например, coding-агент может:
- открыть репозиторий;
- найти нужный файл;
- изучить несколько функций;
- изменить код;
- запустить тесты;
- исправить возникшую ошибку;
- снова выполнить тесты.
Такая задача уже состоит из десятков последовательных действий. При этом качество всей работы становится известно только после завершения полной цепочки, поэтому оценивать каждое действие отдельно практически невозможно.
От оптимизации токенов к оптимизации поведения
Главное отличие в Agent RL концентрация на обучении предсказании не отдельного правильного ответа, а всей стратегии поведения агента.
Например, вместо оценки такого вида:
Запрос -> Ответ-> Награда
Получается длинная агентная траектория:
Поиск -> Открытие файла -> Редактирование -> Запуск тестов -> Исправление ошибки
-> Награда
В простейшем случае награда начисляется по результату выполнения всей задачи. При этом траектория не обязательно должна быть длинной, если агент не смог продолжить работу уже после первого действия, эпизод может завершиться раньше и получить нулевую или отрицательную награду. В более сложных системах дополнительно используются промежуточные награды за отдельные успешно выполненные этапы.
Фактически агент начинает обучаться уже не генерации текста, а последовательности действий, которая приводит к достижению цели.
Такой переход часто называют переходом от token-level optimization к trajectory-level optimization.
Верифицируемые награды
Одна из причин стремительного развития Agent RL — появление задач, результат которых можно проверить автоматически.
Например, для coding-агентов достаточно выполнить unit-тесты.
Если тесты прошли успешно и с ожидаемым результатом — задача решена.
В случае web-агентов можно проверить:
- оформлен ли заказ;
- найдена ли нужная информация;
- успешно ли заполнена форма.
Такой подход получил название Verifiable Rewards.
В отличие от RLHF, здесь больше не требуется человек, который оценивает качество работы агента.
Награда вычисляется автоматически, что позволяет получать практически неограниченное количество обучающих примеров. Именно поэтому сегодня coding-агенты развиваются особенно быстро.
Credit Assignment как главная проблема Agent RL
Длинные агентные траектории создают новую проблему. Представим, что агент выполнил 50 действий, и только последнее привело к провалу задачи.
Как в таком случае определить, какое именно действие было неправильным?
А если ошибка произошла ещё на пятом шаге, но проявилась только в конце траектории агента?
Эта задача называется **Credit Assignment.** Определяется, как распределить итоговую награду между действиями внутри длинной траектории. Для современных агентов она стала одной из самых сложных проблем Reinforcement Learning.
Agent Lightning
Известная работа последних лет — Agent Lightning.
Авторы предложили рассматривать работу агента как последовательность состояний, действий и наблюдений. Агент взаимодействует со средой привычным образом, используя инструменты и выполняя необходимые действия. После завершения задачи вся история взаимодействия автоматически преобразуется в последовательность RL-переходов, пригодных для дальнейшего обучения.
Например, упрощенную схему можно представить так:
Состояние-> Вызов инструмента (tool call) -> Наблюдение-> Вызов инструмента -> Награда
После этого длинная траектория автоматически разбивается на отдельные RL-переходы, которые используются для обучения.
Главная идея работы — агента больше не нужно специально проектировать под RL. Практически любой существующий агент можно дообучать с помощью единого RL-фреймворка.
Обучение на длинных траекториях
Работа с длинными последовательностями действий сама по себе не является новой задачей для Reinforcement Learning. Существуют как эпизодические задачи, так и continuing RL, где взаимодействие агента со средой потенциально может продолжаться бесконечно долго.
В случае Agent RL сложность заключается скорее в сочетании длинного горизонта, большого пространства возможных действий и разреженной обратной связи. Например, coding-агент может исследовать множество файлов, редактировать код и несколько раз запускать тесты, прежде чем станет понятно, привели ли его действия к решению задачи.
Чем больше шагов отделяет действие агента от итоговой награды, тем сложнее определить, какие именно решения привели к успеху или провалу. Поэтому современные работы исследуют long-horizon credit assignment, использование промежуточных наград и более эффективные способы исследования среды.
К актуальным работам, например, можно отнести AgentFly, SWE-RL, WebSailor, Memento.
AgentFly — это RL-фреймворк для обучения мультитурных языковых агентов, в котором траектории обрабатываются через токен-левел маскирование, а инструменты и награды задаются через декораторы с асинхронной параллельной средой.
SWE-RL — первый подход к масштабированию RL-обучения LLM на реальных кодовых задачах, где награда вычисляется как схожесть с эталонным патчем без исполнения кода, а обученная модель достигает 41.0% solve rate на SWE-бенчмарке.
WebSailor — метод пост-трейнинга веб-агентов, использующий синтез сложных задач с высокой неопределённостью и алгоритм DUPO для RL, позволяющий open-source моделям достичь уровня проприетарных систем на BrowseComp .
Memento — фреймворк непрерывного обучения LLM-агентов без дообучения весов, использующий эпизодическую память прошлых траекторий и case-based reasoning с online soft Q-learning для адаптации в глубоком research
Хотя работы и различны, все они направлены на решение одной общей проблемы эффективного обучения агентов, выполняющих длинные последовательности действий перед получением итоговой награды.
Что дальше?
Сегодня развитие Agent RL постепенно меняет представление о больших языковых моделях.
Если раньше основной целью было научить модель лучше отвечать на вопросы, то теперь исследователи стремятся обучить её самостоятельно выполнять сложные задачи, взаимодействуя с окружающей средой почти так же, как и человек.
Сегодня агент уже может строить планы, выбирать инструменты, анализировать промежуточные результаты, исправлять ошибки и постепенно совершенствовать свою стратегию поведения.
Именно поэтому большинство современных исследований сосредоточено уже не на качестве отдельных ответов модели, а на обучении полноценного автономного поведения.

