Групповая оптимизация политики (Group Policy Optimization, GPO) стала популярным подходом для обучения агентов на основе больших языковых моделей (LLM) с использованием разреженных сигналов вознаграждения. Однако при решении сложных многошаговых задач (long-horizon tasks) этот метод сталкивается с критической проблемой: повторяющиеся или малоэффективные действия доминируют в области высокой вероятности политики, в то время как редкие, но критически важные шаги остаются недообученными. Новая работа, представленная на arXiv (2607.22724), предлагает решение этой проблемы.
Что произошло
Авторы представили метод Progress-conditioned Group Policy Optimization (PGPO), который модифицирует стандартную GPO, вводя оценку прогресса в качестве ключевого фактора при сравнении траекторий. Вместо того чтобы просто сравнивать все шаги внутри группы, PGPO взвешивает их в зависимости от того, насколько каждый шаг продвигает агента к цели. Это позволяет алгоритму уделять больше внимания действиям, которые действительно приближают решение, а не просто повторяются.
Почему это важно
Проблема дисбаланса выборки особенно остра в задачах, где большинство действий неэффективны или ведут в тупик. Например, в сценариях навигации или многоэтапного планирования агент может совершать сотни бесполезных шагов, которые статистически будут доминировать в градиенте политики. PGPO решает эту проблему, делая обучение более стабильным и эффективным, особенно в условиях редких вознаграждений. Это открывает путь к созданию более надежных ИИ-агентов, способных выполнять сложные практические задачи, такие как управление роботами или автоматизация рабочих процессов.
«Наш подход позволяет агенту сосредоточиться на действиях, которые действительно имеют значение, а не на тех, которые просто часто встречаются. Это критически важно для обучения в длительных горизонтах, где каждая удачная последовательность действий — редкость», — отмечают авторы исследования.
Что дальше
Разработка PGPO — это шаг к более эффективному обучению с подкреплением для LLM-агентов. В ближайшей перспективе метод может быть интегрирован в существующие фреймворки для обучения диалоговых систем и автономных ассистентов. Дальнейшие исследования, вероятно, будут направлены на комбинирование PGPO с другими техниками, такими как обучение с подкреплением на основе человеческого фидбека (RLHF), а также на тестирование в реальных средах, где длительные задачи являются нормой. Если метод подтвердит свою эффективность на практике, он может стать стандартом для обучения агентов нового поколения.