Суббота, 1 августа 2026 г.сб · 1 авг
ИИ-чат для сайта
Подключите ИИ-ассистента на сайт за одну строку кода — отвечает на вопросы клиентов 24/7 — Neuralismo.ru →
Главная/Исследования/Прогресс-обусловленная групповая оптимиз…
Исследования

Прогресс-обусловленная групповая оптимизация политики для длительных задач агентов ИИ

Исследователи предложили новый метод обучения LLM-агентов, решающий проблему дисбаланса выборки при выполнении длительных задач. Подход Progress-conditioned Group Policy Optimization (PGPO) фокусируется на прогрессе, а не на частоте действий.

Групповая оптимизация политики (Group Policy Optimization, GPO) стала популярным подходом для обучения агентов на основе больших языковых моделей (LLM) с использованием разреженных сигналов вознаграждения. Однако при решении сложных многошаговых задач (long-horizon tasks) этот метод сталкивается с критической проблемой: повторяющиеся или малоэффективные действия доминируют в области высокой вероятности политики, в то время как редкие, но критически важные шаги остаются недообученными. Новая работа, представленная на arXiv (2607.22724), предлагает решение этой проблемы.

Что произошло

Авторы представили метод Progress-conditioned Group Policy Optimization (PGPO), который модифицирует стандартную GPO, вводя оценку прогресса в качестве ключевого фактора при сравнении траекторий. Вместо того чтобы просто сравнивать все шаги внутри группы, PGPO взвешивает их в зависимости от того, насколько каждый шаг продвигает агента к цели. Это позволяет алгоритму уделять больше внимания действиям, которые действительно приближают решение, а не просто повторяются.

Почему это важно

Проблема дисбаланса выборки особенно остра в задачах, где большинство действий неэффективны или ведут в тупик. Например, в сценариях навигации или многоэтапного планирования агент может совершать сотни бесполезных шагов, которые статистически будут доминировать в градиенте политики. PGPO решает эту проблему, делая обучение более стабильным и эффективным, особенно в условиях редких вознаграждений. Это открывает путь к созданию более надежных ИИ-агентов, способных выполнять сложные практические задачи, такие как управление роботами или автоматизация рабочих процессов.

«Наш подход позволяет агенту сосредоточиться на действиях, которые действительно имеют значение, а не на тех, которые просто часто встречаются. Это критически важно для обучения в длительных горизонтах, где каждая удачная последовательность действий — редкость», — отмечают авторы исследования.

Что дальше

Разработка PGPO — это шаг к более эффективному обучению с подкреплением для LLM-агентов. В ближайшей перспективе метод может быть интегрирован в существующие фреймворки для обучения диалоговых систем и автономных ассистентов. Дальнейшие исследования, вероятно, будут направлены на комбинирование PGPO с другими техниками, такими как обучение с подкреплением на основе человеческого фидбека (RLHF), а также на тестирование в реальных средах, где длительные задачи являются нормой. Если метод подтвердит свою эффективность на практике, он может стать стандартом для обучения агентов нового поколения.

Читайте нас в Телеграм
2–3 поста в день, без шума
Телеграм
То же самое — но в кармане, без браузера.
Главные ИИ-новости, разборы и one-liners. 2–3 поста в день, без шума.
@theNeuralBase →
@theNeuralBase · сейчас
🟠 OpenAI выкатила o5-mini — в 3 раза дешевле o4.
⚪ Mistral закрыл раунд на $1.6 млрд. Оценка $14 млрд.
12 814 подписчиков