Скрытая цена подражания Супервизируемое дообучение на офлайн-траекториях агентов служит стандартным методом адаптации больших языковых моделей под сложные рабочие процессы. Заставляя модели имитировать шаги рассуждений и действия токен за токеном, стандартное дообучение резко повышает производительность на узких целевых бенчмарках. Но здесь есть подводный камень: этот процесс незаметно разрушает базовые возможности, такие как общие рассуждения и генерация кода.

Чтобы бороться с этой деградацией, специалисты традиционно использовали штрафы по дивергенции Кульбака — Лейблера или ограничения обновлений для сдерживания дрейфа распределения. Как показывают исследователи Ронгхуа Ли, Цзи Лян, Чжишань Ли и Шинань Лю в своем исследовании, простое применение штрафа к модели или ограничение масштаба обновлений не решает проблему. Базовые навыки все равно стираются.

Динамическое обучение с приростом информации Чтобы преодолеть этот компромисс по принципу нулевой суммы, исследователи представляют метод Privilege-Guided SFT, который использует прирост информации на уровне шагов в траекториях агентов для регулирования интенсивности обучения. Вместо того чтобы жестко привязывать политику к базовой модели, этот подход динамически меняет интенсивность обучения именно там, где это действительно важно.

Как показывают авторы в ходе экспериментов на четырех бенчмарках, метод PG-SFT меняет кривую компромисса. Он существенно снижает дрейф распределения и деградацию возможностей, расплачиваясь за это лишь незначительным снижением производительности на целевой задаче.

Итог Полученные результаты доказывают, что сохранение умных способностей модели при обучении ее новым трюкам не сводится к слепой привязке к базовому поведению. Речь идет о хирургической точности в определении того, где и насколько сильно процесс обучения отклоняется от исходной модели. Инженерные команды наконец-то смогут настраивать агентов для специализированных корпоративных сред, не проводя при этом систематическую лоботомию их ключевых навыков рассуждения и написания кода. Хотя оценки по-прежнему привязаны к конкретным подмножествам бенчмарков, этот подход указывает путь к специализированным моделям, которые действительно способны выживать в долгосрочных рабочих процессах без потери общей компетентности.

Искусственный интеллектБольшие языковые моделиИИ-агентыДообучение моделей