Библиотеки навыков изначально создавались для того, чтобы избавить обучение с подкреплением в агентных системах от ресурсоемкого перебора вариантов, позволяя агентам на базе больших языковых моделей повторно использовать процедурные знания в сложных задачах. Однако на практике существующие архитектуры страдают от постоянного узкого места: процесс эволюции навыков изолирован от оптимизации базовой политики. Системы либо опираются на жестко заданные вручную сценарии, либо воспринимают навыки как статичные и закрытые блоки. Когда рабочее окружение меняется, такие библиотеки превращаются в бесполезный балласт, снижают качество рассуждений и требуют постоянной ручной корректировки промптов. Чтобы устранить эту проблему, исследователи из Института автоматики Китайской академии наук (CAS), Китайского народного университета и компании ByteDance представили фреймворк CoSkill.

Ограничения существующих фреймворков навыков

Предыдущие подходы к управлению процедурными знаниями в агентных архитектурах делятся на три неидеальные парадигмы. Первая — внешне управляемая эволюция — рассматривает репозиторий навыков как отдельную базу знаний, перекладывая задачи обновления на вторичные LLM или эвристические правила, полностью оторванные от обучения основной политики. Вторая оптимизирует управление библиотекой через вознаграждения в обучении с подкреплением, но трактует каждый навык как неделимый черный ящик, оставляя внутренние подпроцедуры без оптимизации. Третья полагается на жестко закодированные пайплайны мета-навыков, не способные адаптироваться синхронно с исполнительной политикой.

Сквозная коадаптация навыков и политик

CoSkill трансформирует этот статичный жизненный цикл: управление мета-навыками становится активным, обучаемым агентом мета-навыков (Meta-Skill Agent), который тренируется совместно с агентом рассуждений (Reasoning Agent) на базе иерархического дерева навыков. Оба агента работают на единой базовой модели, формируя тесно связанный контур обратной связи.

«Агент рассуждений выстраивает свои действия на основе извлеченного навыка задачи и пошаговых навыков из дочернего набора, в то время как успешность выполнения задачи направляет агента мета-навыков при доработке этих пошаговых инструкций».

Такой непрерывный цикл мультиагентного обучения с подкреплением защищает процедурные инструкции от устаревания и рассинхронизации с реальными требованиями политики. На структурированных бенчмарках CoSkill продемонстрировал показатель успешности 98,4% в среде ALFWorld (+3,5 процентных пункта по сравнению с базовыми решениями) и 90,6% в WebShop (+6,2 п. п.). Авторы опубликовали исходный код исследования на GitHub.

Для технических лидеров бизнеса CoSkill обозначает важный вектор развития: переход от хрупких репозиториев промптов с ручной поддержкой к самооптимизирующимся процедурным процессам, адаптирующимся к отклику среды. Тем не менее готовность технологии к промышленной эксплуатации остается открытым вопросом. Преодоление разрыва между изолированными детерминированными бенчмарками и реальными корпоративными API с задержками и непредсказуемыми сбоями потребует серьезной инженерной работы, прежде чем автономная эволюция навыков сможет полностью заменить контроль со стороны человека.

Искусственный интеллектИИ-агентыМашинное обучениеБольшие языковые моделиАвтоматизация