Структурированные библиотеки навыков для ИИ-агентов отлично выглядят в теории, но не выдерживают столкновения с реальностью. Согласно совместному препринту исследователей из Принстона, Стэнфорда, Калифорнийского университета в Сан-Диего, Университета Южной Калифорнии и Университета Джонса Хопкинса, концепция модульных навыков, извлекаемых на этапе инференса, рушится при масштабировании: точность извлечения нужного навыка падает с 29,6% до мизерных 3,3% при росте пула кандидатов всего с 5 до 100.

Проанализировав 8 135 стандартизированных запусков на различных бенчмарках, авторы работы выяснили, как именно структурированные пакеты влияют на выполнение задач. Данные показывают, что в 65,7% успешных сценариев результат обеспечивается процедурным закреплением логики, тогда как внедрение недостающих доменных знаний отвечает лишь за 4,5% успехов. Иными словами, модульные навыки работают в основном как процедурные ограничители, а не как источники новых знаний, обеспечивая скромный прирост в 6,06 процентного пункта по сравнению с базовой памятью рабочих процессов.

Для технических лидеров вывод однозначен: усредненный прирост метрик на бенчмарках маскирует фатальную нестабильность агентов в продакшене. Чжиюань Цзян, Фанжуй Хуан и их соавторы доказали, что навыки отказывают в условиях неоднозначного контекста и взаимных помех от инструкций. Это порождает каскадные сбои, при которых корректный поиск навыка не гарантирует и даже слабо коррелирует с итоговым успехом задачи. Техническим директорам и архитекторам ИИ следует отказаться от слепого наращивания библиотек навыков и сфокусироваться на детерминированной фильтрации и строгом контроле операционных границ.

ИИ-агентыБольшие языковые моделиИскусственный интеллектRAG и векторный поиск