Автономные ИИ-системы регулярно спотыкаются одни и те же операционные препятствия от запуска к запуску просто потому, что веса базовой модели остаются неизменными после обучения. Непрерывное дообучение фундаментальных моделей остается дорогой и нестабильной головной болью для ML-инженеров, тогда как работа корпоративных агентов требует предсказуемого способа накопления практического опыта. Чтобы обойти деградацию весов и избежать бесконечных циклов тонкой настройки, подразделение Google Research представило WikiSkill — фреймворк, оснащающий агентов прозрачной и накопительной базой знаний.
Три уровня операционной памяти
Опираясь на концепцию «LLM Wiki» Андрея Карпати, которая рассматривает накопленный опыт как развивающийся структурированный корпус данных, WikiSkill организует память агента в три явных слоя. В самом низу находится Слой исходных данных (Raw Layer), служащий неизменяемым журналом трассировок выполнения, вызовов инструментов и прямых ответов среды. Над ним работает Вики-слой (Wiki Layer), где эти операционные следы преобразуются в задокументированные паттерны ошибок и готовые стратегии, пополняемые с каждым новым запуском.
«Эти знания упаковываются в „навыки агента“ — модули повторного использования, которые направляют поведение системы без изменения того, что она усвоила во время обучения».
На вершине расположен Слой навыков (Skill Layer), содержащий активные процедурные правила, управляющие выводом модели в реальном времени. Как только агент завершает задачу, специализированный компонент Wiki Maintainer разбирает трассировку, каталогизирует новые типы сбоев в вики и запускает модуль Skill Proposer для генерации обновленных правил поведения. Механизм строгой валидации тщательно проверяет каждое предложенное обновление на изолированных тестовых наборах перед развертыванием, отменяя регрессии и навсегда сохраняя информацию об ошибке в архиве вики.
Результаты тестов на моделях разного масштаба
Google протестировала архитектуру на пяти независимых бенчмарках, охватывающих математические рассуждения, поиск в интернете в реальном времени, работу с электронными таблицами, ответы на вопросы по документам и интерактивные виртуальные среды. Оценка проводилась как на открытых моделях семейств Qwen (4B, 9B, 27B) и Gemma, так и на коммерческих API линейки Gemini. В структурированных доменах такая процедурная экстернализация стабильно превосходила предыдущие методы эволюции навыков, обеспечивая двузначный прирост эффективности без изменения базовых параметров.
Прирост производительности оказался тесно связан со структурой предметной области. Задачи с четкими алгоритмическими границами и повторяющимися сценариями ошибок показали наибольший прогресс, доказав, что внешняя регулировка правил легко выигрывает у дорогостоящей адаптации параметров.
Ограничения контекста и переносимость
Хотя крупные фундаментальные модели извлекли максимальную пользу из плотных наборов процедурных правил, компактные модели с поддержкой WikiSkill часто сравнивались по производительности с более крупными базовыми аналогами без расширения. Для технических руководителей, внедряющих ИИ в корпоративные процессы, модульная текстовая память предлагает проверяемую и экономически выгодную альтернативу непрерывному дообучению — при условии, что команды настроят строгий контроль регрессий во избежание разрастания промптов и дрейфа поведения.