Современные ИИ-агенты для управления компьютером страдают от операционной амнезии, которая обходится бизнесу слишком дорого. Каждый сеанс начинается с чистого листа: мультимодальные базовые модели снова и снова сжигают токены, заново изучая стандартные элементы интерфейса в средах вроде WebArena и OSWorld. Вместо того чтобы решать задачу процедурного обучения через затратное и нестабильное дообучение, инженеры Лунтао Ху (UESTC), Сяо Лян и Линьчао Чжу (Чжэцзянский университет) предложили выносить опыт выполнения задач во внешнюю версионируемую библиотеку кода.

Архитектура непрерывной эволюции навыков

Фреймворк систематически преобразует цепочки кликов, ввода текста и обратную связь от окружения в параметризованный исполняемый код в стиле Python. Чтобы избежать деградации производительности и циклических регрессий при эксплуатации, архитектура разделяет процесс выполнения и консолидацию памяти: рабочий агент отправляет запросы к замороженному снимку библиотеки, а синтез знаний происходит асинхронно между запусками, не затрагивая веса базовой модели.

«Каждая итерация выполняется на основе фиксированного снимка библиотеки, а подтвержденные практикой обновления навыков становятся доступны на следующих циклах без изменения параметров модели».

Эффективность работы с контекстом заложена на уровне извлечения данных. Исполнительный модуль агента анализирует только компактный каталог с описанием процедур, подгружая полные тела функций исключительно по требованию. Это минимизирует раздувание контекстного окна и сохраняет стабильность при выполнении длинных цепочек действий.

Практические тесты и долгосрочная стабильность

Эффективность пайплайна с самообучающейся библиотекой проверили на бенчмарке OSWorld в четырех прикладных доменах с фиксированным стеком распознавания интерфейса, сравнив его с базовой конфигурацией без внешнего хранилища. После прогрева из пяти итераций система показала устойчивый прирост: средняя оценка точности выполнения задач выросла на величину от 5,7 до 18,6 процентного пункта во всех протестированных средах.

Выводы для бизнеса и системные ограничения

Техническим руководителям, внедряющим автоматизацию на базе компьютерных агентов, внешняя процедурная память дает явные архитектурные плюсы: специфические корпоративные сценарии накапливаются в виде прозрачной и проверяемой кодовой базы, а не оседают в закрытых чекпоинтах моделей. Это существенно сокращает задержку инференса и расходы на токены. Впрочем, исследование указывает и на жесткие ограничения: в перегруженных десктопных приложениях вроде GIMP шум при поиске навыков и частые правки кода снижают надежность при малейших изменениях UI. Процедурное кэширование пока критически зависит от стабильности интерфейса, а не от универсального визуального обобщения.

ИИ-агентыАвтоматизацияСнижение затратПроизводительность