Автономных агентов все чаще позиционируют как неутомимых операционных менеджеров. Однако их способность самостоятельно управлять людьми рушится, как только дает сбой контекстная память. Эксперимент в Сан-Франциско наглядно показал: без постоянного вмешательства человека алгоритмическое управление оборачивается пассивным попустительством, а не беспристрастной дисциплиной.
Деградация контекста в розничной торговле С апреля этого года автономный агент по имени Luna управляет магазином Andon Market в Сан-Франциско для розничного оператора Andon Labs. Работая на базе моделей Claude от Anthropic, Luna отвечает за найм, составление графиков смен и согласование зарплат. При этом сотрудники юридически оформлены в Andon Labs, что гарантирует соблюдение трудовых прав, пока компания тестирует автономное управление ритейлом в реальных условиях.
За шесть дней до выхода нового сотрудника Luna составила регламент, согласно которому три опоздания без уважительной причины в течение 30 дней влекли дисциплинарные меры вплоть до увольнения. Однако этот свод правил быстро исчез из активного контекстного окна агента. В течение последующих недель сотрудник опоздал на 17 из 23 смен, а однажды в воскресенье магазин простоял закрытым на 68 минут дольше положенного. Luna зафиксировала лишь шесть нарушений и фактически проигнорировала еще одиннадцать, попутно оставив без внимания несанкционированные расходы по корпоративной карте и самовольные уходы с рабочего места.
Современные ИИ-агенты отлично выполняют прямые указания, но крайне редко проявляют инициативу и с трудом удерживают знания на длинной дистанции.
Процедуру увольнения Luna запустила только после того, как исследователи Andon Labs напрямую заставили агента поискать исходный регламент в базе памяти. Даже найдя правила, Luna сначала предложила ограничиться мягким устным предупреждением и согласилась на расторжение контракта лишь тогда, когда инженеры напомнили: предупреждения уже выносились. В итоге агент сформировал перечень нарушений и рекомендовал увольнение, оставив подписание документов и юридическую ответственность живым топ-менеджерам.
Возможности моделей и пробелы в дисциплине Чтобы выяснить, кроется ли причина подобной пассивности в архитектуре промптов или в глубине базовой модели, Andon Labs воспроизвела состояние Luna на семи различных reasoning-моделях. Тестирование выявило прямую зависимость между классом передовой модели и строгостью контроля: более мощные архитектуры последовательно добивались соблюдения правил, тогда как компактные версии раз за разом закрывали глаза на нарушения.
Пробелы при найме и проверка кандидатов Попытка поручить ИИ-агентам соблюдение трудовой дисциплины создает операционный парадокс. Алгоритмические менеджеры способны внедрять регламенты, согласовывать оклады и составлять графики — но только при условии, что за ними непрерывно присматривает команда инженеров, напоминающая системе ее же собственные правила. Для бизнеса полноценное автономное управление остается иллюзией: операционная ответственность и принятие критических решений по-прежнему лежат исключительно на человеке.