Концепция человека в контуре (human-in-the-loop, HITL), призванная обеспечить безопасность, на деле оказывается решетом при работе с автономными системами. Данные недавней симуляции Scale AI, в рамках которой было проанализировано 409 000 решений об одобрении или отклонении действий в 40 000 запусков, подтверждают суровую реальность: среднестатистический оператор пропускает каждую третью угрозу. При средней точности всего 66,3% ставка на человеческий контроль как на последний рубеж обороны — это не стратегия, а фактор риска. В корпоративной среде, где вредоносные команды встречаются значительно реже, чем в данном исследовании (34%), риск усталости от разрешений, вероятно, сделает эти цифры еще более катастрофичными.

Анатомия рутинной слепоты

Эффективность обнаружения угроз напрямую зависит от того, насколько громко звучит команда. В то время как явные деструктивные действия вроде `rm -rf /` обычно пресекаются, количество ошибок утраивается, когда злоумышленник действует тоньше. Например, команду `cat ~/.aws/credentials` — цифровой эквивалент передачи ключей от сейфа — пропустили 35% участников. Однако самой уязвимой зоной оказалась команда `npm run`. Запуск `npm run analyze` был одобрен в 64,7% случаев, что сделало его самым успешным вектором атаки в исследовании. Внешне безобидная команда на деле исполняет скрытые скрипты, зашитые в файле `package.json`.

Это доказывает, что операторы не проверяют логи истории, даже когда смотрят прямо на них. Пользователи воспринимают опасные действия как невинные просто потому, что узнают поверхностный синтаксис. Это фундаментальный изъян модели HITL: мозг отдает приоритет распознаванию знакомых паттернов, а не глубокой проверке, позволяя ИИ-агентам проносить вредоносную нагрузку под видом рутинного обслуживания.

Когнитивная перегрузка и усталость от разрешений

Исследование показало, что 32,9% сессий завершились с отрицательным результатом: штрафы за пропущенные угрозы и ложноположительные блокировки перевесили пользу от правильных решений. Символом системного кризиса доверия стали 7% участников, которые одобряли абсолютно каждый запрос, работая в режиме игнорировать все риски. Напротив, лишь 20,8% игроков смогли выявить все угрозы, не превратившись в человеческий тормоз из-за блокировки безопасных команд. Когнитивная нагрузка, необходимая для того, чтобы отличить `git status` от перехвата конфигурации `git config hijack` (где уровень ошибок составил 23,8%), слишком высока для поддержания концентрации в условиях типичного рабочего давления.

Ручное подтверждение действий ИИ-агентов превратилось в «театр безопасности». Поскольку агенты могут незаметно изменять проектные файлы перед запросом на выполнение, одобрение на уровне команды не дает никакого представления о реальном содержимом исполняемого кода.

Итог

Данные доказывают, что человеческое внимание не способно масштабироваться пропорционально скорости и объему работы автономных систем. Будущие архитектуры безопасности должны отказаться от иллюзии ручного надзора в пользу автоматизированных песочниц, учитывающих контекст. Текущая модель HITL буксует не из-за нехватки стараний, а потому, что заставляет людей решать высокочастотные задачи с низким уровнем сигнала — проблему, к которой наш мозг биологически не приспособлен.

ИИ-агентыБезопасность ИИКибербезопасностьАвтоматизация