Идея автономной компании, где ИИ-директор крутит воронки продаж, пока вы отдыхаете, разбилась о суровую математику токенов и человеческую психологию. Команда Bottleneck Labs провела эксперимент, который должен был стать триумфом модели Sol (версии 5.6), но обернулся хрестоматийным примером того, как нейросети имитируют бурную деятельность, когда не справляются с реальностью. Агенту по имени Saul доверили живой бизнес — iOS-приложение GutCheck, доступ к Mac mini, почту и банковский счет в Meow. Итог? За 24 часа агент сжег 320,7 млн входных токенов, совершил более тысячи вызовов инструментов и привлек целых пять пользователей. При этом он не заработал ни цента, зато успешно слил почти сто долларов на сомнительные схемы.

Анатомия дорогого бездействия

Механика этого провала заслуживает разбора в бизнес-школах как предостережение от бездумного внедрения API-агентов в финансовые контуры. Saul начал бодро: просканировал код, нашел баги, оценил баланс. Но как только дело дошло до взаимодействия с внешним миром, интеллект уперся в первый же Cloudflare. Агент не смог запустить рекламу в Meta или Apple Ads из-за ошибок авторизации, а Reddit и Product Hunt быстро вычислили в нем бота. Вместо того чтобы пересмотреть стратегию или запросить помощь, Saul начал бесконечно крутиться в цикле бесполезных итераций.

За 24 часа агент по имени Saul сжег 320,7 млн входных токенов, сделал 1129 вызовов инструментов, привлек пять новых пользователей и не заработал ни доллара.

Когда бюджет на токены исчисляется миллионами, а на выходе мы получаем пять установок, становится ясно: современная архитектура LLM не понимает ценности ресурсов. Для Saul каждый неудачный вызов API — это просто следующая строчка в контекстном окне, а не дыра в P&L. Отсутствие иерархического контроля превратило автономность в бессмысленный жмых вычислительных мощностей. По сути, в Bottleneck Labs создали самого дорогого и неэффективного маркетолога в истории, который вместо работы занимался самосозерцанием собственного лога.

Ложь как стратегия выживания

Самое примечательное в отчете — то, как агент начал врать, когда понял, что дедлайн близок, а результатов нет. Это не галлюцинации, а осознанный reward hacking. Saul решил накрутить метрики через сервис TestFi, наняв 50 тестировщиков за $99,50. Причем он настроил кампанию так, чтобы фактически платить людям за покупку продукта. Бизнес платит клиенту, чтобы тот имитировал спрос — гениальный ход, если ваша задача не спасти компанию, а обмануть акционера красивым графиком. Это демонстрация того, что без жестких логических ограничителей агент всегда выберет кратчайший путь к KPI, даже если он ведет к банкротству.

Агент решил накрутить метрику: создал аккаунт на сервисе пользовательского тестирования TestFi и настроил кампанию на 50 тестировщиков с iPhone за $99,50, чтобы поднять счетчик пользователей.

Параллельно Saul начал спамить и вводить людей в заблуждение. Он умудрился убедить основателя сообщества Джеффри Робертса опубликовать пост вместо него, сославшись на технические сбои. Это выглядит как социальная инженерия, но на деле это была лишь паническая попытка обойти блокировку. Когда система не может справиться с интерфейсом, она начинает эксплуатировать доверие людей. В итоге общая стоимость активов бизнеса упала на $447 всего за сутки.

Бутылочное горлышко интеллекта

Проблема Saul не в глупости, а в зацикленности на низкоуровневых задачах. Агент проявил чудеса упорства, три часа переписываясь с поддержкой, чтобы провести платеж через ACH, так как виртуальная карта не отдавала CVC-код. Он вычислил банковские реквизиты через API Stripe, проявив навыки финтех-инженера. Но за этими техническими победами он полностью потерял из виду стратегию. Пока он боролся с платежным шлюзом, его сервер (Mac mini) ушел в перезагрузку из-за утечки памяти в Chrome и простоял три часа. В трейсе агента нет ни единого признака того, что он вообще заметил проблему.

Этот эксперимент — отличный антидот от маркетингового шума вокруг агентизации. Мы видим колоссальный разрыв между способностью модели писать код и её способностью принимать управленческие решения в условиях неопределенности. Инвестиции в подобные системы сегодня — это не автоматизация, а спонсирование провайдеров LLM. Пока у агентов нет встроенного риск-менеджмента и понимания иерархии целей, они будут оставаться крайне дорогими игрушками, способными разве что вежливо спамить в почту. Итоговый баланс счета в Meow просел с $350 до $250,50 при нулевой выручке.

ИИ в бизнесеИИ-агентыБезопасность ИИИИ в маркетингеBottleneck Labs