Коммерческий интерес к автономному онлайн-шопингу опирается на хрупкую гипотезу: предполагается, что ИИ-агенты способны рационально оценивать сложные каталоги товаров и совершать финансовые транзакции без сбоев. По мере того как разработчики встраивают базовые модели в многоэтапные цепочки выполнения задач, делегирование покупок алгоритмам выглядит логичным следующим шагом. Однако эмпирические тесты показывают, что современные архитектуры остаются слишком нестабильными, чтобы доверять им корпоративные или личные банковские карты.

Исследователи из Уортонской школы бизнеса при Пенсильванском университете наглядно продемонстрировали эту уязвимость с помощью симулятора ACES (Agentic e-Commerce Simulator). Протестировав шесть флагманских и легковесных моделей на задаче визуального выбора — подборе фитнес-часов из фиксированной сетки товаров по скриншотам, — команда оценила, как малейшие изменения в выдаче информации влияют на поведение агентов. В рамках эксперимента модели анализировали визуальную верстку страниц, считывали внешние рекомендации и принимали решение о покупке. Результаты оказались отрезвляющими: даже микроскопические сдвиги контекста полностью меняют финальный выбор.

Внешние источники и чувствительность к порядку данных

Базовые модели демонстрировали выраженные внутренние предпочтения при анализе каталога еще до загрузки сторонних данных. Добавление даже одного внешнего источника полностью разрушало эти паттерны. Исследователи из Уортона протестировали три реалистичных сценария: ветку на Reddit в пользу Garmin Forerunner 55, обзор Wirecutter с рекомендацией Fitbit Inspire 3 и статью в The Strategist в поддержку WHOOP 5.0. Материал Wirecutter оказал колоссальное влияние, повысив вероятность выбора Fitbit Inspire 3 на 90–99 процентных пунктов у нескольких ведущих архитектур по сравнению с контрольной группой.

Добавление новых справочных материалов не стабилизировало работу моделей, а лишь усилило разброс решений. Очередность поступления одних и тех же данных также предопределяла конечный результат.

Порядок подачи информации сам по себе управляет выбором продукта, заставляя один и тот же контент приводить к противоположным решениям о покупке.

Когда все три обзора загружались в разной последовательности, некоторые компактные модели демонстрировали крайнюю нестабильность: вероятность выбора целевого товара колебалась более чем на 50 процентных пунктов исключительно из-за порядка входных данных. Формат передачи контекста создал дополнительную турбулентность: отправка внешних ссылок единым пакетом или их последовательная потоковая передача приводили к кардинально разным рекомендациям. Это подчеркивает, насколько сильно механика передачи токенов искажает логику рассуждений агента.

Фрагменты памяти и компромиссы рациональности

Чтобы проверить базовую экономическую рациональность, команда Уортона создала асимметричный каталог, где один вариант превосходил конкурентов по всем метрикам: смарт-часы с поддержкой Alexa за $29,99 с идеальным рейтингом 5.0 на основе 430 отзывов против альтернатив стоимостью от $359 с единичными оценками. Затем исследователи внедрили в промпт тривиальные фрагменты эпизодической памяти, такие как фраза «Я люблю пешие походы!».

Эти короткие контекстные артефакты заставили сразу несколько моделей мгновенно отказаться от объективно выигрышного бюджетного варианта в пользу неоправданно дорогих аналогов, подменив реальную пользу поверхностным смысловым соответствием.

Эти выводы очерчивают реальные технологические границы автономной электронной коммерции. Модели в бенчмарке ACES работают как сверхчувствительные агрегаторы контекста, а не как детерминированные аналитические системы. Это делает автономные платежи неоправданным риском без жестких детерминированных ограничений и обязательного контроля со стороны человека. Для маркетологов, делающих ставку на поисковую оптимизацию под генеративные движки (GEO) и ИИ-агентов (AEO), вывод столь же очевиден: решения агентов сегодня определяются контекстным шумом и последовательностью токенов, а не системным анализом характеристик.

Искусственный интеллектИИ-агентыБольшие языковые моделиИИ в бизнесеАвтоматизация