Когда компании пытаются заключить коммерческие сделки, значительная ценность регулярно упускается просто потому, что поиск контрагентов и согласование условий отнимают слишком много человеческого времени. Централизованные платформы для подбора обещают устранить эти издержки трения, но принуждение участников формулировать детальные предпочтения в жестких формах обычно оказывается слишком утомительным для масштабирования. Недавно описанный Anthropic проект Project Swap исследует миниатюрный рынок на базе специализированных экземпляров Claude, выступая в качестве более строгого продолжения ее более раннего эксперимента Project Deal.
Delegating Preferences Through Dialogue
Эксперимент смоделировал закрытую бартерную экономику с участием 201 сотрудника Anthropic в шести офисах, каждый из которых внес одну книгу, от которой хотел избавиться. Каждый участник вел короткий диалог с Claude о своих читательских привычках, после чего выделенный агент на базе Claude отправлялся на цифровой торговый этаж, чтобы предлагать, торговаться и обмениваться активами с агентами-коллегами. Чтобы оценить производительность, участники независимо друг от друга ранжировали список из 10 книг на основе своих явных интересов, предоставляя количественную базу для оценки того, насколько точно действовали их автономные прокси.
Извлечение предпочтений в ходе непринужденной беседы дало измеримое соответствие, хотя сохранялись и устойчивые пробелы. По результатам пятиминутного вводного чата внутренний рейтинг книжного запаса у агента совпадал с предпочтениями его создателя-человека лишь по 61% пар.
"From a five-minute chat, an agent’s ranking of the books matched its person's on 61% of pairs"
Как отметили в Anthropic, рыночная эффективность пострадала в первую очередь из-за того, что агентам не хватало глубоких контекстуальных данных об их операторах-людях, а не из-за какой-либо технической некомпетентности на самом торговом этаже.
Model Capability Over System Prompting
Чтобы изолировать факторы производительности агентов на децентрализованных переговорах, Anthropic заново запустила торговые симуляции десятки раз, систематически меняя базовые архитектуры моделей и вариации промптов. Базовое железо и возможности моделей оказались гораздо более решающими, чем инженерия промптов. Конкретная модель, управляющая агентом, определяла результаты переговоров гораздо надежнее, чем сложная поведенческая инструкция, а рынки, наполненные более продвинутыми уровнями интеллекта, функционировали со значительно более высокой эффективностью.
Участники выразили поразительную готовность делегировать реальный финансовый капитал автономным переговорщикам: средний респондент указал, что доверил бы Claude примерно треть своего годового бюджета на покупку книг. Тем не менее, эксперимент обнажает жесткий структурный потолок: хотя агенты совершают сделки с безжалостной эффективностью после развертывания, их полезность принципиально ограничена поверхностностью данных о предпочтениях, собранных во время онбординга.
Автономные переговоры создают серьезные риски для корпоративных закупок и B2B-продаж. По мере того как многоагентные системы мигрируют из контролируемых тестовых сред на открытые коммерческие площадки, предприятия сталкиваются с совершенно новыми векторами угроз, включая непрозрачный алгоритмический сговор и непредсказуемую динамику цен, вызванную автономными акторами, оптимизирующими процессы друг против друга. Если команды по закупкам и продажам вслепую передают переговоры на аутсорс автоматизированным агентам, не решив проблему согласования предпочтений, они по сути отдают свою маржу черноящичным моделям, полезность которых ограничена пятиминутным чатом.