ИИ-агенты превратились в восхитительно дорогие игрушки. По мере того как автономные агенты проникают в корпоративные рабочие процессы (что подтверждается пятнадцатикратным ростом год к году в средах Microsoft 365, а агенты для написания кода тихо занимают 28,7% активных проектов на GitHub), они тянут за собой облачные зависимости, словно якорь. Прогон бесконечных циклов агентов через удаленные конечные точки означает астрономические счета за API и параллельную передачу конфиденциальной бизнес-логики на сторонние серверы.

На сцену выходит AgBench — набор тестов, разработанный Ичжоу Ханем (Yizhou Han), Дхананджаем Сайкумаром (Dhananjay Saikumar) и Блессоном Варгесе (Blesson Varghese) из Сент-Эндрюсского университета совместно с Ди Ву (Di Wu) из Чжэцзянского технологического университета. Вместо того чтобы делать вид, будто аппаратных ограничений не существует, AgBench оценивает рабочие нагрузки агентов напрямую на персональных устройствах, учитывая суровую реальность локальных ограничений памяти, троттлинга и разряда батареи.

Оценка аппаратного узкого места

Результаты тестирования предлагают отрезвляющую проверку реальности для инженерных команд, стремящихся сократить расходы на облако. Да, локальное выполнение исключает затраты на API и ограждает конфиденциальные промпты от зияющей пасти облака. Но запуск рабочих процессов целиком на периферийном железе сопряжен с серьезными оперативными компромиссами по сравнению с централизованной архитектурой.

Выполнение исключительно на локальном устройстве исключает затраты на API облачных моделей и риски утечки конфиденциальной информации через облачных агентов.

Локальная обработка страдает от более низкого процента успешных задач и вялой скорости выполнения, особенно по мере роста параллелизма. Физические машины быстро упираются в ресурсные барьеры, снижая пропускную способность инференса, когда несколько агентов пытаются рассуждать одновременно. Чтобы обойти это, инженерные команды склоняются к гибридным схемам развертывания, которые разделяют конвейеры рассуждений между клиентскими устройствами и удаленными серверами. AgBench демонстрирует, что, хотя гибридное выполнение спасает показатели успешности задач, оно незаметно возвращает облачные расходы и риски утечки данных в зависимости от того, как распределена рабочая нагрузка. Бесплатного сыра не бывает: инженерным командам приходится сопоставлять надежность задач, полезную производительность, затраты на облако и конфиденциальность с их конкретными аппаратными профилями.

Практический вывод заключается в том, что перенос рабочих нагрузок агентов из облака — это не бинарный переключатель. Чисто локальное развертывание обеспечивает конфиденциальность и экономию, но жертвует скоростью и надежностью под нагрузкой. AgBench наконец-то дает техническим лидерам воспроизводимый инструмент для измерения этих компромиссов на реальном целевом железе, вместо того чтобы верить маркетинговым слайдам вендоров.

ИИ-агентыЛокальный ИИПроизводительностьОблачные вычисления