Оценка автономных агентных систем создает фундаментальные проблемы верификации, которые стандартные бенчмарки привыкли игнорировать. Когда вендор или лаборатория заявляет о резком росте производительности благодаря новому промпту, архитектурному каркасу или модели, технические руководители вынуждены отвечать на два прямых вопроса: можно ли строго пересчитать эти результаты на основе сохраненных доказательств и отражает ли этот архив всю экспериментальную выборку, а не только тщательно отобранные удачные попытки? Обычные логи приложений, цепочки с защитой от несанкционированного доступа и хешированные транскрипты сохраняют исходные байты, но не определяют изначальный массив запусков. В итоге скрытые промежуточные состояния, незаметные повторные попытки и провальные прогоны просто остаются невидимыми.

Чтобы обеспечить подлинную валидность при аудите агентов, исследователи Пэйин Чжу и Сыди Чан разработали ClaimReceipt. Этот фреймворк представляет собой спецификацию цифровых квитанций и селективный верификатор, который напрямую связывает типизированные доказательства транзакций с подписанным манифестом эксперимента. По итогам проверки каждого запуска система возвращает структурированный вердикт: «Пройдено» (Pass), «Недействительно» (Invalid) или «Неубедительно» (Inconclusive).

Предварительная фиксация манифестов и криптографическая заморозка

До начала любого сбора данных манифест эксперимента криптографически фиксирует параметры выборки, конфигурации тестовых групп, цифровые отпечатки протоколов, структуру репликаций, алгоритмы оценки, пороговые значения и правила охвата. Такая предварительная фиксация создает неизменяемое эталонное пространство: любые скрытые пропуски запусков и потерянные прогоны приводят к ошибке верификации, а не к завышенным метрикам.

Для обеспечения строгой процедурной целостности Чжу и Чан зафиксировали спецификацию ClaimReceipt до ее практической реализации под хешем SHA-256 18d109...b81.

«Проверка заявлений требует как доказательств, достаточных для подтверждения гипотезы, так и зафиксированного пространства экспериментов, на фоне которого любые пропуски становятся очевидными».

Закрепляя схемы данных и обязательства по выполнению запусков до начала инференса, верификатор исключает возможность подгонки метрик и пересчета результатов задним числом.

Эмпирическая проверка на исторических и проспективных данных

В ходе тестирования протокола с помощью верификатора CR-2 на 1392 исторических записях взаимодействия покупателей и продавцов (включая 600 детерминированных прогонов и 792 постгенерационные записи) система безошибочно воспроизвела все пять размеченных вручную аудиторских вердиктов. Обе группы тестов были воспроизведены без отклонений, при этом система выявила 11 из 11 внедренных семантических ошибок с нулевым уровнем ложных срабатываний на 8 чистых прогонах.

В проспективном тестировании CR-3 с 30 предварительно зафиксированными назначениями полный набор доказательств показал идеальные результаты по охвату и учету. Однако сокрытие хотя бы одной финальной квитанции мгновенно вызывало вердикт INCONCLUSIVE_COVERAGE. Кроме того, исключение закрытых этапов сохраняло базовую валидность протокола, но закономерно аннулировало заявления об экономической эффективности, подтвердив заложенные командой сценарии тестирования на отказ.

На практике интеграция ClaimReceipt добавляет всего 0,021% к общему времени инференса модели и увеличивает объем данных на 9,9 КБ на транзакцию. Для технических директоров, оценивающих внедрение корпоративных ИИ-агентов, криптографические аудиторские следы быстро превращаются из академического идеала в обязательное операционное требование перед покупкой коммерческих решений. Хотя внутренняя проверка показала, что спецификация еще требует доработки для независимых внешних аудиторов, архитектура доказывает: надежная защита аудита ИИ-агентов от манипуляций технически реализуема и практически не требует дополнительных затрат.

ИИ-агентыБезопасность ИИИИ в бизнесеПроизводительность