По мере того как агенты на базе языковых моделей берутся за задачи, охватывающие обширные рабочие пространства, оценка их многошаговых результатов остается дорогим операционным узким местом. Когда агент генерирует сложный отчет или обновляет громоздкую электронную таблицу, в системах часто отсутствуют эталонные ответы или внешние суперспекторы для выявления скрытых дефектов. В недавнем исследовании ученые из University of Cambridge и Google Cloud AI Research представили VeriHarness — фреймворк верификации, призванный устранить этот пробел в оценке с помощью фиксированной базовой модели без эталонных данных во время тестирования.

Challenging Shared Assumptions

Стандартные конвейеры часто исходят из наивного предположения, что согласие между несколькими запусками свидетельствует о фактической точности. Тем не менее, исследование показывает, что консенсус между независимыми генерациями агентов регулярно маскирует общие системные ошибки, в то время как точки расхождения выявляют жизнеспособные правильные альтернативы.

Чтобы разорвать этот цикл, фреймворк развертывает базовую модель-генератор в рамках структурированной системы верификации. Система объединяет разрешитель разногласий, который проверяет противоречивые утверждения на соответствие имеющимся данным в рабочей среде, с оппонентом консенсуса, предназначенным для проверки общих утверждений. Кроме того, исследователи показали, что эти навыки верификации могут самосовершенствоваться на основе отзывов об ошибках в процессе оценки.

Empirical Performance Across Workspaces

На пяти бенчмарках долгосрочных рабочих пространств и двух передовых моделях VeriHarness достигает самых высоких показателей отбора среди оцениваемых базовых решений. Интеграция доработок, подтвержденных фактическими данными, обеспечивает прирост производительности по сравнению с одиночным запуском на 6,2 балла для Gemini 3.5 Flash и на 6,4 балла для Claude Opus 4.8.

Когда Gemini 3.5 Flash работает одновременно как генератор и верификатор, VeriHarness обеспечивает стабильное улучшение по сравнению с базовыми показателями одиночного запуска во всех пяти бенчмарках. Чтобы создать стандартизированную основу для исследований в области автономной оценки, авторы выпустили датасет, содержащий около 26 000 результатов запусков, созданных при затратах, превышающих $100 000.

Опора на мажоритарное голосование в прогонах агентов порождает опасные слепые зоны в автономных рабочих процессах.

Превращая генератор в активного верификатора, оснащенного инструментами для анализа данных рабочей среды, системы могут разрешать внутренние конфликты и исправлять ошибки без необходимости привлечения человеческих аннотаторов или дорогостоящих внешних судей.

Искусственный интеллектИИ-агентыБольшие языковые моделиGoogle DeepMind