На фоне лавинообразного роста числа заявок на конференции по искусственному интеллекту процесс научного рецензирования столкнулся с колоссальной нехваткой времени и потерей качества. Хотя большие языковые модели уже тестируются в пилотных проектах для первичного отбора и оценки статей, опыт показывает: ИИ-рецензенты систематически завышают баллы, искажая результаты для пограничных работ. В ответ на это исследователи из Чжэцзянского университета, Наньянского технологического университета и HKUST представили диагностический бенчмарк. Он смещает фокус с простой бинарной точности вердикта на детальный аудит промежуточных цепочек рассуждений.
Формализация цепочки рецензирования
Классические методы оценки рассматривают автоматическое рецензирование как одноэтапное решение или анализируют сгенерированный текст в отрыве от логики. Чтобы проверить, действительно ли модели опираются на факты при вынесении вердикта, консорциум исследователей формализовал весь пайплайн в виде последовательного кортежа: исходный документ (x), структурированное саммари (zs), критический анализ (zc), практические рекомендации (zr) и итоговое решение (y). Для системного аудита разнородные массивы исторических рецензий из баз PeerRead, NLPeer ARR-22 и OpenReview-ICLR были приведены к единому стандартизированному формату.
Бенчмарк сопоставляет работу моделей с базовым сценарием прямого прогнозирования решения по исходному тексту статьи. Система оценивает каждый этап, отслеживает согласованность цепочки и проводит интервенционный анализ чувствительности, сравнивая эталонные переменные рассуждений человека с переменными, сгенерированными моделью.
«Хотя созданные моделью промежуточные тексты рецензий демонстрируют высокую локальную связность на соседних этапах, итоговые решения систематически не подкрепляются предшествующей доказательной базой».
Этот структурный разрыв между гладкими формулировками и финальным вердиктом доказывает: убедительный промежуточный текст часто служит лишь красивым фасадом для галлюцинаций или необоснованных выводов. Эксперименты на трех датасетах с участием шести моделей показали, что человеческая логика рассуждений неизменно обеспечивает более валидные решения, чем сгенерированная ИИ. Причем этот разрыв стабильно сохраняется независимо от архитектуры нейросети и наборов данных.
Что это значит для бизнеса
Для руководителей компаний выводы исследования выходят далеко за рамки академического рецензирования. Внедрение генеративного ИИ в сложные процессы — комплексный аудит (due diligence), комплаенс или многоэтапный анализ контрактов — требует отказа от оценки по поверхностным метрикам и слепой веры в уверенность черного ящика. Поэтапный диагностический аудит становится обязательным архитектурным стандартом: только так можно гарантировать, что промежуточная логика модели действительно обосновывает финальные бизнес-решения и оценку рисков.