Публичные лидерборды долгое время служили главным ориентиром для корпоративных закупок и выбора архитектуры ИИ. Однако общие сводные баллы регулярно маскируют реальные эксплуатационные характеристики моделей. Исследователи из Института искусственного интеллекта Аллена (Ai2) представили BenchMIRT — систему аудита, созданную для анализа бенчмарков языковых моделей на уровне отдельных промптов. Она выявляет скрытые сопутствующие факторы, искажающие популярные тесты на безопасность и логику.

Поиск скрытых переменных в тестовых датасетах

BenchMIRT заимствует из психометрики многомерную теорию моделирования и параметризации тестов (MIRT), чтобы одновременно оценивать и тестовые задания, и ответы моделей. Как отмечает технологический обозреватель Кайл Виггерс, стандартные наборы тестов сжимают разнородные когнитивные навыки в обманчивые обобщенные цифры. Проверка результатов 100 языковых моделей на 16 стандартных бенчмарках и более чем 34 000 вопросов выявила систематические искажения в общепринятых рейтингах.

Показателен пример датасета BBQ (Bias Benchmark for QA), который повсеместно применяют для измерения социальной предвзятости и токсичности. Анализ через BenchMIRT показал, что отдельные задания часто тестируют совершенно посторонние навыки, а не наличие предвзятости.

«Бенчмарк обычно проектируют для проверки конкретного навыка — например, безопасности, общего логического мышления или следования инструкциям. Однако отдельные задачи внутри него могут зависеть от факторов, выходящих за рамки заявленной цели».

В одном из тестовых сценариев дедушка и внук пытаются вызвать Uber — промпт формально проверяет модель на эйджизм. На деле же для правильного ответа требуется отслеживать сущности внутри контекстного окна и выводить логические связи из заданных предпосылок. Если LLM ошибается, общие метрики штрафуют ее за нарушение безопасности, хотя модель всего лишь сбилась в контекстной логике.

Разрыв между безопасностью и ложными отказами

Аналогичное искажение подрывает бенчмарки безопасности вроде WildJailbreak. Если вредоносные промпты действительно проверяют защитные барьеры, то безобидные калибровочные запросы измеряют следование инструкциям и общее рассуждение. Сведение этих параметров в единую метрику скрывает суть: одна модель может строго соблюдать политики этичности, а другая — просто отклонять запрос из-за непонимания сложного синтаксиса.

Для бизнеса слепое доверие публичным лидербордам превращается в дорогую ошибку. Покупка лицензий на базовые модели за миллионы долларов на основе синтетических рейтингов чревата внедрением неподходящей архитектуры. Пока публичные тесты не очистят от скрытых переменных, компаниям стоит отказаться от общих лидербордов в пользу собственных конвейеров валидации под реальные рабочие нагрузки.

Большие языковые моделиИИ в бизнесеБезопасность ИИМашинное обучение