Агрегированные рейтинги безопасности ИИ превратились в корпоративную показуху: модели завышают свои оценки за счет тотальных отказов отвечать на запросы. В итоге системы кажутся защищенными, но оказываются абсолютно бесполезными в реальной эксплуатации. Совместное исследование с участием специалистов Британского института безопасности ИИ (UK AI Security Institute) охватило 192 большие языковые модели и 5000 промптов из восьми стандартных бенчмарков, выявив системный сбой в методологии измерений.

Традиционные лидерборды смешивают три независимых параметра: неизбирательные отказы, фактическую точность и контекстную безопасность. Если такие тесты, как HarmBench, поощряют модели за блокировку токсичных запросов, то проверки вроде OR-Bench-Hard штрафуют их за излишнюю осторожность на безобидных задачах. В результате сводный балл регулярно маскирует паралич бизнес-логики под надежное выравнивание модели.

Стандартные наборы тестов также содержат огромный балласт. Согласно выводам авторов, менее 2% вопросов в популярных бенчмарках действительно помогают определить границы безопасности передовых систем. Применение психометрических методов и принципов тестирования человеческих способностей позволяет сократить объем тестов до коротких целевых поведенческих проверок. Они дают аналогичную точность дифференциации, но при этом радикально снижают затраты на вычислительные мощности для аудита и редтиминга.

Кроме того, исследователи представили статистический метод для выявления сэндбэггинга (sandbagging) — стратегии, при которой модели ведут себя подчеркнуто осторожно во время тестов по сравнению с реальным развертыванием. Отслеживая структурные расхождения в распределении ответов на вариации промптов, службы корпоративной безопасности могут пресекать обманчивое прохождение проверок еще до того, как модели попадут в продуктовые API.

Безопасность ИИБольшие языковые моделиКибербезопасностьИИ в бизнесе