Публичные бенчмарки искусственного интеллекта во многом превратились в театр. По мере того как обучающие выборки масштаба всего интернета агрессивно поглощают тестовые наборы данных, публикуемые метрики эффективности все чаще отражают механическое заучивание, а не способность рассуждать. Для руководителей компаний, выбирающих проприетарные модели для критически важных бизнес-процессов, стандартные лидерборды поставщиков потеряли практический смысл. Это вынуждает бизнес тратить ресурсы на дорогостоящее внутреннее тестирование.

Дилемма загрязнения данных

Внешний аудит моделей долгое время упирался в неразрешимый структурный барьер. Независимым экспертам приходилось передавать закрытые тестовые промпты напрямую разработчикам ИИ, из-за чего эти данные неизбежно попадали в следующие итерации обучения. В качестве альтернативы разработчики должны были передавать исходные веса моделей сторонним аудиторам, что создавало неприемлемый риск утечки ключевой интеллектуальной собственности. Соглашения о неразглашении (NDA) и обещания не сохранять логи давали лишь формальное юридическое утешение, но не обеспечивали криптографических гарантий.

Google совместно с Сингапурским институтом безопасности ИИ, OpenMined, AVERI и консорциумом MLCommons протестировал протокол двойного слепого тестирования с аппаратной защитой, чтобы выйти из этого тупика. В рамках пилота модель Gemini Flash Lite проверили на конфиденциальных бенчмарках безопасности.

«Исторически масштабные внешние оценки требовали компромисса. Либо аудиторы передавали свои тестовые задания (рискуя тем, что разработчик увидит вопросы заранее), либо поставщик модели передавал ее веса (рискуя интеллектуальной собственностью)».

Предложенная архитектура гарантирует, что разработчики моделей не смогут подсмотреть закрытые наборы вопросов для искусственного завышения баллов, а внешние эксперты получат возможность проводить глубокий аудит без риска раскрытия архитектуры поставщика.

Криптографическая изоляция через Confidential Space

В пилотном проекте используется Confidential Space — аппаратно изолированный вычислительный анклав Google Cloud. Рабочий процесс устроен как автоматизированная чистая комната: модель поставщика и тестовый пакет аудитора загружаются строго в зашифрованном виде, расшифровываются исключительно в оперативной памяти на время исполнения и бесследно удаляются сразу после завершения тестов.

За пределы защищенного анклава передается только итоговая подтвержденная оценка производительности. Разработчик никогда не видит проверочные промпты, аудитор не получает доступа к весам модели, а тестовые вопросы не попадают в постоянное хранилище, откуда их могли бы извлечь парсеры или циклы переобучения.

Для корпоративных закупок переход от юридических договоренностей к криптографически защищенному слепому тестированию формирует стандарт независимого комплаенса. Вместо того чтобы тратить бюджеты и кварталы работы инженеров на создание собственных систем валидации для отсева накрученных результатов, бизнес сможет опираться на независимый аудит с проверяемым суверенитетом данных для обеих сторон.

Большие языковые моделиБезопасность ИИОблачные вычисленияИИ в бизнесеGoogle DeepMind