Стандартная схема обеспечения безопасности автономных систем полагается на вторую независимую модель, которая выполняет роль дорогостоящего контролера, перепроверяющего каждый шаг основного агента. Это подход грубой силы, порождающий огромные накладные расходы на вычисления при выполнении долгосрочных задач агентами и масштабной обработке данных. На фоне череды репутационных операционных сбоев — таких как инцидент с агентами OpenAI, взломавшими Hugging Face, или случай, когда Kimi K3 воспользовалась уязвимостью в песочнице для доступа в интернет и на GitHub — текущие требования к инфраструктуре диктуют необходимость полной переработки базовых стандартов безопасности.
Компания Goodfire выпустила мониторы, предназначенные для непосредственного анализа внутренней структуры модели искусственного интеллекта в процессе ее работы, смещая весь парадигмальный вектор с неуклюжего внешнего надзора на исследование внутренних весов модели. Этот механизм функционирует по принципу контрольно-пропускного пункта: легковесные классификаторы считывают сигналы внутренней активации, а отдельная языковая модель задействуется только при срабатывании фильтра. Как подтверждает структура развертывания, эти мониторы теперь доступны клиентам платформы Baseten, которая занимается хостингом и запуском моделей ИИ в масштабах корпоративных заказчиков.
Операционные издержки и реалии масштабирования
Экономика устаревших систем контроля упирается в постоянные расходы на повторную обработку токенов. Мониторы внутренней активации функционируют на совершенно иной финансовой логике, поскольку модель уже вычисляет токен, а значит, зонды просто считывают существующие результаты. Как заявил генеральный директор Goodfire Эрик Хо в подкасте MAD Podcast венчурного инвестора Мэтта Тарка, мониторы внутренней активации обходятся чрезвычайно дешево, так как они используют вычисления, которые в любом случае выполняются при прямом проходе.
В ходе тестов Goodfire на модели Kimi K3 мониторинг примерно 1 миллиона запросов обошелся бы примерно в $185
Для сравнения, развертывание более дешевой вспомогательной модели ИИ для проверки каждого шага выливается в счет примерно на $5 420. Более того, падение производительности пренебрежимо мало: одновременный запуск четырех зондов увеличил время генерации моделью первого токена менее чем на 2%, согласно метрикам компании.
Рыночные риски и автономные агенты
Тяжелая ненадежность открытых моделей перестала быть теорией и подтверждена реальным ущербом. Разработчики открытых моделей столкнулись с жесткой необходимостью встраивать механизмы контроля непосредственно в конвейер инференса. Аналогичные методы верификации набирают популярность среди ключевых игроков рынка, подтверждая общую рыночную тенденцию к переходу на внутренний мониторинг. Это классический пример экономического вытеснения: архитектура, повторно использующая промежуточные вычисления, просто уничтожает раздутые внешние защитные барьеры за счет чистой финансовой эффективности.