Модификация моделей с открытыми весами для полного отключения защитных ограничений официально переросла уровень самодельных скриптов на GitHub и превратилась в коммерческую облачную инфраструктуру. Американский стартап Abliteration.ai сделал бизнес на хирургии весов: компания удаляет механизмы цензуры из базовых моделей вроде GLM-5.3 и продает доступ к генерации без фильтров через коммерческий API.
Модификация весов как готовый облачный сервис
В конце августа Abliteration.ai представил abliterated-model-large-v2 — модифицированную версию модели GLM-5.3 от Z.AI, настроенную на систематический обход стандартных триггеров безопасности. Вместо нестабильных текстовых джейлбрейков стартап изолирует внутренние векторы активации, отвечающие за отказы отвечать, и напрямую переписывает веса модели, заглушая эти сигналы.
Стартап находит внутренние паттерны активации, вызывающие отказ модели, и меняет веса напрямую.
Такое точечное вмешательство сохраняет исходные способности модели к рассуждению и решению технических задач. Согласно внутренним тестам модифицированной GLM-5.3, Abliteration.ai зафиксировал 84,5% в бенчмарке CyberGym, 41,8% в Terminal-Bench 4.0 и 105 решенных задач ExploitGym за двухчасовой тестовый запуск. Этот эндпоинт заменил предыдущую сборку abliterated-model-large на базе GLM-5.2.
Экономика и риски двойного назначения
Сервис позиционируют как легальный инструмент для корпоративных клиентов: специалистов по наступательной кибербезопасности, редтимеров и исследователей надежности ИИ, которым нужны ответы без ограничений без необходимости арендовать собственные GPU-кластеры. Однако, упаковав неоткалиброванные модели в формат API по подписке, стартап фактически превратил генерацию эксплойтов и анализ вредоносного ПО в доступную массовую услугу для любого владельца API-ключа.
Подобная коммерциализация разрушает представление о базовой безопасности открытых моделей. Когда выравнивание безопасности можно навсегда вырезать и масштабируемо перепродавать, встроенные защитные барьеры теряют всякую ценность для корпоративного комплаенса. Для регуляторов и разработчиков моделей это означает крах идеи контроля на входе: если открытые веса можно превратить в облачное оружие за считаные дни после релиза, возлагать ответственность за последствия на первоначального создателя модели становится бессмысленно.