Опубликованный на Hugging Face форк наглядно доказывает: точечная посттренировочная абляция способна полностью нейтрализовать защитные ограничения открытых моделей без ущерба для их логических способностей. Разработчик под ником trohrbaugh представил модель trohrbaugh/Qwen3.8-27B-heretic-ara, в которой применил метод произвольно-ранговой абляции (Arbitrary-Rank Ablation, ARA) на базе модифицированного фреймворка Heretic v1.2.0, чтобы полностью устранить отказы отвечать на запросы. В результате показатель отказов упал с исходных 99 из 100 до абсолютного нуля по стандартным бенчмаркам безопасности.

Что критически важно, эта модификация практически не затронула базовую производительность модели. Согласно телеметрии репозитория, дивергенция Кульбака — Лейблера относительно исходных весов составила символические 0,0535. Вместо грубого дообучения (fine-tuning) метод ARA хирургически воздействовал на внутренние слои с 26-го по 56-й, используя выверенные коэффициенты: вес 0,9432 для сохранения целевого поведения, 0,0009 для подавления нежелательных паттернов и 0,5038 для относительной гиперкоррекции при 10 соседних узлах. Полученный чекпоинт на 27 млрд параметров сохраняет полную совместимость с популярными средами инференса, включая vLLM, SGLang, TokenSpeed и Hugging Face Transformers.

Для руководителей корпоративной инфраструктуры и ИИ-архитекторов вывод очевиден: встроенные ограничения безопасности в моделях с открытыми весами носят исключительно косметический характер и легко обратимы, как только модель покидает серверы разработчика. Методы высокоточной постобработки позволяют локально отключать любые фильтры вендоров без потери функциональности, подтверждая факт: навязанные создателями правила безопасности не работают при самостоятельном хостинге моделей.

Большие языковые моделиОпенсорс ИИБезопасность ИИЛокальный ИИHugging Face