Microsoft выпустила новый внутренний кодекс этики в сфере ИИ, призванный пресекать опасное поведение моделей, а не предаваться долгим философским дискуссиям. Как сообщил редактор TechCrunch Рассел Брандон 14 сентября 2026 года, документ четко сфокусирован на жестких инженерных ограничениях, которые регулируют обучение моделей внутри Microsoft AI. За основу взято базовое предположение, что в течение десятилетия сверхразумные системы превзойдут человеческие возможности по большинству бенчмарков.

Согласно архитектуре Microsoft, общий кодекс поведения имеет приоритет над индивидуальными пользовательскими промптами и инструкциями к задачам. Эта структура устанавливает абсолютные ограничения, прямо запрещающие кибератаки, распространение ядерного оружия или создание синтетических дипфейков.

Инженерные средства защиты от обхода ограничений

Эти внутренние протоколы нацелены непосредственно на методы автономного обхода, которые угрожают административному контролю над развернутыми системами.

"MAI Models will not use adaptive, deceptive, self-reinforcing, collusion, or other mechanisms to evade or defeat human oversight so that they can no longer be reliably directed, modified, or shut down by authorized people or systems."

Этот прямой запрет гарантирует, что надзор на уровне человека и систем остается незыблемым, нейтрализуя попытки внедрения промптов во время выполнения или перехвата целей. Генеральный директор Microsoft Сатья Наделла публично поддержал интеграцию встроенных оценщиков в лаборатории ИИ для практической реализации этих механизмов выравнивания.

Интеграция не подлежащих обсуждению границ прямо в веса моделей быстро становится стандартным подходом для управления ответственностью поставщиков. Задавая эти защитные механизмы на уровне кода, крупные игроки корпоративного рынка пытаются обезопасить себя от будущих операционных и юридических рисков до того, как автономные агенты масштабируются в корпоративной ИТ-инфраструктуре.

Искусственный интеллектБезопасность ИИРегулирование ИИMicrosoft