Разработчику Гийому Мейеру потребовалось ровно четыре часа, чтобы обойти систему невидимых водяных знаков Anthropic для разметки сгенерированного текста. Созданный им инструмент для обхода защиты с открытым исходным кодом мгновенно завирусился на GitHub и в X, собрав более 100 контрибьюторов и свыше 20 000 закладок. Этот релиз превратил потенциальный инструмент комплаенса в публичный провал, наглядно продемонстрировав техническую бессмысленность принудительной маркировки контента от ИИ.

Anthropic поспешила внедрить машиночитаемые метки в продакшен, пытаясь сыграть на опережение перед вступлением в силу европейского Закона об ИИ (EU AI Act). Этот регламент грозит поставщикам базовых моделей штрафами в размере до 3% от годового оборота за несоблюдение требований. «Под капотом» механизм заимствует подход Google SynthID: система незаметно смещает вероятности выбора токенов при генерации, формируя статистический цифровой отпечаток. Специалист по computer science Скотт Ааронсон ранее объяснял, почему OpenAI воздержалась от развертывания схожей криптографической маркировки: она остается крайне уязвимой даже к базовым искажениям и редактированию текста.

Даже по признанию самой Anthropic, технология дает лишь вероятностную оценку того, что к тексту причастна Claude, но при этом выдает ложноположительные срабатывания на совершенно легитимных сценариях — например, при обычной проверке грамматики через Grammarly. Для бизнеса, технических директоров (CTO) и руководителей информационной безопасности (CISO) выводы неутешительны: обязательное внедрение водяных знаков превращается в театр безопасности, который лишь снижает качество генерации в корпоративных пайплайнах и не дает никакой реальной защиты от целенаправленного обхода.

AnthropicБезопасность ИИРегулирование ИИБольшие языковые моделиКибербезопасность