Anthropic превращает подтверждение происхождения сгенерированного контента в базовую платформенную инфраструктуру. Компания готовит API для обнаружения водяных знаков, который позволит сторонним инженерам проверять тексты Claude напрямую по шаблонам декодирования модели. Вместо сторонних эвристических сканеров вроде Pangram, которые лишь угадывают происхождение текста по типичным формулировкам и энтропии словарного запаса без доступа к весам или сидам, Anthropic внедряет криптографическую схему. Архитектура адаптирует фреймворк SynthID Text от Google DeepMind, описанный в Nature в 2024 году, прямо в стек генерации Claude. Механизм смещает псевдослучайную выборку при отборе токенов, встраивая детерминированную статистическую сигнатуру непосредственно в последовательность.

По заявлению Anthropic, такое смещение выборки не снижает качество генерации или точность формулировок.

Водяной знак корректирует источник случайности при выборе слов, формируя отслеживаемый паттерн без какого-либо влияния «на содержание, уровень креативности или читаемость текста Claude».

Этот шаг уводит корпоративный комплаенс от сторонних вероятностных догадок и привязывает верификацию напрямую к логам декодирования на стороне провайдера, создавая структурированную базу для регуляторного аудита.

Архитектурные слепые зоны и технические ограничения

Новый API детекции служит уровнем атрибуции, а не неуязвимым криминалистическим инструментом. Anthropic открыто обозначила пограничные случаи, в которых устойчивость водяного знака падает. Статистическая сигнатура требует достаточного уровня энтропии: на коротких промптах, фактологических выжимках с ограниченным лексиконом и детерминированных фрагментах кода водяной знак либо сильно деградирует, либо вовсе не считывается. Кроме того, ручная правка человеком размывает статистический паттерн, тогда как полный перевод его сохраняет, поскольку Claude выбирает каждый токен в итоговой последовательности. Как отмечается в документации для разработчиков, агрессивный рерайт текста с помощью других моделей полностью стирает метку.

Атрибуция также остается строго асимметричной. API может подтвердить, что Claude участвовал в составлении фрагмента, но не способен измерить точную долю между полной генерацией и совместным редактированием. Инструмент также не отличит неразмеченный текст человека от генерации конкурирующей передовой модели. Для файлов и артефактов Anthropic дополняет токенизацию открытым стандартом C2PA, прикрепляя криптографические метаданные без изменения самого содержимого файла.

Глобальный запуск под давлением закона ЕС об ИИ

Архитектурное внедрение технологии ускорено нормативными требованиями европейского Закона об ИИ (EU AI Act). Наряду с примерно 190 подписантами Anthropic взяла на себя обязательства по Кодексу прозрачности синтетического контента ЕС. Поскольку современная инфраструктура инференса не позволяет надежно разделять механизмы выборки токенов по географии пользователей без резкого роста задержек и фрагментации маршрутизации, Anthropic развертывает маркировку глобально. Все модели Claude, выпущенные после 2 августа 2025 года, поддерживают протокол водяных знаков нативно, а для устаревших версий запланирована обратная интеграция.

Техническим руководителям в корпоративном секторе стоит пересмотреть внутренние пайплайны верификации уже сейчас: будущий API обнаружения следует воспринимать как маркер атрибуции, а не как однозначный бинарный вердикт об авторстве для коротких фрагментов или переписанного программного кода.

AnthropicGoogle DeepMindГенеративный ИИРегулирование ИИБезопасность ИИ