Anthropic в отчёте «How Claude's Text Watermark Works» раскрыла механику маркировки синтетического текста. Как подчеркнул исследователь Себастьян Рашка, речь идёт не об эвристиках, а о математически строгом вотермаркинге и его статистической детекции на стороне провайдера.

Механика сэмплирования и скрытый сид

Языковая модель генерирует ответ последовательно, рассчитывая распределение вероятностей по словарю токенов. «Жадное декодирование» стабильно выбирает вариант с наивысшим баллом, что на длинной дистанции неизбежно приводит к зацикливанию. Поэтому в прод-системах используют вероятностное сэмплирование, где выбор между синонимами вроде overcast (пасмурно) и gray (серо) определяет псевдослучайное число.

Маркировка встраивается непосредственно в фазу сэмплирования без переобучения или изменения архитектуры модели. Вместо чисто случайного генератора система использует детерминированный алгоритм.

В водяном знаке Claude сид формируется детерминированно из секретного ключа и информации о предыдущих словах текста.

Случайность становится псевдослучайностью: модель по-прежнему выбирает правдоподобные токены, сохраняя связность и стиль, но их последовательность подчинена скрытому ключу.

Устойчивость и проверка

Для внешнего наблюдателя текст выглядит неотличимым от органического. Однако владелец секретного ключа может провести статистический Z-тест: детектор прогоняет n-граммы и вычисляет, насколько часто выбор токенов совпадает с детерминированным правилом. Метод сохраняет устойчивость к частичной правке, замене синонимов и ручному перефразированию, пока в тексте остаётся достаточный массив исходных связок.

Главное: Anthropic переводит аудит синтетики с неработающих эвристических классификаторов на строгую криптографическую основу. Для B2B-контура это означает переход к доказуемой фильтрации контента, защите корпоративных баз знаний от скрытого AI-спама и формированию надёжных стандартов комплаенса без потери качества генерации.

AnthropicБезопасность ИИБольшие языковые моделиГенеративный ИИИИ в бизнесе