Anthropic в отчёте «How Claude's Text Watermark Works» раскрыла механику маркировки синтетического текста. Как подчеркнул исследователь Себастьян Рашка, речь идёт не об эвристиках, а о математически строгом вотермаркинге и его статистической детекции на стороне провайдера.
Механика сэмплирования и скрытый сид
Языковая модель генерирует ответ последовательно, рассчитывая распределение вероятностей по словарю токенов. «Жадное декодирование» стабильно выбирает вариант с наивысшим баллом, что на длинной дистанции неизбежно приводит к зацикливанию. Поэтому в прод-системах используют вероятностное сэмплирование, где выбор между синонимами вроде overcast (пасмурно) и gray (серо) определяет псевдослучайное число.
Маркировка встраивается непосредственно в фазу сэмплирования без переобучения или изменения архитектуры модели. Вместо чисто случайного генератора система использует детерминированный алгоритм.
В водяном знаке Claude сид формируется детерминированно из секретного ключа и информации о предыдущих словах текста.
Случайность становится псевдослучайностью: модель по-прежнему выбирает правдоподобные токены, сохраняя связность и стиль, но их последовательность подчинена скрытому ключу.
Устойчивость и проверка
Для внешнего наблюдателя текст выглядит неотличимым от органического. Однако владелец секретного ключа может провести статистический Z-тест: детектор прогоняет n-граммы и вычисляет, насколько часто выбор токенов совпадает с детерминированным правилом. Метод сохраняет устойчивость к частичной правке, замене синонимов и ручному перефразированию, пока в тексте остаётся достаточный массив исходных связок.
Главное: Anthropic переводит аудит синтетики с неработающих эвристических классификаторов на строгую криптографическую основу. Для B2B-контура это означает переход к доказуемой фильтрации контента, защите корпоративных баз знаний от скрытого AI-спама и формированию надёжных стандартов комплаенса без потери качества генерации.