Как работают водяные знаки от Claude

С 2 августа 2026 года новые модели Claude поддерживают машинно-читаемую маркировку AI-контента. Anthropic внедряет её в рамках требований европейского регулирования: метка должна позволять определить, что текст был создан или обработан ИИ. При этом речь идёт не о невидимом символе, специальном шрифте или метаданных. Водяной знак встраивается непосредственно в процесс генерации текста.

🔹 Механизм основан на статистике выбора слов. Языковая модель при генерации текста постоянно оценивает множество возможных следующих токенов и их вероятности. Например, после фразы «Погода сегодня была…» возможны продолжения «холодной», «пасмурной», «солнечной» и другие. При маркировке Claude слегка изменяет выбор между такими вариантами по специальному алгоритму.

🔵 Понять принцип можно на примере с монеткой. Представим, что обычная модель при выборе слов как будто подбрасывает монетку: иногда выпадает орёл, иногда решка. Если подбросить её пять раз, никакой закономерности может не быть: орёл — решка — орёл — орёл — решка. Но если сделать 10 тысяч бросков и обнаружить, что орёл выпадает заметно чаще, чем должен, можно предположить, что монетка была «настроена» особым образом.

С текстом происходит нечто похожее. Claude использует секретный алгоритм, который распределяет возможные токены по определённым группам и повышает вероятность выбора нужных вариантов. Один такой выбор незаметен, но после сотен и тысяч решений возникает определённый статистический рисунок. Специальный детектор может проверить текст и определить, соответствует ли его статистика такой маркировке.

🔹 Поэтому водяной знак нельзя убрать обычным копированием, удалением невидимых символов или очисткой метаданных: в тексте нет отдельного «кусочка», являющегося водяным знаком. Он распределён по множеству решений модели. Простая замена нескольких слов может не разрушить статистический сигнал.

Однако говорить, что водяной знак невозможно удалить вообще, было бы неправильно. Глубокое перефразирование или полная переработка текста способна изменить статистику настолько, что исходную метку будет сложнее обнаружить. Поэтому корректнее говорить об устойчивости водяного знака к обычному редактированию, а не о его абсолютной неуничтожимости.

При этом метка показывает прежде всего, что текст был сгенерирован или обработан Claude, а не обязательно доказывает, что весь текст написал ИИ. Например, человек может самостоятельно подготовить материал и использовать Claude только для перевода или редактирования – при обработке чат-бот все равно может пометить результат водяным знаком.

19 views·1 share