10 августа из-за новых требований Евросоюза в Anthropic обновили правила, по которым Claude помечает контент, сгенерированный ИИ. Они распространяются на все ИИ-модели, которые будут запущены после 2 августа. Теперь в компании разъяснили, как именно устроен водяной знак в текстах Claude.
Суть маркировки текста в том, чтобы создать определённый шаблон, который незаметен обычному пользователю, но его можно распознать при наличии ключа.
«LLM генерируют по одному слову за раз. Каждый раз, когда модель выбирает следующее слово, она выбирает из списка потенциальных кандидатов, в конечном итоге останавливаясь на наиболее разумном или вероятном варианте <...> [обычно] выбор определяется случайным числом. Водяные знаки используются, [чтобы] создать в ответах Claude определённый шаблон»— Anthropic
При выборе следующего слова Claude будет полагаться не на случайность, а на информацию в ключе. Из-за этого и получается шаблонная последовательность токенов, которую можно распознать.
В основе системы лежит SynthID-Text — метод который Google использует с 2024 года. Компания тестировала, влияет ли маркировка на качество ответов ИИ, раздав части пользователей Gemini модель с водяным знаком: по статистике, в основном пользователи не замечали разницы.
В Anthropic отмечают, что водяные знаки не влияют на качество работы Claude. Для читателя ответ с водяным знаком неотличим от ответа без него. Нет в том числе и скрытых символов, поэтому нанесение маркировки не требует дополнительных токенов и не влечёт лишние затраты.
Кроме того, в компании обращают внимание, что водяные знаки не содержат никакой идентифицирующей информации и не позволяют отследить конкретного человека, организацию или чат.
При этом для работы с кодом у Claude другие правила: когда выбор стоит между выдачей единственного правильного ответа и созданием шаблона, ИИ выбирает первый вариант.
«В случаях, когда требуется точный результат — когда выбора нет, и выбор другого термина привёл бы к фактической ошибке или поломке кода — водяной знак не применяется»— Anthropic
Пока у Anthropic нет ИИ-моделей, соблюдающих новые правила. Все имеющиеся модели вышли ещё до 2 августа. API для обнаружения водяных знаков пока находится в работе.