Anthropic раскрыла детали работы водяных знаков в текстах, созданных Claude

Автор: Владимир Стецюк, сегодня, 02:01

Anthropic рассказала, как будут работать водяные знаки в текстах, созданных чат-ботом Claude. Компания объяснила принцип маркировки, возможность его удаления при редактировании и особенности применения технологии к программному коду.

Что известно

Водяной знак будет формироваться через выбор слов и формулировок в процессе генерации ответа. Например, когда для описания одного и того же явления можно использовать несколько вариантов слов, модель будет выбирать по определённому шаблону. Это будет незаметно для читателя, но его можно будет обнаружить с помощью специального ключа.

Anthropic будет использовать подход SynthID-Text, который в 2024 году описала команда Google DeepMind. Компания также планирует выпустить API для обнаружения водяных знаков.

Маркировку можно удалить полным переписыванием текста, когда заменяются все слова. Согласно данным Anthropic, при незначительном редактировании водяной знак может оставаться. Если Claude только проверяет или незначительно редактирует текст, написанный человеком, маркировка будет зависеть от длины текста и объёма внесённых моделью изменений.

Для программного кода водяной знак будет менее выраженным, так как модель имеет ограниченные возможности для выбора между различными вариантами, если код должен выполнять конкретную задачу. В то же время технологию можно применять к комментариям и другим частям кода, где возможен выбор между разными словами.

Anthropic сообщила, что водяные знаки будут внедрять не только для Claude. Другие крупные разработчики моделей также подписали соответствующий кодекс практики ЕС и планируют использовать собственные системы маркировки ИИ-контента.

Источник: Anthropic