Anthropic розкрила деталі роботи водяних знаків у текстах, створених Claude

Автор: Володимир Стецюк | сьогодні, 02:01

Anthropic розповіла, як працюватимуть водяні знаки у текстах, створених чат-ботом Claude. Компанія пояснила принцип маркування, можливість його видалення під час редагування та особливості застосування технології до програмного коду.

Що відомо

Водяний знак формуватиметься через вибір слів і формулювань під час генерації відповіді. Наприклад, коли для опису однакового явища можна використати кілька варіантів слів, модель робитиме вибір за певним шаблоном. Він буде непомітним для читача, але його можна буде виявити за допомогою спеціального ключа.

Anthropic використовуватиме підхід SynthID-Text, який у 2024 році описала команда Google DeepMind. Компанія також планує випустити API для виявлення водяних знаків.

Маркування можна видалити повним переписуванням тексту, коли замінюються всі слова. За даними Anthropic, під час незначного редагування водяний знак може залишатися. Якщо Claude лише перевіряє або незначно редагує текст, написаний людиною, маркування залежатиме від довжини тексту та обсягу внесених моделлю змін.

Для програмного коду водяний знак буде менш вираженим, оскільки модель має обмежені можливості для вибору між різними варіантами, якщо код повинен виконувати конкретне завдання. Водночас технологію можна застосовувати до коментарів та інших частин коду, де можливий вибір між різними словами.

Anthropic повідомила, що водяні знаки впроваджуватимуть не лише для Claude. Інші великі розробники моделей також підписали відповідний кодекс практики ЄС та планують використовувати власні системи маркування ШІ-контенту.

Джерело: Anthropic