Anthropic внедряет водяные знаки в сгенерированный контент
D@data_secretsAI-инженер
2 недAnthropic начинает маркировать сгенерированный текст в соответствии с AI Act ЕС. Разбираемся, как работают водяные знаки и почему они пока неэффективны.
Это первый шаг к глобальной стандартизации идентификации ИИ-контента, который в будущем изменит правила проверки подлинности информации.
- Пользователи и компании должны учитывать, что сгенерированный ИИ текст теперь может содержать скрытые маркеры.
- Технология водяных знаков пока уязвима к редактированию, что ограничивает её эффективность как инструмента верификации.
- Соответствие требованиям ЕС становится обязательным условием для работы крупных ИИ-компаний на глобальном рынке.
Теперь Anthropic будет метить весь сгенерированный текст. Разбираемся, как это работает.
Стартап подписал Кодекс поведения по прозрачности ИИ-контента в рамках Европейского AI Act. Он вступил в силу 2 августа, и с этого момента провайдеры и деплоеры ИИ-систем, которые выходят в ЕС, обязаны встраивать водяные знаки в сгенерированный текст и файлы.
Собственно, антропики только что обновили документацию по этому поводу: https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content.
Несмотря на то, что это закон ЕС, маркировка будет применяться глобально. Однако это не значит, что прямо с сегодняшнего дня весь ваш текст от моделей Claude будет помечен.
Во-первых, поддерживать маркировку сразу с запуска должны только модели, которые вышли после 2 августа. Для остальных моделей закон предусматривает переходный период в 4 месяца, и у Anthropic старые модели тоже пока остаются без вотерок (в документации написано, что они "работают над добавлением фичи", но сроков нет).
Во-вторых, пока что маркировку не сможет прочитать вообще никто, кроме самих антропиков. Пока что не существует общедоступного инструмента, в который можно вставить текст с вотермаркой и получить ответ типа "да, это Claude" или "нет, не Claude". Стартап обещает выпустить такие инструменты и документацию, но сроков, опять же, нет. Так что еще какое-то время эти метки будут чистой формальностью.
В-третьих, эти метки исчезают, если текст немного отредактировать. Тут надо понимать, как вотермарка в принципе прячется в тексте. На каждом шаге генерации модель по секретному ключу и предыдущим токенам делит словарь на "предпочтительные" и обычные токены, и слегка склоняется в сторону первых там, где это не портит текст. В результате в тексте накапливается статистический паттерн, невидимый на глаз. Детектор с тем же ключом проверяет текст на этот паттерн и по частоте совпадений судит, сгенерирован ли он моделью. Поэтому если вы подредактируете текст, смешаете его с другим текстом, или он, например, будет коротким, статистический паттерн перестанет быть надежно обнаружимым.
(Для файлов это работает немного иначе: там просто встраиваются соответствующие C2PA-метаданные).
Честно говоря, большого смысла в таких пометках пока не видно. Технически интересно, юридически обязательно, но как решение исходной проблемы – довольно дыряво.

КонтекстAI
AI Act — это масштабный пакет законодательных актов Европейского союза, регулирующий использование искусственного интеллекта. Он накладывает строгие требования на разработчиков ИИ-систем в части прозрачности, включая обязательную маркировку контента, созданного нейросетями, для борьбы с дезинформацией.
Кратко (AI)
Компания Anthropic начала внедрять водяные знаки в текст, генерируемый моделями Claude, чтобы соответствовать требованиям европейского закона AI Act. Маркировка основана на статистических паттернах выбора токенов, которые легко нарушаются при редактировании текста. На данный момент инструменты для проверки этих меток отсутствуют, а сама система носит скорее формальный юридический характер.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖