Anthropic внедряет скрытые водяные знаки в текст моделей
з@ctodailyмедиа / агрегатор
2 недAnthropic начала использовать лингвистическую стеганографию для маркировки сгенерированного текста, следуя трендам индустрии и требованиям ЕС.
Это меняет способы проверки подлинности контента в интернете.
- Позволяет компаниям доказывать, что текст написан нейросетью, а не человеком.
- Усложняет использование ИИ для создания незаметного фейкового контента.
- Подготовка к обязательному регулированию ИИ в Евросоюзе к 2026 году.
Модели Anthropic начали вшивать в текст секретные водяные знаки.
Текст можно переписать огромным числом вариантов, просто меняя синонимы. Теперь, модели выбирают эти синонимы не случайно, и в последовательности этих не-случайностей зашит сигнал, что текст сгенерирован нейросетью.
Лингвистическую стеганографию (тайное письмо за счет замены синонимов) обсуждали ещё в начале 2000-х, но в 2022 ученый из OpenAI описал, как это можно недорого сделать в нейросетях.
Такая маркировка начинает работать примерно со 150 слов, и не работает, если у модели недостаточно свободы в выборе синонимов — при генерации кода или таблиц с цифрами. Водяной знак переживает незначительную редактуру текста, но не серьезный рерайт.
В 2024 такую маркировку вшил в свои модели Гугл под названием SynthID, а закон ЕС требует маркировать контент, сгенерированный нейросетями, начиная со 2 августа 2026. 190 компаний уже подписали с Евросоюзом договор, как именно они будут реализовывать эту маркировку.
Интересно, для детектирования маркировки нужно знать секретный ключ (если все знают ключ — то маркировку очень легко стереть или подделать). То есть для проверки нужно будет загрузить свой текст производителю модели.
Кратко (AI)
Anthropic начала внедрять в свои модели скрытые водяные знаки через лингвистическую стеганографию, выбирая определенные синонимы для формирования сигнала. Метод эффективен для текстов от 150 слов, но уязвим к серьезному рерайту. Технология соответствует будущим требованиям ЕС по маркировке ИИ-контента.
Обсуждение
2тут прикол не в самой маркировке, а в том что проверка требует доверия к держателю ключа. то есть если хочешь узнать, генерил ли текст нейросеть, ты грузишь его в Anthropic или Google и веришь им на слово. по сути к 2026 они станут теми, кто решает, подлинный текст или нет, во всем интернете сразу
а кому вообще было не очевидно, чем это кончится, когда решили ключ прятать. по факту детекция теперь услуга от тех же, кто эти знаки ставит, и без вариантов, других способов проверить просто не будет.