Как работают невидимые водяные знаки ИИ: глубокий разбор технологии

Computerphile 87 тыс. 31 мин 3 мин 03.09.2026
Главное

💧 Как работают водяные знаки ИИ: глубокий разбор технологии 0:00

Технология водяных знаков для искусственного интеллекта становится обязательным стандартом в мировой практике. В Европейском союзе уже приняты законы, обязывающие разработчиков ИИ-систем внедрять невидимые маркеры в генерируемый контент []. Подобные меры призваны упростить обнаружение сгенерированного материала независимо от того, идет ли речь о коде, стихах или аналитических текстах [].

🔍 Базовые принципы и эволюция подходов 2:38

В основе работы больших языковых моделей лежит прогнозирование следующего токена (слова или части слова) на основе контекста. Например, в классической фразе «кот сидел на…» модель оценивает вероятности: с вероятностью 70% следующим словом будет «мат» (коврик), с меньшей — «стул» или «диван».

Ранние методы водяных знаков использовали жесткое разделение возможных вариантов на «красные» и «зеленые» списки.

Современные продвинутые системы используют более изящные математические алгоритмы, сохраняющие исходные вероятности модели неизменными даже при внедрении скрытого маркера.

🛡️ Турнирный метод отбора токенов 7:57

Чтобы не искажать статистику языковой модели, разработчики применяют многоуровневый процедурный отбор, который Майк Паунд метафорично описывает как «средневековый турнир» между токенами.

  1. Контекст и хеширование: Для каждого шага генерации берется небольшой контекст (например, предыдущие 4 токена) и секретный ключ разработчика.
  2. Генерация очков: С помощью псевдослучайной хеш-функции кандидаты на следующий токен получают двоичные оценки («нули» и «единицы»).
  3. Микроматчи: Токены попарно соревнуются между собой в серии раундов, где «очки» выступают аналогом боевых преимуществ.
  4. Сохранение вероятностей: Если у какого-то слова вероятность выпадения изначально составляла 100%, оно побеждает во всех раундах автоматически, не нарушая логику текста.

🕵️ Как работает детектирование водяных знаков 13:26

Процесс проверки текста не требует доступа ко всем промежуточным вариантам, которые рассматривала модель при генерации.

💻 Особенности применения для разных типов контента

Эффективность водяных знаков напрямую зависит от энтропии — степени свободы выбора слов в тексте.

⚠️ Уязвимости и методы обхода защиты

Система не является абсолютно несокрушимой. Если злоумышленник намеренно стремится стереть маркер, у него есть несколько путей:

Тем не менее, по мнению эксперта, для массового неструктурированного потока контента подобные алгоритмы представляют собой крайне мощный и работающий барьер.

💬 Цитаты

«В EU приняли законы, что ИИ-компании должны водяными знаками метить свой вывод, чтобы его можно было обнаружить.»

Майк Паунд 00:13

«Идея в том, что для нас это выглядит как обычное предложение, но позже детектор может это обнаружить.»

Майк Паунд 03:31

«Если вы посмотрите на средний G-score по всем раундам турнира, он составляет 0.4964, что практически равно 0.5.»

Майк Паунд 24:59
👥 Спикеры
🔗 Упомянутые сайты и проекты
📖 Термины
Токен
Минимальная единица текста (слово или часть слова), с которой работает языковая модель.
Энтропия
Мера неопределенности или свободы выбора следующего токена в тексте.
G-score
Числовой показатель, рассчитываемый турнирным алгоритмом для оценки токенов при детектировании водяных знаков.
📊 Цифры
⚖️ Другая сторона
Искусственный интеллект SynthID Computerphile Майк Паунд большие языковые модели водяные знаки ИИ