# Как работают невидимые водяные знаки ИИ: глубокий разбор технологии

Источник: https://www.youtube.com/watch?v=kVXp6UNVPTo
Канал: Computerphile
Опубликовано: 03.09.2026

---

## 💧 Как работают водяные знаки ИИ: глубокий разбор технологии

[[JUMP:0:00]]

Технология водяных знаков для искусственного интеллекта становится обязательным стандартом в мировой практике. В Европейском союзе уже приняты законы, обязывающие разработчиков ИИ-систем внедрять невидимые маркеры в генерируемый контент []. Подобные меры призваны упростить обнаружение сгенерированного материала независимо от того, идет ли речь о коде, стихах или аналитических текстах [].

### 🔍 Базовые принципы и эволюция подходов

[[JUMP:2:38]]

В основе работы больших языковых моделей лежит прогнозирование следующего токена (слова или части слова) на основе контекста. Например, в классической фразе «кот сидел на…» модель оценивает вероятности: с вероятностью 70% следующим словом будет «мат» (коврик), с меньшей — «стул» или «диван». 

Ранние методы водяных знаков использовали жесткое разделение возможных вариантов на «красные» и «зеленые» списки. 

* Модель принудительно подталкивали выбирать слова из разрешенной категории.
* Главным недостатком такого подхода была сильная дисторсия (искажение) исходного распределения вероятностей.
* Текст начинал деградировать, теряя естественность.

Современные продвинутые системы используют более изящные математические алгоритмы, сохраняющие исходные вероятности модели неизменными даже при внедрении скрытого маркера.

### 🛡️ Турнирный метод отбора токенов

[[JUMP:7:57]]

Чтобы не искажать статистику языковой модели, разработчики применяют многоуровневый процедурный отбор, который Майк Паунд метафорично описывает как «средневековый турнир» между токенами. 

1. **Контекст и хеширование**: Для каждого шага генерации берется небольшой контекст (например, предыдущие 4 токена) и секретный ключ разработчика.
2. **Генерация очков**: С помощью псевдослучайной хеш-функции кандидаты на следующий токен получают двоичные оценки («нули» и «единицы»).
3. **Микроматчи**: Токены попарно соревнуются между собой в серии раундов, где «очки» выступают аналогом боевых преимуществ.
4. **Сохранение вероятностей**: Если у какого-то слова вероятность выпадения изначально составляла 100%, оно побеждает во всех раундах автоматически, не нарушая логику текста.

### 🕵️ Как работает детектирование водяных знаков

[[JUMP:13:26]]

Процесс проверки текста не требует доступа ко всем промежуточным вариантам, которые рассматривала модель при генерации. 

* **Ретроспективный анализ**: Проверяющий использует секретный ключ компании (например, Anthropic или Google) для пересчета турнирных очков ( G-scores) по уже готовому тексту.
* **Статистическое отклонение**: В обычном человеческом тексте среднее значение набранных «единиц» стремится ровно к 0.5 (случайное распределение).
* **Сигнал ИИ**: Текст, созданный с водяным знаком, демонстрирует устойчивый тренд в сторону повышения среднего балла (например, 0.51 или выше).
* **Пороговые значения**: Как отмечает Майк Паунд, для надежного статистического подтверждения требуется достаточный объем текста — обычно закон ЕС не требует проверки на фрагментах короче 200 токенов из-за высокой погрешности.

### 💻 Особенности применения для разных типов контента

Эффективность водяных знаков напрямую зависит от энтропии — степени свободы выбора слов в тексте.

* **Эссе и художественные истории**: Обладают высокой энтропией (много вариантов синонимов), поэтому водяной знак обнаруживается с высокой точностью и уверенным $p$-value.
* **Программный код**: Имеет низкую энтропию из-за жестких синтаксических требований языков программирования (обязательные точки с запятой, ключевые слова). Водяной знак в коде распределяется преимущественно по комментариям и именам переменных, из-за чего его значительно проще случайно или намеренно повредить при редактировании.

### ⚠️ Уязвимости и методы обхода защиты

Система не является абсолютно несокрушимой. Если злоумышленник намеренно стремится стереть маркер, у него есть несколько путей:

* **Ручное или автоматическое переписывание**: Изменение каждого третьего-четвертого слова в предложении полностью ломает локальный контекст из 4 токенов, обнуляя статистический сигнал.
* **Использование эмодзи-прослоек**: Популярный трюк, когда модель просят вставлять смайлики между каждым словом, а затем удаляют их вручную, разрушает привязку хеш-функции к контексту.
* **Локальные 오픈소스 модели**: Запуск немодерируемых моделей на собственном железе позволяет полностью исключить внедрение корпоративных водяных знаков.

Тем не менее, по мнению эксперта, для массового неструктурированного потока контента подобные алгоритмы представляют собой крайне мощный и работающий барьер.