Стэнфорд CME295: Как работают трансформеры от Word2vec до внимания

Stanford Online 107 тыс. 1 ч 44 мин 4 мин 28.09.2026
Главное

Эта лекция открывает курс CME 295 в Стэнфордском университете, посвященный архитектуре трансформеров и большим языковым моделям (LLM). Преподаватели Афшин Амиди и Шервин Амиди, имеющие опыт работы в Uber, Google и Netflix, представляют глубокий технический разбор механизмов, которые легли в основу современной революции искусственного интеллекта, начиная с фундаментальной работы 2017 года «Attention is All You Need».

🎓 Введение в курс и эволюция NLP 0:00

Курс CME 295 нацелен на широкую аудиторию: от будущих ученых-исследователей до разработчиков, создающих персональные проекты с использованием ИИ-агентов . Афшин Амиди подчеркивает важность «ИИ-грамотности» (AI literacy) для любого специалиста в современных реалиях . Программа 2026 года существенно обновлена по сравнению с предыдущими итерациями, чтобы включить последние достижения индустрии, такие как дистилляция политик (policy distillation), новые парадигмы генерации (например, диффузионные методы в LLM) и агентное поведение моделей .

Исторический контекст развития области:

🧩 Токенизация: как машины читают текст 16:56

Модели не понимают текст напрямую — они работают с числами. Процесс разделения текста на неделимые единицы называется токенизацией . Афшин выделяет три основных подхода, каждый из которых имеет свои компромиссы:

  1. Уровень слов (Word level): Просто и интерпретируемо, но ведет к огромным словарям и проблеме OOV (out-of-vocabulary) — когда модель встречает незнакомое слово и не знает, что с ним делать .
  2. Уровень символов (Character level): Маленький словарь, нет проблем с опечатками, но последовательности становятся слишком длинными, что замедляет вычисления .
  3. Подуровни слов (Subword level): «Золотая середина», используемая в современных LLM. Самый популярный метод — BPE (Byte Pair Encoding), который итеративно объединяет наиболее часто встречающиеся пары символов в новые токены .

Помимо обычных слов, существуют специальные токены: BOS (начало последовательности), EOS (конец последовательности), UNK (неизвестный токен) и PAD (заполнитель для выравнивания длины векторов) .

🧠 От Word2vec до внимания: поиск смысла 37:27

Для эффективной работы токены должны быть представлены в виде векторов (эмбеддингов), отражающих их смысл. Ранние методы, такие как Word2vec (2013), использовали прокси-задачи (например, предсказание слова по его контексту) для обучения представлений . Однако у Word2vec были критические недостатки:

Рекуррентные сети (RNN) и их улучшенные версии (LSTM) пытались решить это с помощью «скрытого состояния» (hidden state), которое переносит информацию о прошлых словах . Но они страдали от проблемы «забывания» начала длинных предложений (vanishing gradient) и были медленными в обучении из-за невозможности параллелизации .

Решением стала концепция внимания (Attention): вместо того чтобы сжимать всё прошлое в один вектор, модель получает прямые связи со всеми предыдущими токенами и сама решает, какие из них наиболее важны для текущего шага .

🏗️ Архитектура Трансформера: Механизм Self-Attention 57:16

Сердце трансформера — механизм Self-Attention. Он позволяет каждому токену в последовательности взаимодействовать со всеми остальными. Для этого используются три вектора (получаемые через обучаемые матрицы проекции) :

Степень взаимодействия определяется скалярным произведением Query одного токена и Key другого. Математически это выражается фундаментальной формулой: $Softmax(QK^T / \sqrt{d_k})V$ .

Трансформер в своей классической форме (для перевода) состоит из двух частей:

  1. Энкодер: Создает контекстно-зависимые представления исходного текста .
  2. Декодер: Генерирует текст на целевом языке, используя результаты энкодера и уже сгенерированные ранее токены .

🛠️ Вычислительные хитрости и пример работы 1:22:16

Чтобы такая глубокая структура работала стабильно, авторы внедрили ряд инженерных решений:

Шервин Амиди подводит итог: архитектура выглядит сложной, но ее успех держится на двух столпах — механизме внимания и полносвязных слоях (Feed Forward), в которых сосредоточена основная вычислительная мощность и «память» модели .

💬 Цитаты

«Внимание — это всё, что вам нужно (Attention is all you need).»

Афшин Амиди 14:08

«Независимо от вашей роли, знание того, как работают эти инструменты, становится всё более важным. Это называется ИИ-грамотностью.»

Афшин Амиди 03:02
👥 Спикеры
📚 Упомянутые книги
🔗 Упомянутые сайты и проекты
📖 Термины
BPE (Byte Pair Encoding)
Алгоритм токенизации, который сжимает наиболее частые пары символов в один токен.
Self-Attention
Механизм, позволяющий модели определять важность других слов в предложении при обработке текущего слова.
Эмбеддинг (Embedding)
Векторное представление слова или токена в многомерном пространстве, отражающее его смысл.
Авторегрессия
Процесс генерации текста, где каждый новый токен создается на основе всех предыдущих.
📊 Цифры
🗓 Хронология
  1. 2010-е Эпоха RNN и узкоспециализированных моделей для каждой задачи NLP.
  2. 2017 Публикация архитектуры Transformer.
  3. Ноябрь 2022 Запуск ChatGPT и начало массового использования разговорного ИИ.
  4. 2026 Текущий курс CME 295, фокусирующийся на ИИ-агентах и современных архитектурах.
⚖️ Другая сторона
Искусственный интеллект Transformer Self-Attention BPE Stanford Online LLM