Эта лекция открывает курс CME 295 в Стэнфордском университете, посвященный архитектуре трансформеров и большим языковым моделям (LLM). Преподаватели Афшин Амиди и Шервин Амиди, имеющие опыт работы в Uber, Google и Netflix, представляют глубокий технический разбор механизмов, которые легли в основу современной революции искусственного интеллекта, начиная с фундаментальной работы 2017 года «Attention is All You Need».
🎓 Введение в курс и эволюция NLP 0:00
Курс CME 295 нацелен на широкую аудиторию: от будущих ученых-исследователей до разработчиков, создающих персональные проекты с использованием ИИ-агентов . Афшин Амиди подчеркивает важность «ИИ-грамотности» (AI literacy) для любого специалиста в современных реалиях . Программа 2026 года существенно обновлена по сравнению с предыдущими итерациями, чтобы включить последние достижения индустрии, такие как дистилляция политик (policy distillation), новые парадигмы генерации (например, диффузионные методы в LLM) и агентное поведение моделей .
Исторический контекст развития области:
- 2010-е годы: Доминирование рекуррентных нейронных сетей (RNN). Каждая задача (перевод, анализ тональности, извлечение сущностей) требовала отдельной специализированной модели .
- 2017 год: Выход статьи «Attention is All You Need». Появление архитектуры Transformer, которая оказалась невероятно масштабируемой: увеличение данных и вычислительных мощностей приводило к взрывному росту качества .
- 2022 год: Релиз ChatGPT. Переломный момент с точки зрения продукта, когда взаимодействие с чат-ботом стало массовым .
- 2026 год: Эпоха кодинг-агентов и автономных ИИ-систем, с которыми пользователи взаимодействуют ежедневно .
🧩 Токенизация: как машины читают текст 16:56
Модели не понимают текст напрямую — они работают с числами. Процесс разделения текста на неделимые единицы называется токенизацией . Афшин выделяет три основных подхода, каждый из которых имеет свои компромиссы:
- Уровень слов (Word level): Просто и интерпретируемо, но ведет к огромным словарям и проблеме OOV (out-of-vocabulary) — когда модель встречает незнакомое слово и не знает, что с ним делать .
- Уровень символов (Character level): Маленький словарь, нет проблем с опечатками, но последовательности становятся слишком длинными, что замедляет вычисления .
- Подуровни слов (Subword level): «Золотая середина», используемая в современных LLM. Самый популярный метод — BPE (Byte Pair Encoding), который итеративно объединяет наиболее часто встречающиеся пары символов в новые токены .
Помимо обычных слов, существуют специальные токены: BOS (начало последовательности), EOS (конец последовательности), UNK (неизвестный токен) и PAD (заполнитель для выравнивания длины векторов) .
🧠 От Word2vec до внимания: поиск смысла 37:27
Для эффективной работы токены должны быть представлены в виде векторов (эмбеддингов), отражающих их смысл. Ранние методы, такие как Word2vec (2013), использовали прокси-задачи (например, предсказание слова по его контексту) для обучения представлений . Однако у Word2vec были критические недостатки:
- Отсутствие учета порядка слов .
- Статичность: слово «банк» (речной или финансовый) всегда имело один и тот же вектор, независимо от контекста .
Рекуррентные сети (RNN) и их улучшенные версии (LSTM) пытались решить это с помощью «скрытого состояния» (hidden state), которое переносит информацию о прошлых словах . Но они страдали от проблемы «забывания» начала длинных предложений (vanishing gradient) и были медленными в обучении из-за невозможности параллелизации .
Решением стала концепция внимания (Attention): вместо того чтобы сжимать всё прошлое в один вектор, модель получает прямые связи со всеми предыдущими токенами и сама решает, какие из них наиболее важны для текущего шага .
🏗️ Архитектура Трансформера: Механизм Self-Attention 57:16
Сердце трансформера — механизм Self-Attention. Он позволяет каждому токену в последовательности взаимодействовать со всеми остальными. Для этого используются три вектора (получаемые через обучаемые матрицы проекции) :
- Query (Запрос): «Что я ищу?»
- Key (Ключ): «Что я содержу?»
- Value (Значение): «Что я передаю, если я подошел запросу?»
Степень взаимодействия определяется скалярным произведением Query одного токена и Key другого. Математически это выражается фундаментальной формулой: $Softmax(QK^T / \sqrt{d_k})V$ .
Трансформер в своей классической форме (для перевода) состоит из двух частей:
- Энкодер: Создает контекстно-зависимые представления исходного текста .
- Декодер: Генерирует текст на целевом языке, используя результаты энкодера и уже сгенерированные ранее токены .
🛠️ Вычислительные хитрости и пример работы 1:22:16
Чтобы такая глубокая структура работала стабильно, авторы внедрили ряд инженерных решений:
- Позиционное кодирование (Positional Encoding): Поскольку механизм внимания сам по себе не учитывает порядок слов, к эмбеддингам добавляются векторы на основе синусоид разной частоты, чтобы «сообщить» модели положение токена .
- Остаточные связи (Residual Connections): Прокидывание входного сигнала напрямую через слой ($F(x) + x$), что предотвращает затухание градиентов и облегчает обучение глубоких сетей .
- Multi-Head Attention: Использование нескольких «голов» внимания параллельно, чтобы модель могла одновременно отслеживать разные типы связей (например, грамматические и смысловые) .
- Masked Self-Attention: В декодере модель «закрывает» будущие токены маской, чтобы она не могла «подглядывать» в ответ во время обучения .
Шервин Амиди подводит итог: архитектура выглядит сложной, но ее успех держится на двух столпах — механизме внимания и полносвязных слоях (Feed Forward), в которых сосредоточена основная вычислительная мощность и «память» модели .