🎓 Самообучающиеся ИИ-агенты: Обзор курса Stanford CS329A 0:05
Лекция открывает курс Стэнфордского университета CS329A «Self-Improving AI Agents», который ведут преподаватели Ааканкша Чоудери и Азалия Мирхосейни. Программа посвящена эволюции больших языковых моделей (LLM), масштабированию вычислений во время инференса и переходу от статических чат-ботов к автономным агентным системам.
📈 Законы масштабирования и эволюция базовых моделей 2:23
Развитие языковых моделей долгое время опиралось на эмпирические законы масштабирования (scaling laws). Увеличение трех ключевых компонентов — объема вычислительных ресурсов, размера обучающего датасета и количества параметров модели — стабильно приводит к снижению функции потерь (test loss) и росту качества.
- BERT: 340 млн параметров
- GPT-2: 1,5 млрд параметров
- GPT-3: 175 млрд параметров
- PaLM: 540 млрд параметров
- GPT-4: триллионы параметров (оценка)
Помимо снижения потерь, рост моделей приводит к появлению качественно новых эмерджентных свойств. Среди них выделяются few-shot (обучение по нескольким примерам) и zero-shot обучение, когда модель способна выполнять новые задачи без предварительного fine-tuning просто на основе текстового промпта.
Другим важнейшим свойством крупных моделей стала способность к выстраиванию цепочки рассуждений (chain of thought, CoT). Пошаговое развертывание логики решения математических или логических задач позволяет моделям преодолевать ограничения базовой предсказательной логики, хотя на небольших моделях (например, с параметрами около 7–8 млрд) этот метод изначально не дает эффекта.
🛠️ Переломный момент: ChatGPT и этапы посткабинетного обучения 10:45
Запуск ChatGPT в ноябре 2022 года стал историческим событием, преодолевшим отметку в 1 миллион пользователей всего за 5 дней. Этот прорыв стал возможен благодаря внедрению специализированных этапов дообучения поверх базовой модели:
- Предварительное обучение (Pre-training): обучение на сырых текстовых данных для прогнозирования следующего токена.
- Дообучение на качественных данных (Supervised Fine-Tuning):спользование очищенных массивов данных (книги, эссе), приобретенных за миллионы долларов.
- Инструктивное дообучение (Instruction Tuning): обучение на парах «инструкция — вопрос — ответ», помогающее модели точно следовать запросам пользователя.
- Обучение с подкреплением на основе отзывов людей (RLHF): создание модели вознаграждения на основе оценок экспертов и пользователей для выравнивания ответов с человеческими ценностями (sensibleness, safety).
🧠 Инференс-масштабирование и «большие языковые мартышки» 19:32
В последнее время фронтиром развития ИИ стало масштабирование на этапе инференса (inference scaling), не требующее изменения параметров самой модели. Проект лаборатории Азалии Мирхосейни Large Language Monkeys (названный в отсылку к теореме об бесконечных обезьянах) показал, что параллельная генерация множества вариантов ответа (параллельный сэмплинг) с последующей верификацией драматически повышает точность решения сложных задач.
- Количество параллельных сэмплов на одну задачу увеличивалось до 10 000.
- В качестве верификаторов для генерации кода выступают автоматические юнит-тесты.
- Модели семейства Llama при многократном сэмплировании начинают превосходить неоптимизированный GPT-4o на сложных бенчмарках.
Позднее появление моделей нового поколения (таких как DeepSeek, серии OpenAI o1/o3 и Gemini Thinking) объединило инференс-масштабирование с генерацией синтетических данных для последующего обучения. Такие модели умеют выполнять глубокую декомпозицию задач, самооценку и исправление ошибок (self-correction) в процессе развертывания внутренних цепочек мыслей.
🤖 Переход от чат-ботов к агентным воркфлоу 41:00
Традиционные чат-боты функционируют в режиме одиночных запросов (single-turn), отвечая на вопросы развлекательного или информационного характера. Современные ИИ-агенты (например, Claude Code или инструменты Deep Research) способны решать комплексные сквозные (end-to-end) задачи, планируя шаги, взаимодействуя с внешними инструментами и средой разработки.
Типовые паттерны агентных воркфлоу включают в себя:
- Prompt chaining: цепочка последовательных подзадач.
- Routing: динамическое направление запроса на сложный или простой конвейер в зависимости от контекста.
- Parallelization: одновременный вызов нескольких агентов для параллельного сбора информации.
- Orchestrator-worker: центральный менеджер-планировщик управляет дочерними задачами.
- LLM-as-a-judge: использование моделей в роли судей и критиков для оценки промежуточных результатов.
Основными областями применения агентов сегодня выступают кодинг и рефакторинг репозиториев (через терминалы и работу с файлами), автоматизация техподдержки (живые транскрипции, умные ответы, суммаризация звонков), углубленные исследования (генерация обзоров литературы) и даже поддержка научных открытий в роли «ИИ-ученых».
📋 Организация курса и логистика 1:01:35
Курс CS329A в текущем семестре включает в себя следующие академические требования:
- Основным источником официальных обновлений является Canvas.
- Оценка успеваемости складывается из трех домашних заданий (50%) и итогового командного проекта (50%).
- Проекты выполняются в командах от двух до четырех человек (допускается индивидуальная работа, но парная работа дает больше бонусных API-кредитов).
- Проект должен носить исследовательский характер (создание нового бенчмарка, улучшение существующих агентов, проверка гипотез), а не быть простым приложением.
- Ключевые дедлайны включают проектное предложение в начале октября, промежуточную презентацию с наработанным прогрессом и итоговую постерную сессию 12 декабря с 16:00 до 18:00.
- Для коммуникации и вопросов используется платформа Ed Stem, а сдача работ ведется через GradeScope. Аудит занятий не предусмотрен, но видеозаписи будут опубликованы на YouTube.