Stanford CS329A Self-Improving AI Agents | Part 1 | Course Overview

Stanford Online 80,8 тыс. 1 ч 9 мин 4 мин 03.08.2026

🎓 Самообучающиеся ИИ-агенты: Обзор курса Stanford CS329A 0:05

Лекция открывает курс Стэнфордского университета CS329A «Self-Improving AI Agents», который ведут преподаватели Ааканкша Чоудери и Азалия Мирхосейни. Программа посвящена эволюции больших языковых моделей (LLM), масштабированию вычислений во время инференса и переходу от статических чат-ботов к автономным агентным системам.

📈 Законы масштабирования и эволюция базовых моделей 2:23

Развитие языковых моделей долгое время опиралось на эмпирические законы масштабирования (scaling laws). Увеличение трех ключевых компонентов — объема вычислительных ресурсов, размера обучающего датасета и количества параметров модели — стабильно приводит к снижению функции потерь (test loss) и росту качества.

Помимо снижения потерь, рост моделей приводит к появлению качественно новых эмерджентных свойств. Среди них выделяются few-shot (обучение по нескольким примерам) и zero-shot обучение, когда модель способна выполнять новые задачи без предварительного fine-tuning просто на основе текстового промпта.

Другим важнейшим свойством крупных моделей стала способность к выстраиванию цепочки рассуждений (chain of thought, CoT). Пошаговое развертывание логики решения математических или логических задач позволяет моделям преодолевать ограничения базовой предсказательной логики, хотя на небольших моделях (например, с параметрами около 7–8 млрд) этот метод изначально не дает эффекта.

🛠️ Переломный момент: ChatGPT и этапы посткабинетного обучения 10:45

Запуск ChatGPT в ноябре 2022 года стал историческим событием, преодолевшим отметку в 1 миллион пользователей всего за 5 дней. Этот прорыв стал возможен благодаря внедрению специализированных этапов дообучения поверх базовой модели:

  1. Предварительное обучение (Pre-training): обучение на сырых текстовых данных для прогнозирования следующего токена.
  2. Дообучение на качественных данных (Supervised Fine-Tuning):спользование очищенных массивов данных (книги, эссе), приобретенных за миллионы долларов.
  3. Инструктивное дообучение (Instruction Tuning): обучение на парах «инструкция — вопрос — ответ», помогающее модели точно следовать запросам пользователя.
  4. Обучение с подкреплением на основе отзывов людей (RLHF): создание модели вознаграждения на основе оценок экспертов и пользователей для выравнивания ответов с человеческими ценностями (sensibleness, safety).

🧠 Инференс-масштабирование и «большие языковые мартышки» 19:32

В последнее время фронтиром развития ИИ стало масштабирование на этапе инференса (inference scaling), не требующее изменения параметров самой модели. Проект лаборатории Азалии Мирхосейни Large Language Monkeys (названный в отсылку к теореме об бесконечных обезьянах) показал, что параллельная генерация множества вариантов ответа (параллельный сэмплинг) с последующей верификацией драматически повышает точность решения сложных задач.

Позднее появление моделей нового поколения (таких как DeepSeek, серии OpenAI o1/o3 и Gemini Thinking) объединило инференс-масштабирование с генерацией синтетических данных для последующего обучения. Такие модели умеют выполнять глубокую декомпозицию задач, самооценку и исправление ошибок (self-correction) в процессе развертывания внутренних цепочек мыслей.

🤖 Переход от чат-ботов к агентным воркфлоу 41:00

Традиционные чат-боты функционируют в режиме одиночных запросов (single-turn), отвечая на вопросы развлекательного или информационного характера. Современные ИИ-агенты (например, Claude Code или инструменты Deep Research) способны решать комплексные сквозные (end-to-end) задачи, планируя шаги, взаимодействуя с внешними инструментами и средой разработки.

Типовые паттерны агентных воркфлоу включают в себя:

Основными областями применения агентов сегодня выступают кодинг и рефакторинг репозиториев (через терминалы и работу с файлами), автоматизация техподдержки (живые транскрипции, умные ответы, суммаризация звонков), углубленные исследования (генерация обзоров литературы) и даже поддержка научных открытий в роли «ИИ-ученых».

📋 Организация курса и логистика 1:01:35

Курс CS329A в текущем семестре включает в себя следующие академические требования: