# Stanford CS329A Self-Improving AI Agents | Part 1 | Course Overview

Источник: https://www.youtube.com/watch?v=6YnLB0XbTnI
Канал: Stanford Online
Опубликовано: 03.08.2026

---

## 🎓 Самообучающиеся ИИ-агенты: Обзор курса Stanford CS329A
[[JUMP:0:05]]

Лекция открывает курс Стэнфордского университета CS329A «Self-Improving AI Agents», который ведут преподаватели Ааканкша Чоудери и Азалия Мирхосейни. Программа посвящена эволюции больших языковых моделей (LLM), масштабированию вычислений во время инференса и переходу от статических чат-ботов к автономным агентным системам.

## 📈 Законы масштабирования и эволюция базовых моделей
[[JUMP:2:23]]

Развитие языковых моделей долгое время опиралось на эмпирические законы масштабирования (scaling laws). Увеличение трех ключевых компонентов — объема вычислительных ресурсов, размера обучающего датасета и количества параметров модели — стабильно приводит к снижению функции потерь (test loss) и росту качества. 

*   **BERT:** 340 млн параметров
*   **GPT-2:** 1,5 млрд параметров
*   **GPT-3:** 175 млрд параметров
*   **PaLM:** 540 млрд параметров
*   **GPT-4:** триллионы параметров (оценка)

Помимо снижения потерь, рост моделей приводит к появлению качественно новых эмерджентных свойств. Среди них выделяются few-shot (обучение по нескольким примерам) и zero-shot обучение, когда модель способна выполнять новые задачи без предварительного fine-tuning просто на основе текстового промпта.

Другим важнейшим свойством крупных моделей стала способность к выстраиванию цепочки рассуждений (chain of thought, CoT). Пошаговое развертывание логики решения математических или логических задач позволяет моделям преодолевать ограничения базовой предсказательной логики, хотя на небольших моделях (например, с параметрами около 7–8 млрд) этот метод изначально не дает эффекта.

## 🛠️ Переломный момент: ChatGPT и этапы посткабинетного обучения
[[JUMP:10:45]]

Запуск ChatGPT в ноябре 2022 года стал историческим событием, преодолевшим отметку в 1 миллион пользователей всего за 5 дней. Этот прорыв стал возможен благодаря внедрению специализированных этапов дообучения поверх базовой модели:

1.  **Предварительное обучение (Pre-training):** обучение на сырых текстовых данных для прогнозирования следующего токена.
2.  **Дообучение на качественных данных (Supervised Fine-Tuning):спользование очищенных массивов данных (книги, эссе), приобретенных за миллионы долларов.**
3.  **Инструктивное дообучение (Instruction Tuning):** обучение на парах «инструкция — вопрос — ответ», помогающее модели точно следовать запросам пользователя.
4.  **Обучение с подкреплением на основе отзывов людей (RLHF):** создание модели вознаграждения на основе оценок экспертов и пользователей для выравнивания ответов с человеческими ценностями (sensibleness, safety).

## 🧠 Инференс-масштабирование и «большие языковые мартышки»
[[JUMP:19:32]]

В последнее время фронтиром развития ИИ стало масштабирование на этапе инференса (inference scaling), не требующее изменения параметров самой модели. Проект лаборатории Азалии Мирхосейни *Large Language Monkeys* (названный в отсылку к теореме об бесконечных обезьянах) показал, что параллельная генерация множества вариантов ответа (параллельный сэмплинг) с последующей верификацией драматически повышает точность решения сложных задач.

*   Количество параллельных сэмплов на одну задачу увеличивалось до 10 000.
*   В качестве верификаторов для генерации кода выступают автоматические юнит-тесты.
*   Модели семейства Llama при многократном сэмплировании начинают превосходить неоптимизированный GPT-4o на сложных бенчмарках.

Позднее появление моделей нового поколения (таких как DeepSeek, серии OpenAI o1/o3 и Gemini Thinking) объединило инференс-масштабирование с генерацией синтетических данных для последующего обучения. Такие модели умеют выполнять глубокую декомпозицию задач, самооценку и исправление ошибок (self-correction) в процессе развертывания внутренних цепочек мыслей.

## 🤖 Переход от чат-ботов к агентным воркфлоу
[[JUMP:41:00]]

Традиционные чат-боты функционируют в режиме одиночных запросов (single-turn), отвечая на вопросы развлекательного или информационного характера. Современные ИИ-агенты (например, Claude Code или инструменты Deep Research) способны решать комплексные сквозные (end-to-end) задачи, планируя шаги, взаимодействуя с внешними инструментами и средой разработки.

Типовые паттерны агентных воркфлоу включают в себя:

*   **Prompt chaining:** цепочка последовательных подзадач.
*   **Routing:** динамическое направление запроса на сложный или простой конвейер в зависимости от контекста.
*   **Parallelization:** одновременный вызов нескольких агентов для параллельного сбора информации.
*   **Orchestrator-worker:** центральный менеджер-планировщик управляет дочерними задачами.
*   **LLM-as-a-judge:** использование моделей в роли судей и критиков для оценки промежуточных результатов.

Основными областями применения агентов сегодня выступают кодинг и рефакторинг репозиториев (через терминалы и работу с файлами), автоматизация техподдержки (живые транскрипции, умные ответы, суммаризация звонков), углубленные исследования (генерация обзоров литературы) и даже поддержка научных открытий в роли «ИИ-ученых».

## 📋 Организация курса и логистика
[[JUMP:1:01:35]]

Курс CS329A в текущем семестре включает в себя следующие академические требования:

*   Основным источником официальных обновлений является **Canvas**.
*   Оценка успеваемости складывается из трех домашних заданий (**50%**) и итогового командного проекта (**50%**).
*   Проекты выполняются в командах от двух до четырех человек (допускается индивидуальная работа, но парная работа дает больше бонусных API-кредитов).
*   Проект должен носить исследовательский характер (создание нового бенчмарка, улучшение существующих агентов, проверка гипотез), а не быть простым приложением.
*   Ключевые дедлайны включают проектное предложение в начале октября, промежуточную презентацию с наработанным прогрессом и итоговую постерную сессию **12 декабря с 16:00 до 18:00**.
*   Для коммуникации и вопросов используется платформа **Ed Stem**, а сдача работ ведется через **GradeScope**. Аудит занятий не предусмотрен, но видеозаписи будут опубликованы на YouTube.