Дайан Пенн: «Evals — это новые PRD, а современный продакт должен потеть над токенами»

Lenny's Podcast 21,8 тыс. 1 ч 33 мин 5 мин 26.07.2026
Главное

Дайан Пенн, руководитель отдела продуктов в Anthropic AI Research and Labs, прошла путь от первого технического продакт-менеджера компании до лидера команд, создающих самые продвинутые модели семейства Claude. В большом интервью Ленни Рачицки она раскрывает внутренние процессы компании, объясняет, почему в мире ИИ традиционные методы управления продуктом больше не работают, и как Anthropic удалось занять нишу лучшего инструмента для программистов, конкурируя с гигантами индустрии.

🚀 Начало пути: от пяти инженеров до статуса самого быстрорастущего стартапа 2:31

Когда Дайан Пенн пришла в Anthropic в 2023 году, команда продукта состояла всего из пяти инженеров, а за всё API-направление отвечал один человек . В то время многие эксперты, включая самого Ленни Рачицки, скептически относились к шансам компании, полагая, что OpenAI уже захватила рынок и Anthropic не сможет её догнать .

Однако внутри компании царила культура стартапа с жестким фокусом на миссии и ценностях . Одним из первых признаков того, что Anthropic нащупывает свою идентичность, стал проект Golden Gate Claude. В начале 2024 года исследователи обнаружили в слоях модели «фичу», отвечающую за тематику моста Золотые Ворота . Команда за 24 часа создала интерфейс, где Claude становился одержим этим мостом, упоминая его даже в рецептах спагетти . Этот «причудливый» эксперимент, по словам Пенн, показал способность компании быстро превращать сложные исследования в уникальный пользовательский опыт .

Основные принципы ранней культуры Anthropic:

📈 Жизнь внутри «экспоненты»: непредсказуемость ИИ-прогресса 13:50

Дарио Амодеи, сооснователь Anthropic, часто говорит о том, что индустрия находится на экспоненциальной кривой развития. По мнению Дайан Пенн, это означает, что каждый следующий шаг — это не просто улучшение, а качественный скачок .

Главная сложность работы в таких условиях заключается в том, что способности моделей возникают «скачкообразно» и нелинейно. В исследовательских работах по законам масштабирования (Scaling Laws) видно, что с ростом вычислений общая ошибка предсказания падает плавно, но конкретные навыки — например, умение складывать числа — появляются внезапно .

Это создает специфические вызовы для команды продукта:

  1. Невозможность долгосрочного планирования: команда часто достает из архива планы, которые казались невозможными пару месяцев назад, потому что новая модель внезапно обрела нужный навык .
  2. Product Overhang (Продуктовый навес): текущие модели (например, Claude 3.5 Sonnet, в транскрипте упоминаемый как Fable) обладают возможностями, которые пользователи ещё даже не начали исследовать .
  3. Адаптивность как главная черта: Пенн призывает команду постоянно спрашивать: «Если выйдет Claude 8, как это изменит поведение пользователей?» .

🛠 Эволюция роли PM: «Evals — это новые PRD» 44:16

В Anthropic роль продакт-менеджера (PM) претерпела фундаментальные изменения. Вместо написания длинных документов с описанием требований (PRD), менеджеры фокусируются на создании наборов тестов — Evals .

Процесс работы над фичей теперь выглядит так:

  1. Глубокое изучение транскриптов: PM должен «потеть над токенами так же, как над пикселями» . Нужно досконально понимать, почему модель ошиблась: была ли это галлюцинация, излишняя уверенность или ошибка в вызове инструмента .
  2. Создание «золотого набора»: если пользователи жалуются, что Claude плохо следует формату JSON, PM собирает 30–40 примеров идеальных ответов .
  3. Запуск тестов: этот набор становится частью репозитория. Каждая новая итерация модели прогоняется через этот тест до тех пор, пока точность не достигнет 100% .

Дайан Пенн подчеркивает, что PRD всё ещё полезны для синхронизации больших групп людей (юристов, дизайнеров, маркетологов) или при запуске совершенно новых категорий, таких как Computer Use . Однако для улучшения существующих моделей тесты (Evals) являются более эффективным инструментом коммуникации с исследователями .

🧪 Anthropic Labs и инкубация прорывных идей 23:30

Подразделение Anthropic Labs, в котором работают Бен Манн и Майк Кригер, занимается «непрерывными крупными ставками», которые не вписываются в основную дорожную карту . Именно отсюда вышли такие продукты, как Claude Code, MCP (Model Context Protocol) и Claude Design .

Секреты успеха Labs:

🛡 Безопасность и конституция как драйверы интеллекта 1:03:50

Существует миф, что ограничения безопасности делают ИИ скучным и глупым. Опыт Anthropic доказывает обратное: работа над выравниванием (alignment) и «Конституционный ИИ» сделали Claude более интересным собеседником .

Пенн утверждает, что способность модели спорить и возражать пользователю — это ключевой элемент интеллекта. Хороший «партнер по мышлению» не должен просто соглашаться; он должен указывать на слабые места в аргументации . Например, при обсуждении стратегии ценообразования для новых моделей Дайан использует Claude как спарринг-партнера, который подвергает её идеи сомнению .

Что касается «ИИ-почерка», Дайан признает, что тексты, написанные нейросетями, всё ещё часто выглядят шаблонно («зубчатые края» технологии). Anthropic активно работает над улучшением тона и характера моделей, чтобы они писали более естественно . При этом Пенн считает, что в будущем важнее будет не то, кто написал текст, а то, кто его проверил и подписал .

🧠 Где человек останется незаменимым? 1:11:40

Несмотря на приближение к AGI, Пенн выделяет несколько областей, где человеческий мозг сохранит ценность:

  1. Суждение (Judgment): накопленный десятилетиями опыт и интуиция, которых нет у систем, обучающихся только на данных .
  2. Настойчивость и воля: ИИ может предложить решение, но человек должен решить, стоит ли его реализовывать и как долго за него бороться .
  3. Формирование собственного мнения: Пенн советует сначала формулировать свою точку зрения, а уже потом обсуждать её с Claude, чтобы избежать атрофии критического мышления .

В воспитании своих детей (4 и 8 лет) Дайан делает упор на те же качества: любопытство, настойчивость и развитие собственного «внутреннего голоса», который позволит им оставаться самодостаточными личностями в мире, наполненном алгоритмами .

💬 Цитаты

«Evals — это новые PRD. Чтобы приносить пользу пользователю, нужно понять его боль и превратить её в тест для модели.»

Дайан Пенн 41:40

«Вы должны потеть над токенами так же сильно, как потеете над пикселями.»

Дайан Пенн 42:47

«Нам нужны фронтирные продукты, чтобы люди могли почувствовать магию фронтирных моделей.»

Дайан Пенн 12:55
👥 Спикеры
📚 Упомянутые книги
🎬 Упомянутые фильмы и сериалы
🔗 Упомянутые сайты и проекты
📖 Термины
Evals (Evaluations)
Наборы тестовых данных и критериев для количественной оценки качества ответов языковой модели.
Scaling Laws
Математические закономерности, описывающие, как способности ИИ растут пропорционально количеству данных и вычислительной мощности.
MCP (Model Context Protocol)
Протокол, позволяющий ИИ-моделям безопасно подключаться к различным источникам данных и инструментам.
Tokenmaxxing
Стратегия использования огромного количества дешевых токенов ИИ для автоматизации работы, эквивалентной сотням инженеров.
📊 Цифры
🗓 Хронология
  1. 2023 Дайан Пенн присоединяется к Anthropic в качестве первого технического продакт-менеджера.
  2. Март 2024 Запуск модели Opus 3, ставшей переломным моментом для уверенности компании в своих силах.
  3. Начало 2024 Эксперимент с Golden Gate Claude, показавший возможности интерпретируемости моделей.
⚖️ Другая сторона
Продукты и маркетинг Anthropic Claude продакт-менеджмент Искусственный интеллект LLM Evals