# Дайан Пенн: «Evals — это новые PRD, а современный продакт должен потеть над токенами»

Источник: https://www.youtube.com/watch?v=tivaWTTVRhY
Канал: Lenny's Podcast
Опубликовано: 26.07.2026

---

Дайан Пенн, руководитель отдела продуктов в Anthropic AI Research and Labs, прошла путь от первого технического продакт-менеджера компании до лидера команд, создающих самые продвинутые модели семейства Claude. В большом интервью Ленни Рачицки она раскрывает внутренние процессы компании, объясняет, почему в мире ИИ традиционные методы управления продуктом больше не работают, и как Anthropic удалось занять нишу лучшего инструмента для программистов, конкурируя с гигантами индустрии.

## 🚀 Начало пути: от пяти инженеров до статуса самого быстрорастущего стартапа
[[JUMP:02:31]]

Когда Дайан Пенн пришла в Anthropic в 2023 году, команда продукта состояла всего из пяти инженеров, а за всё API-направление отвечал один человек [03:57]. В то время многие эксперты, включая самого Ленни Рачицки, скептически относились к шансам компании, полагая, что OpenAI уже захватила рынок и Anthropic не сможет её догнать [03:04].

Однако внутри компании царила культура стартапа с жестким фокусом на миссии и ценностях [04:10]. Одним из первых признаков того, что Anthropic нащупывает свою идентичность, стал проект **Golden Gate Claude**. В начале 2024 года исследователи обнаружили в слоях модели «фичу», отвечающую за тематику моста Золотые Ворота [05:14]. Команда за 24 часа создала интерфейс, где Claude становился одержим этим мостом, упоминая его даже в рецептах спагетти [05:52]. Этот «причудливый» эксперимент, по словам Пенн, показал способность компании быстро превращать сложные исследования в уникальный пользовательский опыт [06:46].

Основные принципы ранней культуры Anthropic:

*   **Культура «снизу вверх»:** инженеры и дизайнеры добровольно тратили время на амбициозные прототипы [07:25].
*   **Единство в кризис:** во время работы над Opus 3 в декабре 2023 года вся команда работала из домов своих родителей на каникулах, что создало фундамент доверия между исследователями и менеджерами [10:17].
*   **Фокус на кодинге:** команда вовремя заметила, что пользователи начинают писать длинный код с помощью ИИ, и сделала на это ставку при обучении моделей, хотя изначально кодинг не считался приоритетным направлением [11:35].

## 📈 Жизнь внутри «экспоненты»: непредсказуемость ИИ-прогресса
[[JUMP:13:50]]

Дарио Амодеи, сооснователь Anthropic, часто говорит о том, что индустрия находится на экспоненциальной кривой развития. По мнению Дайан Пенн, это означает, что каждый следующий шаг — это не просто улучшение, а качественный скачок [14:42]. 

Главная сложность работы в таких условиях заключается в том, что способности моделей возникают «скачкообразно» и нелинейно. В исследовательских работах по законам масштабирования (Scaling Laws) видно, что с ростом вычислений общая ошибка предсказания падает плавно, но конкретные навыки — например, умение складывать числа — появляются внезапно [18:29]. 

Это создает специфические вызовы для команды продукта:

1.  **Невозможность долгосрочного планирования:** команда часто достает из архива планы, которые казались невозможными пару месяцев назад, потому что новая модель внезапно обрела нужный навык [16:33].
2.  **Product Overhang (Продуктовый навес):** текущие модели (например, Claude 3.5 Sonnet, в транскрипте упоминаемый как Fable) обладают возможностями, которые пользователи ещё даже не начали исследовать [19:35].
3.  **Адаптивность как главная черта:** Пенн призывает команду постоянно спрашивать: «Если выйдет Claude 8, как это изменит поведение пользователей?» [34:50].

## 🛠 Эволюция роли PM: «Evals — это новые PRD»
[[JUMP:44:16]]

В Anthropic роль продакт-менеджера (PM) претерпела фундаментальные изменения. Вместо написания длинных документов с описанием требований (PRD), менеджеры фокусируются на создании наборов тестов — **Evals** [41:40].

Процесс работы над фичей теперь выглядит так:

1.  **Глубокое изучение транскриптов:** PM должен «потеть над токенами так же, как над пикселями» [42:47]. Нужно досконально понимать, почему модель ошиблась: была ли это галлюцинация, излишняя уверенность или ошибка в вызове инструмента [43:00].
2.  **Создание «золотого набора»:** если пользователи жалуются, что Claude плохо следует формату JSON, PM собирает 30–40 примеров идеальных ответов [45:29].
3.  **Запуск тестов:** этот набор становится частью репозитория. Каждая новая итерация модели прогоняется через этот тест до тех пор, пока точность не достигнет 100% [46:13].

Дайан Пенн подчеркивает, что PRD всё ещё полезны для синхронизации больших групп людей (юристов, дизайнеров, маркетологов) или при запуске совершенно новых категорий, таких как **Computer Use** [48:54]. Однако для улучшения существующих моделей тесты (Evals) являются более эффективным инструментом коммуникации с исследователями [41:54].

## 🧪 Anthropic Labs и инкубация прорывных идей
[[JUMP:23:30]]

Подразделение **Anthropic Labs**, в котором работают Бен Манн и Майк Кригер, занимается «непрерывными крупными ставками», которые не вписываются в основную дорожную карту [24:01]. Именно отсюда вышли такие продукты, как **Claude Code**, **MCP** (Model Context Protocol) и **Claude Design** [24:32].

Секреты успеха Labs:

*   **Маленькие «поды»:** идеи часто начинаются с одного инженера, что позволяет избежать бюрократии больших команд [26:34].
*   **Право на ошибку:** многие прототипы закрываются, если они не показывают потенциал 10-кратного роста, что требует от сотрудников характера «основателя» и готовности пережить неудачу [27:12].
*   **Сильная позиция по теме:** команда может иметь твердое мнение о направлении (например, «ИИ должен использовать компьютер»), но оставаться гибкой в выборе конкретного способа реализации [24:59].

## 🛡 Безопасность и конституция как драйверы интеллекта
[[JUMP:1:03:50]]

Существует миф, что ограничения безопасности делают ИИ скучным и глупым. Опыт Anthropic доказывает обратное: работа над выравниванием (alignment) и «Конституционный ИИ» сделали Claude более интересным собеседником [1:04:17]. 

Пенн утверждает, что способность модели **спорить и возражать** пользователю — это ключевой элемент интеллекта. Хороший «партнер по мышлению» не должен просто соглашаться; он должен указывать на слабые места в аргументации [1:05:48]. Например, при обсуждении стратегии ценообразования для новых моделей Дайан использует Claude как спарринг-партнера, который подвергает её идеи сомнению [1:05:10].

Что касается «ИИ-почерка», Дайан признает, что тексты, написанные нейросетями, всё ещё часто выглядят шаблонно («зубчатые края» технологии). Anthropic активно работает над улучшением тона и характера моделей, чтобы они писали более естественно [1:10:51]. При этом Пенн считает, что в будущем важнее будет не то, кто написал текст, а то, **кто его проверил и подписал** [1:08:40].

## 🧠 Где человек останется незаменимым?
[[JUMP:1:11:40]]

Несмотря на приближение к AGI, Пенн выделяет несколько областей, где человеческий мозг сохранит ценность:

1.  **Суждение (Judgment):** накопленный десятилетиями опыт и интуиция, которых нет у систем, обучающихся только на данных [1:12:12].
2.  **Настойчивость и воля:** ИИ может предложить решение, но человек должен решить, стоит ли его реализовывать и как долго за него бороться [1:12:53].
3.  **Формирование собственного мнения:** Пенн советует сначала формулировать свою точку зрения, а уже потом обсуждать её с Claude, чтобы избежать атрофии критического мышления [1:01:59].

В воспитании своих детей (4 и 8 лет) Дайан делает упор на те же качества: любопытство, настойчивость и развитие собственного «внутреннего голоса», который позволит им оставаться самодостаточными личностями в мире, наполненном алгоритмами [1:14:39].