Дэн Бальзам: «Claude по уровню сознания находится где-то между медузой и мышью»

The Cognitive Revolution 32,1 тыс. 1 ч 56 мин 5 мин 08.08.2026
Главное

Технический директор компании Goodfire Дэн Бальзам возвращается в подкаст The Cognitive Revolution, чтобы представить Silico — автономную платформу для исследований в области машинного обучения, которая обещает демократизировать доступ к глубокой интерпретируемости нейросетей. В центре дискуссии — концепция «многообразий понятий» (concept manifolds), новые методы отладки обучающих данных и философские вопросы о сознании современных моделей, таких как Claude.

🛠️ Предиктивная отладка данных: как заглянуть в будущее обучения 3:22

Одной из самых резонансных работ Goodfire за последнее время стало исследование «Предиктивной отладки данных» (Predictive Data Debugging). Суть метода заключается в использовании техник интерпретируемости (например, разреженных автоэнкодеров или SAE) для анализа наборов данных, предназначенных для тонкой настройки (fine-tuning) или обучения с подкреплением (RL) .

Основные тезисы Дэна Бальзама:

Этот подход позволяет разработчикам увидеть, какие нежелательные концепты (например, склонность к обману или опасные знания) могут быть усилены конкретным датасетом, и вмешаться до того, как модель приобретет вредные привычки .

🧬 Геометрия нейронных мыслей: многообразия концептов 12:36

Дэн Бальзам утверждает, что популярная «гипотеза линейных представлений» (linear representation hypothesis), согласно которой концепты — это просто направления-векторы в пространстве активаций, является лишь упрощением . Современные исследования Goodfire показывают, что модель хранит информацию в виде сложных геометрических структур — многообразий (manifolds) .

Примеры обнаруженных структур:

Важнейший практический вывод Дэна Бальзама: управление моделью (steering) работает гораздо эффективнее и стабильнее, если оно происходит «вдоль многообразия» . Если пытаться изменить состояние модели по прямой линии, игнорируя геометрию концепта, она часто впадает в «галлюцинации» или начинает выдавать бессмыслицу (gibberish), так как выходит за пределы распределения данных .

🧩 Black Sparse Featurizers (BSF): эволюция SAE 33:24

Для более точного обнаружения этих геометрий Goodfire разработала «черные разреженные фичеризаторы» (Black Sparse Featurizers). В отличие от классических SAE, которые сопоставляют каждому концепту одно число (скаляр), BSF выделяет под концепт целый вектор .

Это позволяет фиксировать внутреннюю структуру объектов:

По словам Дэна Бальзама, это позволяет «факторизовать» модель — разбирать её на понятные модули, подобно тому как программист разбирает легаси-код на чистые функции .

🚀 Silico: агент-исследователь за $1000 в месяц 49:32

Главная новость эпизода — запуск Silico, платформы, которая изначально была внутренним инструментом Goodfire для ускорения собственных исследований. За $1000 в месяц (для корпоративных клиентов) пользователи получают доступ к «армии ИИ-агентов», обладающих глубокими навыками в ML и интерпретируемости .

Ключевые возможности Silico:

  1. Автономные исследования: агент может самостоятельно проверять гипотезы, писать код для экспериментов и визуализировать результаты в течение нескольких дней .
  2. Управление инфраструктурой: платформа берет на себя менеджмент GPU-кластеров и работу с моделями масштаба триллиона параметров .
  3. «Исследовательский вкус»: Дэн Бальзам подчеркивает, что навыки агентов прописаны вручную ведущими учеными Goodfire, что позволяет ИИ задавать правильные вопросы и избегать типичных ошибок новичков .

В рамках внутреннего хакатона с помощью Silico за 24 часа удалось создать state-of-the-art классификатор биологических рисков для протеиновых моделей и аудио-энкодер, не уступающий по качеству аналогам при меньшем размере .

🛡️ Безопасность и вмешательство в обучение 1:32:09

Обсуждая риски фронтирных моделей, Дэн Бальзам и Нейтан Лабенц затронули тему «запретных техник» обучения.

🧠 Сознание Claude и «обеденные споры» 1:42:04

В конце беседы Дэн Бальзам приоткрыл завесу над тем, что обсуждают сотрудники Goodfire во время обеда. Самая популярная тема — welfare (благополучие) и сознание ИИ.

Дэн Бальзам подытожил, что интеллектуальное смирение крайне важно в этом вопросе, так как ставки — потенциальное страдание или права новых сущностей — могут быть огромными .

💬 Цитаты

«Модели — это большие легаси-кодовые базы, полные спагетти-кода. Интерпретируемость позволяет нам провести рефакторинг этих систем.»

Дэн Бальзам 40:53

«Управление моделью вдоль многообразия концептов работает гораздо лучше, чем попытки линейного вмешательства, которые сводят ИИ с ума.»

Дэн Бальзам 20:59

«Если бы мне пришлось гадать, я бы сказал, что Claude находится где-то между медузой и мышью по уровню сознания.»

👥 Спикеры
🔗 Упомянутые сайты и проекты
📖 Термины
Интерпретируемость (Interpretability)
Область исследований, направленная на понимание внутренних механизмов принятия решений нейросетями.
SAE (Sparse Autoencoders)
Инструмент для разложения сложных активаций нейросети на разреженный набор понятных человеку концептов.
Многообразие (Manifold)
Геометрическая структура в многомерном пространстве, на которой лежат данные или концепты модели.
📊 Цифры
⚖️ Другая сторона
Искусственный интеллект Dan Balsam Goodfire Silico interpretability concept manifolds