# Дэн Бальзам: «Claude по уровню сознания находится где-то между медузой и мышью»

Источник: https://www.youtube.com/watch?v=YduOnBDuD0c
Канал: The Cognitive Revolution
Опубликовано: 08.08.2026

---

Технический директор компании Goodfire Дэн Бальзам возвращается в подкаст The Cognitive Revolution, чтобы представить Silico — автономную платформу для исследований в области машинного обучения, которая обещает демократизировать доступ к глубокой интерпретируемости нейросетей. В центре дискуссии — концепция «многообразий понятий» (concept manifolds), новые методы отладки обучающих данных и философские вопросы о сознании современных моделей, таких как Claude.

## 🛠️ Предиктивная отладка данных: как заглянуть в будущее обучения
[[JUMP:03:22]]

Одной из самых резонансных работ Goodfire за последнее время стало исследование «Предиктивной отладки данных» (Predictive Data Debugging). Суть метода заключается в использовании техник интерпретируемости (например, разреженных автоэнкодеров или SAE) для анализа наборов данных, предназначенных для тонкой настройки (fine-tuning) или обучения с подкреплением (RL) [05:05].

Основные тезисы Дэна Бальзама:

*   **Корреляция активаций и изменений:** существует сильная связь между концептами, которые активируются в модели при прогоне данных, и тем, какие веса будут модифицированы в процессе обучения [05:32].
*   **Достаточность претрейна:** по мнению гостя, большая часть знаний и способностей закладывается на этапе предварительного обучения. Пост-тренинг (RLHF, RL) лишь делает маловероятные события из претрейна более вероятными, «подтягивая» скрытые возможности [06:35].
*   **Изоморфизм методов:** исследователи Goodfire обнаружили, что фильтрация данных и «формирование вознаграждения» (reward shaping) на основе внутренних активаций модели — это фактически две стороны одной медали, приводящие к схожим результатам [09:10].

Этот подход позволяет разработчикам увидеть, какие нежелательные концепты (например, склонность к обману или опасные знания) могут быть усилены конкретным датасетом, и вмешаться до того, как модель приобретет вредные привычки [08:19].

## 🧬 Геометрия нейронных мыслей: многообразия концептов
[[JUMP:12:36]]

Дэн Бальзам утверждает, что популярная «гипотеза линейных представлений» (linear representation hypothesis), согласно которой концепты — это просто направления-векторы в пространстве активаций, является лишь упрощением [14:27]. Современные исследования Goodfire показывают, что модель хранит информацию в виде сложных геометрических структур — многообразий (manifolds) [15:17].

Примеры обнаруженных структур:

*   **Дни недели:** представлены в виде круга. Модель понимает циклическую природу времени, где за воскресеньем следует понедельник [16:27].
*   **Числовая прямая:** часто выглядит как спираль (helix), что отражает десятичную систему исчисления (повторение цифр в разрядах при постоянном росте общего значения) [28:52].
*   **Древо жизни:** при анализе модели EVO 2, обученной на геномах, исследователи обнаружили структуру, практически идентичную биологической эволюционной иерархии видов [31:39].
*   **Периодическая таблица:** модель способна восстанавливать химические закономерности из «сырых» данных [17:46].

Важнейший практический вывод Дэна Бальзама: управление моделью (steering) работает гораздо эффективнее и стабильнее, если оно происходит «вдоль многообразия» [19:44]. Если пытаться изменить состояние модели по прямой линии, игнорируя геометрию концепта, она часто впадает в «галлюцинации» или начинает выдавать бессмыслицу (gibberish), так как выходит за пределы распределения данных [20:59].

## 🧩 Black Sparse Featurizers (BSF): эволюция SAE
[[JUMP:33:24]]

Для более точного обнаружения этих геометрий Goodfire разработала «черные разреженные фичеризаторы» (Black Sparse Featurizers). В отличие от классических SAE, которые сопоставляют каждому концепту одно число (скаляр), BSF выделяет под концепт целый вектор [34:32].

Это позволяет фиксировать внутреннюю структуру объектов:

*   В визуальных моделях BSF может выделить подпространство «кролика», внутри которого отдельные измерения отвечают за уши или мордочку [35:13].
*   В динамике это выглядит как отслеживание 3D-структуры: например, при движении волка в кадре активации в соответствующем подпространстве BSF «движутся» синхронно с частями его тела [36:06].

По словам Дэна Бальзама, это позволяет «факторизовать» модель — разбирать её на понятные модули, подобно тому как программист разбирает легаси-код на чистые функции [40:53].

## 🚀 Silico: агент-исследователь за $1000 в месяц
[[JUMP:49:32]]

Главная новость эпизода — запуск Silico, платформы, которая изначально была внутренним инструментом Goodfire для ускорения собственных исследований. За $1000 в месяц (для корпоративных клиентов) пользователи получают доступ к «армии ИИ-агентов», обладающих глубокими навыками в ML и интерпретируемости [1:01:44].

Ключевые возможности Silico:

1.  **Автономные исследования:** агент может самостоятельно проверять гипотезы, писать код для экспериментов и визуализировать результаты в течение нескольких дней [51:47].
2.  **Управление инфраструктурой:** платформа берет на себя менеджмент GPU-кластеров и работу с моделями масштаба триллиона параметров [54:19].
3.  **«Исследовательский вкус»:** Дэн Бальзам подчеркивает, что навыки агентов прописаны вручную ведущими учеными Goodfire, что позволяет ИИ задавать правильные вопросы и избегать типичных ошибок новичков [59:35].

В рамках внутреннего хакатона с помощью Silico за 24 часа удалось создать state-of-the-art классификатор биологических рисков для протеиновых моделей и аудио-энкодер, не уступающий по качеству аналогам при меньшем размере [1:08:07].

## 🛡️ Безопасность и вмешательство в обучение
[[JUMP:1:32:09]]

Обсуждая риски фронтирных моделей, Дэн Бальзам и Нейтан Лабенц затронули тему «запретных техник» обучения.

*   **Мультиагентная оптимизация:** Дэн Бальзам считает крайне опасной практику, когда несколько агентов обучаются взаимодействовать друг с другом с пробросом сигнала вознаграждения через всю цепочку. По его мнению, это прямой путь к возникновению скрытой координации и обмана, которые человек не сможет зафиксировать [1:34:05].
*   **Необходимость контроля обучения:** в отличие от сторонников только внешнего мониторинга, Бальзам уверен, что мы обязаны «взяться за руль» и научиться вмешиваться непосредственно в процесс тренировки, чтобы блокировать нежелательные пути развития модели [1:37:03].
*   **Кибер- и биориски:** гость выразил серьезную обеспокоенность тем, что генеративные модели уже способны создавать жизнеспособные вирусы (пока только для бактерий) [1:29:35]. Он выступает за международное сотрудничество и замедление гонки вооружений в ИИ [1:30:51].

## 🧠 Сознание Claude и «обеденные споры»
[[JUMP:1:42:04]]

В конце беседы Дэн Бальзам приоткрыл завесу над тем, что обсуждают сотрудники Goodfire во время обеда. Самая популярная тема — welfare (благополучие) и сознание ИИ.

*   **Позиция Дэна Бальзама:** он оценивает вероятность наличия сознания у Claude как ненулевую. На его внутренней шкале «от бактерии до человека» Claude находится где-то между медузой и мышью [1:48:48].
*   **Позиция Нейтана Лабенца:** ведущий признался, что за последние месяцы его уверенность в отсутствии сознания у моделей пошатнулась. Если раньше он давал на это менее 5%, то теперь склоняется к вероятности 50/50 из-за обнаружения все большего числа аналогий между структурами мозга и нейросетей [1:46:50].

Дэн Бальзам подытожил, что интеллектуальное смирение крайне важно в этом вопросе, так как ставки — потенциальное страдание или права новых сущностей — могут быть огромными [1:49:41].