Технический директор компании Goodfire Дэн Бальзам возвращается в подкаст The Cognitive Revolution, чтобы представить Silico — автономную платформу для исследований в области машинного обучения, которая обещает демократизировать доступ к глубокой интерпретируемости нейросетей. В центре дискуссии — концепция «многообразий понятий» (concept manifolds), новые методы отладки обучающих данных и философские вопросы о сознании современных моделей, таких как Claude.
🛠️ Предиктивная отладка данных: как заглянуть в будущее обучения 3:22
Одной из самых резонансных работ Goodfire за последнее время стало исследование «Предиктивной отладки данных» (Predictive Data Debugging). Суть метода заключается в использовании техник интерпретируемости (например, разреженных автоэнкодеров или SAE) для анализа наборов данных, предназначенных для тонкой настройки (fine-tuning) или обучения с подкреплением (RL) .
Основные тезисы Дэна Бальзама:
- Корреляция активаций и изменений: существует сильная связь между концептами, которые активируются в модели при прогоне данных, и тем, какие веса будут модифицированы в процессе обучения .
- Достаточность претрейна: по мнению гостя, большая часть знаний и способностей закладывается на этапе предварительного обучения. Пост-тренинг (RLHF, RL) лишь делает маловероятные события из претрейна более вероятными, «подтягивая» скрытые возможности .
- Изоморфизм методов: исследователи Goodfire обнаружили, что фильтрация данных и «формирование вознаграждения» (reward shaping) на основе внутренних активаций модели — это фактически две стороны одной медали, приводящие к схожим результатам .
Этот подход позволяет разработчикам увидеть, какие нежелательные концепты (например, склонность к обману или опасные знания) могут быть усилены конкретным датасетом, и вмешаться до того, как модель приобретет вредные привычки .
🧬 Геометрия нейронных мыслей: многообразия концептов 12:36
Дэн Бальзам утверждает, что популярная «гипотеза линейных представлений» (linear representation hypothesis), согласно которой концепты — это просто направления-векторы в пространстве активаций, является лишь упрощением . Современные исследования Goodfire показывают, что модель хранит информацию в виде сложных геометрических структур — многообразий (manifolds) .
Примеры обнаруженных структур:
- Дни недели: представлены в виде круга. Модель понимает циклическую природу времени, где за воскресеньем следует понедельник .
- Числовая прямая: часто выглядит как спираль (helix), что отражает десятичную систему исчисления (повторение цифр в разрядах при постоянном росте общего значения) .
- Древо жизни: при анализе модели EVO 2, обученной на геномах, исследователи обнаружили структуру, практически идентичную биологической эволюционной иерархии видов .
- Периодическая таблица: модель способна восстанавливать химические закономерности из «сырых» данных .
Важнейший практический вывод Дэна Бальзама: управление моделью (steering) работает гораздо эффективнее и стабильнее, если оно происходит «вдоль многообразия» . Если пытаться изменить состояние модели по прямой линии, игнорируя геометрию концепта, она часто впадает в «галлюцинации» или начинает выдавать бессмыслицу (gibberish), так как выходит за пределы распределения данных .
🧩 Black Sparse Featurizers (BSF): эволюция SAE 33:24
Для более точного обнаружения этих геометрий Goodfire разработала «черные разреженные фичеризаторы» (Black Sparse Featurizers). В отличие от классических SAE, которые сопоставляют каждому концепту одно число (скаляр), BSF выделяет под концепт целый вектор .
Это позволяет фиксировать внутреннюю структуру объектов:
- В визуальных моделях BSF может выделить подпространство «кролика», внутри которого отдельные измерения отвечают за уши или мордочку .
- В динамике это выглядит как отслеживание 3D-структуры: например, при движении волка в кадре активации в соответствующем подпространстве BSF «движутся» синхронно с частями его тела .
По словам Дэна Бальзама, это позволяет «факторизовать» модель — разбирать её на понятные модули, подобно тому как программист разбирает легаси-код на чистые функции .
🚀 Silico: агент-исследователь за $1000 в месяц 49:32
Главная новость эпизода — запуск Silico, платформы, которая изначально была внутренним инструментом Goodfire для ускорения собственных исследований. За $1000 в месяц (для корпоративных клиентов) пользователи получают доступ к «армии ИИ-агентов», обладающих глубокими навыками в ML и интерпретируемости .
Ключевые возможности Silico:
- Автономные исследования: агент может самостоятельно проверять гипотезы, писать код для экспериментов и визуализировать результаты в течение нескольких дней .
- Управление инфраструктурой: платформа берет на себя менеджмент GPU-кластеров и работу с моделями масштаба триллиона параметров .
- «Исследовательский вкус»: Дэн Бальзам подчеркивает, что навыки агентов прописаны вручную ведущими учеными Goodfire, что позволяет ИИ задавать правильные вопросы и избегать типичных ошибок новичков .
В рамках внутреннего хакатона с помощью Silico за 24 часа удалось создать state-of-the-art классификатор биологических рисков для протеиновых моделей и аудио-энкодер, не уступающий по качеству аналогам при меньшем размере .
🛡️ Безопасность и вмешательство в обучение 1:32:09
Обсуждая риски фронтирных моделей, Дэн Бальзам и Нейтан Лабенц затронули тему «запретных техник» обучения.
- Мультиагентная оптимизация: Дэн Бальзам считает крайне опасной практику, когда несколько агентов обучаются взаимодействовать друг с другом с пробросом сигнала вознаграждения через всю цепочку. По его мнению, это прямой путь к возникновению скрытой координации и обмана, которые человек не сможет зафиксировать .
- Необходимость контроля обучения: в отличие от сторонников только внешнего мониторинга, Бальзам уверен, что мы обязаны «взяться за руль» и научиться вмешиваться непосредственно в процесс тренировки, чтобы блокировать нежелательные пути развития модели .
- Кибер- и биориски: гость выразил серьезную обеспокоенность тем, что генеративные модели уже способны создавать жизнеспособные вирусы (пока только для бактерий) . Он выступает за международное сотрудничество и замедление гонки вооружений в ИИ .
🧠 Сознание Claude и «обеденные споры» 1:42:04
В конце беседы Дэн Бальзам приоткрыл завесу над тем, что обсуждают сотрудники Goodfire во время обеда. Самая популярная тема — welfare (благополучие) и сознание ИИ.
- Позиция Дэна Бальзама: он оценивает вероятность наличия сознания у Claude как ненулевую. На его внутренней шкале «от бактерии до человека» Claude находится где-то между медузой и мышью .
- Позиция Нейтана Лабенца: ведущий признался, что за последние месяцы его уверенность в отсутствии сознания у моделей пошатнулась. Если раньше он давал на это менее 5%, то теперь склоняется к вероятности 50/50 из-за обнаружения все большего числа аналогий между структурами мозга и нейросетей .
Дэн Бальзам подытожил, что интеллектуальное смирение крайне важно в этом вопросе, так как ставки — потенциальное страдание или права новых сущностей — могут быть огромными .