В поисках реальности: Кэл Ньюпорт о «сознании» моделей Anthropic 0:00
На этой неделе Кэл Ньюпорт в очередном выпуске своего подкаста Deep Questions выступил с критическим анализом недавнего исследовательского отчета компании Anthropic под названием «Global Workspace and Language Models». В то время как СМИ и пользователи социальных сетей поспешили наделить ИИ-модель Claude «сознанием» и способностью к «размышлениям», Ньюпорт называет этот шум вокруг исследования искусственно созданным и глубоко неискренним. По мнению ведущего, отчет компании — это скорее «прославленный пресс-релиз», нежели серьезная научная работа, которая, при всей интересности самих технических данных, не открывает ничего принципиально нового в архитектуре больших языковых моделей (LLM).
🔍 Что именно обнаружили в Anthropic? 1:45
В центре внимания оказался так называемый «J-пространство» (J-space) — набор внутренних нейронных паттернов, которые, по словам Anthropic, играют особую роль в процессе обработки информации моделью.
Суть открытия:
- Метод: Исследователи применили математический аппарат, основанный на концепции якобиана, чтобы «декодировать» внутренние числовые значения (аннотации), которые модель приписывает токенам в процессе прохождения через свои слои.
- Интерпретируемость: Им удалось экспериментально доказать, что определенные комбинации чисел в матрице влияют на то, какое слово модель выберет следующим. Они назвали это «J-линзой», позволяющей увидеть, как модель «размышляет» о концепциях, не записывая их в явном виде в тексте.
- Эксперименты: В качестве примера приводится запрос о цвете четвертой планеты от Солнца. Исследователи показали, что если принудительно изменить внутренние «аннотации» модели с паттернов, соответствующих Марсу, на паттерны Земли, модель выдаст ответ «синий» вместо «красный», подтверждая влияние этих скрытых данных на семантику вывода.
Ньюпорт отмечает, что само по себе исследование того, как именно нейронные сети кодируют высокоуровневые концепции, — это интересная работа, но она лишь подтверждает то, что специалисты в области глубокого обучения понимали уже давно.
🧩 Как на самом деле работают языковые модели 3:32
Чтобы развеять ореол таинственности, Кэл Ньюпорт приводит высокоуровневое объяснение того, что происходит «под капотом» любой LLM, будь то Claude или семейство GPT.
Механика работы:
- Трансформерные блоки: Модель состоит из цепочки слоев. Входной запрос (промпт) проходит через них последовательно, как через конвейер.
- Аннотирование: На каждом этапе «слои-ученые» добавляют свои аннотации к токенам, передавая их дальше по цепочке. Ньюпорт сравнивает это с чтением страницы Талмуда: в центре находится текст (токен), а вокруг него накапливаются слои комментариев (аннотаций), уточняющих значение.
- Двойная задача: Модель решает одновременно две задачи: что грамматически допустимо сказать следующим (синтаксис) и что семантически осмысленно в контексте промпта.
- Финальный выбор: Последний слой, основываясь на всей накопленной «массе» аннотаций, выдает вероятностное распределение токенов.
По мнению Ньюпорта, «открытие» Anthropic — это просто наблюдение за работой этих самых аннотаций, которые всегда были неотъемлемой частью процесса глубокого обучения.
🚫 Почему риторика компании вызывает критику 21:44
Главная претензия ведущего подкаста заключается в использовании антропоморфного языка, который вводит в заблуждение как широкую аудиторию, так и традиционные СМИ.
- Дискурс о сознании: Использование терминов вроде «познание», «загадки», «размышления» — это сознательная стратегия, направленная на создание ощущения «цифрового ужаса» (digital ick). Это отвлекает внимание от реальных бизнес-вопросов: прибыльности компании, стоимости API и отсутствия у моделей конкурентных преимуществ в специализированных задачах.
- «Сделал сам»: Утверждение Anthropic о том, что модель «сама» выработала эти паттерны, Ньюпорт называет глубоко неискренним. Это основа машинного обучения — нейронные сети обучаются на данных, минимизируя функцию потерь, и «программирование» весов в привычном понимании отсутствует у любой такой системы.
- Ошибочные аналогии: Ньюпорт указывает на спекулятивность попыток связать эти результаты с теорией глобального рабочего пространства (Global Workspace Theory) человеческого сознания. В отличие от человека, LLM — это строго прямоточная (feed-forward) архитектура, где нет «состояния», которое сохранялось бы между вызовами.
В завершение Кэл Ньюпорт призывает Anthropic прекратить выпускать «беллетризированные» отчеты и сосредоточиться на публикации реальных компьютерных исследований, а пользователей — сохранять скептицизм в отношении новостей об «оживших» алгоритмах.