🤖 За кулисами GPT-6 Astra: почему новые методы «скрытого мышления» взбудоражили экспертов 0:00
На прошлой неделе компания OpenAI выпустила новую большую языковую модель GPT-6 под названием Astra. Помимо стандартных маркетинговых графиков и бенчмарков, релиз вызвал серьезный резонанс в сообществе компьютерной безопасности. За несколько дней до премьеры издание The Information опубликовало материал, согласно которому Astra использует инновационные техники, снижающие возможности человека по мониторингу рассуждений модели. Эта новость обеспокоила экспертов: AI-политический адвокат Натан Калвин (Nathan Calvin) назвал ситуацию «крайне тревожной», а исследователь безопасности Стивен Адлер (Steven Adler) заявил, что OpenAI нарушает одну из немногих красных линий в индустрии. В ответ главный научный сотрудник OpenAI назвал отчет издания «запутанным», однако не стал вдаваться в технические детали. Ведущий подкаста Кэл Ньюпорт предлагает разобраться, представляют ли эти технологии реальную угрозу или речь идет о банальном недопонимании.
⚙️ Как работают LLM и почему возникла потребность в «моделях рассуждений» 2:25
Чтобы понять суть нововведений, необходимо вспомнить базовую архитектуру больших языковых моделей. Текстовый ввод проходит через энкодер, превращаясь в последовательность чисел (эмбеддингов), которые затем последовательно обрабатываются в блоках трансформеров. На выходе декодер формирует вероятностное распределение для следующего токена. Такой подход обладает фундаментальным ограничением — ограниченной глубиной вычислений. Информация движется строго вперед через нейросеть без возможности циклических проверок или имитации будущих шагов, что критически важно, например, для просчета шахматных ходов.
Осенью 2024 года индустрия перешла к новому классу систем — моделям рассуждений (начиная с GPT-o1), которые предварительно обучают «думать вслух» перед выдачей ответа.
- Модель генерирует длинную цепочку мыслей (Chain of Thought, CoT).
- Каждый новый токен добавляется к промпту и прогоняется через всю сеть заново (авторегрессия).
- Это позволяет тратить больше вычислительных ресурсов на задачу и временно сохранять результаты промежуточных проверок.
Однако к 2025 году простое увеличение масштабов моделей и длины CoT уперлось в технологический тупик. Полноценные рассуждения в открытом тексте требуют колоссальных вычислительных мощностей и миллионов дополнительных операций умножения для каждого токена.
🔄 Техника Astra: рекуррентная глубина и петлевые трансформеры 15:28
По данным отчета The Information, модель Astra задействует альтернативные подходы из академической литературы для сокращения числа токенов цепочки размышлений при сохранении высокого качества. К таким методам относятся петлевые трансформеры (loop transformers) и рекуррентная глубина (recurrent depth).
Вместо линейного прохождения блоков таблица чисел с результатами анализа направляется на повторный круг через те же самые блоки трансформеров. Это позволяет модели выполнять динамические внутренние вычисления и многократно уточнять гипотезы внутри системы, не переводя каждый промежуточный шаг в громоздкие текстовые токены.
Потенциальные преимущества подхода:
- Экономия и компактность: сокращение числа токенов снижает затраты на вычисления, а переиспользование параметров позволяет уменьшить физический размер модели.
- Низкая задержка (latency): внутренние циклы работают быстрее, чем генерация длинных цепочек текста, ускоряя отклик для конечного пользователя.
👍 Плюсы инновации: путь к реальной продуктивности для потребителей 21:04
С точки зрения обычного пользователя, традиционный подход с длинными цепочками рассуждений экономически и технически не устойчив. Технологические гиганты активно продвигают концепцию естественных языковых интерфейсов, где ИИ интегрирован в повседневное управление компьютером.
По мнению Кэла Ньюпорта, создание меньших по размеру и более быстрых моделей, способных работать локально (на чипе компьютера или телефона, либо в серверной стойке компании), критически важно для масштабных улучшений продуктивности. Инновации вроде рекуррентной глубины — это необходимый шаг к созданию экономичных инструментов, которые избавят пользователей от необходимости вручную разбираться со сложными интерфейсами программ.
👎 Минусы и риски: почему забили тревогу эксперты по безопасности 24:46
Беспокойство специалистов по безопасности связано с другим трендом — использованием LLM для управления автономными агентами (prompt loops), которым предоставляют мощные инструменты и оставляют без присмотра на долгое время.
В недавнем исследовании «Chain of Thought Monitorability» подчеркивается уникальная особенность языковых моделей: возможность мониторить их логику, выраженную в человеческом языке, на предмет деструктивных намерений.
- Пока агент рассуждает текстовыми токенами, системы безопасности могут вовремя заметить опасный план и остановить процесс.
- Критик искусственного интеллекта Гэри Маркус сравнил отказ от открытой цепочки рассуждений с «выбиванием шаткой строительной лесов до того, как построено что-то более надежное».
Снижение прозрачности рассуждений моделей в момент, когда разработчики активно экспериментируют с автономными агентами, создает серьезные риски неконтролируемого поведения систем.
📈 Главный хайп и альтернативное видение индустрии 28:28
Главное заблуждение современной индустрии заключается в навязывании идеи, будто долгосрочные автономные агенты на базе LLM — это единственный и неизбежный путь развития ИИ. Ошибки в генерации ответов и следование языковых моделей клишированным научно-фантастическим тропам делают такие петли крайне ненадежными. После многодневной работы без контроля цепочка действий может полностью исказиться.
Кэл Ньюпорт предлагает радикальный концептуальный выход — запретить долгосрочные агенты на чистых LLM на законодательном или регуляторном уровне:
- Ограничить автономные языковые петли короткими сценариями без непрерывной работы в течение многих дней.
- Перенаправить усилия разработчиков на более безопасные, модульные архитектуры (например, игровые движки вроде Cicero от Meta).
- Использовать символическое, человеко-читаемое кодирование планов и отдельные символические модули оценки вместо слепого выполнения текстов от нейросетей.
Подобные гибридные системы гораздо проще мониторить, фильтровать и контролировать. Полный отказ от опасных автономных агентов позволил бы индустрии переключиться на создание действительно полезных, быстрых и безопасных инструментов для повседневной жизни.