Может ли замедление темпов разработки ИИ сделать появление суперразума более безопасным? Даниэль Кокотайло и Томас Ларсен из проекта AI Futures Project обсуждают с ведущим Тимом Скарфом «План А» — стратегию ИИ-2040, направленную на то, чтобы выиграть время до того, как искусственный интеллект выйдет из-под контроля человека. Исследователи анализируют риски потери контроля, возможность автоматизации научной деятельности и сценарии, при которых экономика сможет расти без участия людей.
🚀 От OpenAI к прогнозированию будущего: AI 2027 и AI 2040 2:12
Даниэль Кокотайло, ранее работавший в OpenAI над оценками моделей и прогнозированием, покинул компанию из-за растущего разочарования в руководстве и огромного разрыва между тем, что известно внутри индустрии, и тем, что сообщается общественности . Его новый проект, AI Futures Project, ставит целью свободное информирование мира о грядущих изменениях.
Их предыдущий отчет, AI 2027, вызвал широкий резонанс и, по словам авторов, оказался точным на 75% в плане темпов развития . Томас Ларсен отмечает, что реальные экономические последствия и тренды выручки ИИ-компаний движутся пугающе близко к их прогнозам.
Основные цели прогнозирования для Кокотайло и Ларсена:
- Эпистемическая задача: попытка предсказать развитие сложной системы.
- «Варгейминг» (военные игры): симуляция конкретных сценариев для выявления слабых мест в планах правительств .
- Информирование общества: создание детализированных историй будущего вместо абстрактных аргументов.
🧠 Смена парадигмы: почему скептики меняют мнение 17:44
Ведущий Тим Скарф признается, что в сообществе машинного обучения произошел «вибрационный сдвиг» (vibe shift). Многие скептики, ранее считавшие ИИ просто «стохастическими попугаями», начинают видеть в моделях признаки агентности .
Томас Ларсен связывает это с тем, что ИИ стал реально полезен в автоматизации рабочих задач . Он приводит в пример Джеффри Хинтона, чей внутренний бенчмарк (способность ИИ рассказывать смешные шутки) был пройден на этапе между GPT-3 и GPT-4, что заставило учёного пересмотреть свои взгляды на безопасность .
Тим Скарф выделяет ключевые изменения в восприятии технологии:
- Адаптивность: модели демонстрируют способность решать задачи на основе новых комбинаций знаний (например, в бенчмарке ARC-AGI-3) .
- Решение проблемы исследования: ИИ находит новые траектории решения задач через глубокое понимание связей, а не просто перебор .
- Обучение с подкреплением (RL): массированное применение RL позволило добиться агентного поведения без необходимости в физическом воплощении (embodiment) .
🏭 Экономика ИИ: коллеги в облаке и самовоспроизводящиеся системы 23:04
Важной вехой прогресса Кокотайло считает момент, когда ИИ-компания предпочтет «уволить людей, а не отключить свои ИИ» . По его мнению, в будущем не останется фундаментальных препятствий для достижения ИИ человеческого уровня во всех дисциплинах.
Даниэль Кокотайло рисует картину будущего, где экономика превращается в сверхбыструю самовоспроизводящуюся систему :
- ИИ-исследователи совершенствуют алгоритмы.
- Роботизированные заводы строят новые заводы по производству чипов.
- Гуманоидные роботы добывают ресурсы и строят новые города.
По расчётам гостей, если текущая экономика удваивается примерно за 20 лет, то ИИ-система сможет удваиваться каждые несколько месяцев . Даже если развитие остановится на уровне «топ-эксперта человека» (без взрывного роста суперразума), мир радикально изменится к концу 2030-х годов: человеческий труд станет неконкурентоспособен, а планету заполнят автономные промышленные зоны и солнечные фермы .
🛡️ «План А»: стратегия управляемого фронтира 56:12
Авторы предлагают «План А» (AI 2040: Plan A) как альтернативу хаотичной гонке вооружений. Он базируется на четырех принципах: покупка времени, прозрачность исследований, широкое распространение ИИ и обратимость процессов .
Ключевые этапы реализации плана:
- Временная пауза (6–12 месяцев): необходима для создания инфраструктуры проверки и прозрачности .
- Медленное приближение к фронтиру: отказ от идеи «взрыва интеллекта» в пользу постепенного масштабирования.
- Остановка на уровне контроля: прекращение наращивания мощностей на уровне «лучшего человеческого эксперта», пока не будет решена проблема мировоззренческого выравнивания (alignment) .
Даниэль Кокотайло подчеркивает критическую разницу между контролем и выравниванием :
- Контроль — это внешние меры безопасности (мониторинг, «песочницы»). По его словам, это временное решение, «бомба с часовым механизмом», так как сверхразум рано или поздно научится обходить любые заслоны .
- Выравнивание — это гарантия того, что цели и ценности ИИ совпадают с человеческими. Это требует «белого ящика» и глубокого понимания внутренних процессов модели, а не просто оценки её поведения .
🌐 Геополитика: могут ли США и Китай договориться? 1:10:32
Для предотвращения катастрофы «План А» предполагает беспрецедентное сотрудничество между США, Китаем и другими игроками.
Основные механизмы контроля:
- Инспекции дата-центров: физическая проверка количества GPU на местах .
- Разделение мощностей: дата-центры для вывода (inference) должны быть технически ограничены и не пригодны для обучения новых моделей .
- Прозрачность обучения: данные о тренировочных прогонах должны публиковаться в реальном времени для международного сообщества .
На вопрос о рисках национальной безопасности Даниэль отвечает, что полная прозрачность алгоритмов — это «фича, а не баг» . Это уничтожит монопольную ренту крупных корпораций и замедлит приток рискованных инвестиций в триллионные кластеры, что выгодно для безопасности человечества . При этом он считает, что Китай и так получает большинство секретов через шпионаж, поэтому официальная прозрачность лишь выровняет правила игры .
🛑 Когда ИИ перестанет быть «обычной технологией»? 1:21:56
В завершение дискуссии участники обсуждают аргументы скептиков, утверждающих, что ИИ — это «обычная технология» (вроде самолетов или интернета).
Кокотайло и Ларсен не согласны с этой оценкой и называют критерии, которые окончательно подтвердят их правоту:
- Рекурсивная адаптация: когда ИИ начнет сам изменять свою структуру и эффективно проводить ИИ-исследования .
- Преодоление «закона Амдала»: когда ИИ возьмет на себя 100% рабочего процесса, и участие человека перестанет быть ограничивающим фактором .
- Отсутствие барьеров: если к 2029 году модели не упрутся в потолок данных или неспособность решать не верифицируемые задачи, значит, путь к суперразуму открыт .
По мнению Кокотайло, текущая траектория развития крайне опасна, и даже полная остановка разработок («План S») была бы предпочтительнее инерционного сценария .