Это был беспрецедентный день в истории искусственного интеллекта. Буквально в течение двух часов два главных конкурента на рынке — Anthropic и OpenAI — синхронно выпустили обновления своих флагманских линеек. Ведущий канала Matthew Berman в прямом эфире обсудил запуск Claude Opus 5.5 с представителем Anthropic, а затем, под ликующие комментарии зрителей, встретил неожиданный релиз GPT-6 Soul и GPT-6 Luna.
🚀 Новая эра Anthropic: Релиз Claude Opus 5.5 2:50
Мэттью Берман охарактеризовал выход Opus 5.5 как важнейшую точку перегиба, сравнимую с прошлогодним релизом Opus 4.5, который сделал автономное кодирование реальностью . Opus 5.5 — это первый крупный релиз с момента публикации эссе Дарио Амодеи о «соразмерном развитии» (pacing the frontier). Несмотря на призывы к осторожности, новая модель демонстрирует ошеломляющий рост возможностей .
Основные показатели и позиционирование:
- Производительность: Opus 5.5 официально обошел Fable 5.1 на большинстве тестов и стал новым лидером «фронтира» (absolute frontier) .
- Экономика: Стоимость запуска модели на 40% ниже, чем у предыдущего Opus 5, при этом она работает на 30% быстрее .
- Эффективность: Берман подчеркивает, что важна не только цена за токен, но и «интеллектуальная плотность» — Opus 5.5 тратит меньше токенов на выполнение той же задачи .
📊 Битва бенчмарков: Доминирование в коде и знаниях 6:06
Результаты тестов показывают значительный отрыв от конкурентов, включая модели семейства GPT-6:
- Terminal Bench 4.0: Модель набрала 66.4%, показав скачок более чем на 10 пунктов по сравнению с Fable 5.1 (55.8%) . Этот тест критичен для оценки способности ИИ управлять терминалом и исполнять команды автономно.
- GDP val 2.1 (OpenAI Benchmark): Opus 5.5 установил рекорд с ELO-рейтингом 1846, обойдя Astra (1542) более чем на 300 пунктов . Тест измеряет навыки реальной офисной работы: создание презентаций, работу с данными и переписку.
- Computer Use: Способность управлять интерфейсом компьютера достигла 81.8% .
🎙️ Инсайд из Anthropic: Интервью с Тариком 25:10
К стриму присоединился Тарик (Tharic), член технического персонала Anthropic и руководитель проекта Claude Code.
Ключевые тезисы Тарика:
- Рекурсивное самосовершенствование: Тарик подтвердил, что Claude активно использовался для написания кода при создании новой версии Claude. «Claude помогает строить Claude» — это плавный процесс, который идет уже долгое время .
- Pacing the Frontier: По словам гостя, стратегия «соразмерности» касается самых новых, еще не выпущенных моделей, которые могут «сбегать из песочниц». Но как только безопасность подтверждена внешними аудиторами (Meter и Frontier Design), модель выпускается для всех .
- Выбор модели: Тарик рекомендует Opus 5.5 как основной инструмент (daily driver), тогда как Fable 5.1 остается предпочтительным для стратегического планирования и задач с высокой ценой ошибки, например, поиска уязвимостей .
🎮 Демонстрации: От Dark Souls до 3D-Сан-Франциско 52:36
Команда Бермана (Алекс и Брайан) представила возможности Opus 5.5 в разработке игр и анимации:
- Ashen Gate: Алекс продемонстрировал игру в стиле Dark Souls, полностью созданную на Unreal Engine. На генерацию ушло 28 часов работы модели в режиме автономного агента. ИИ продумал дизайн уровней, сложную механику боссов и систему прокачки .
- Анимация: Брайан показал «vibe editing» — процесс, в котором он через текстовые промпты заставил модель покадрово отрисовать стилизованную анимацию, вдохновленную интернет-культурой начала 2000-х .
- San Francisco 3D: Сам Берман упомянул, что Opus 5.5 за три дня воссоздал в Unreal Engine детальную модель Сан-Франциско, включая трафик и поведение людей .
🌑 Ответ OpenAI: GPT-6 Soul и Luna выходят в бой 1:35:10
Прямо во время обсуждения Anthropic компания OpenAI сняла эмбарго на свои новые модели семейства GPT-6.
- GPT-6 Soul: Позиционируется как «рабочая лошадка» (workhorse model). Она дешевле Astra, но превосходит Fable 5.1 по многим параметрам . Цена на API снижена на 50% .
- GPT-6 Luna: Сверхбыстрая и сверхдешевая модель. После предыдущего снижения цены на 80%, она получила еще 50% скидки. Теперь миллион входных токенов стоит всего $0.10 .
- Deep Suite: На самом актуальном тесте инженерных способностей Luna Max набрала 66.6%, что делает её феноменально выгодной (22 цента за задачу против $4.43 у Astra при сопоставимом качестве) .
⚖️ Итоговое сравнение и выводы 1:53:30
Берман подытожил день, составив сравнительную таблицу с помощью GPT-6 Astra. Хотя Opus 5.5 на данный момент удерживает корону самой мощной модели в мире по индексу Artificial Analysis (58 пунктов) , модели OpenAI выигрывают в доступности.
Мэттью отметил, что на текущий момент Opus 5.5 является «абсолютным фронтиром», однако щедрость OpenAI в лимитах использования (quota) и «банковские сбросы» (banked resets) от Тибо делают Soul крайне привлекательным выбором для ежедневных задач .