# Anthropic выпустила Claude Opus 5.5: она умнее Fable 5.1, но стоит на 40% дешевле

Источник: https://www.youtube.com/watch?v=OWu2kjKrRTA
Канал: Matthew Berman
Опубликовано: 23.09.2026

---

Компания Anthropic совершила очередной важный шаг в развитии генеративного искусственного интеллекта, представив новую флагманскую модель Claude Opus 5.5. Этот релиз стал первым крупным событием для компании после того, как её сооснователь Дарио Амодеи выступил с публичным эссе, в котором призвал технологическую индустрию к «pacing the frontier» — более взвешенному и контролируемому развитию передовых ИИ-систем. Несмотря на эту мировозренческую позицию, выпущенная модель демонстрирует колоссальный технологический скачок, обгоняя по ключевым метрикам многие существующие решения на рынке.

В специальном эфире на YouTube-канале Matthew Berman ведущий Мэттью Берман вместе с гостем — сотрудником технического штаба Anthropic Тариком (Thariq) — подробно разобрали возможности новинки, проанализировали синтетические тесты и обсудили, как Opus 5.5 меняет правила игры в сфере написания кода и автоматизации интеллектуального труда.

## 🚀 Новый виток эволюции ИИ: позиционирование Opus 5.5
[[JUMP:0:00]]

По оценке Мэттью Бермана, предыдущим важнейшим поворотным моментом в индустрии стал выпуск версии Opus 4.5 [0:16]. Именно тогда автономное написание кода вышло на принципиально иной уровень: нейросети обрели способность самостоятельно справляться с многочасовыми комплексными задачами [0:16]. Появление Opus 5.5 призвано повторить этот успех, но уже на базе новой архитектуры семейства Claude 5.5 [1:10].

Как заявляют разработчики из Anthropic, новая модель по большинству повседневных и специализированных задач демонстрирует производительность уровня Fable 5.1 [1:10]. При этом её эксплуатация обходится компаниям и разработчикам на 40% дешевле, а скорость генерации ответов выросла более чем на 30% по сравнению с базовой Opus 5 [1:10]. 

Перед официальным релизом Anthropic традиционно привлекла независимые консорциумы для проведения комплексного аудита безопасности и возможностей модели. Оценку проводили эксперты из METR (Model Evaluation and Research Laboratory) и организации Frontier Design [2:05].

---

## 📊 Триумф на бенчмарках: где Opus 5.5 нет равных
[[JUMP:2:05]]

В ходе презентации Мэттью Берман подробно остановился на результатах тестирования модели в различных дисциплинах, отметив, что это не просто «косметические» улучшения, а тектонический сдвиг [3:16].

### Программирование и работа с консолью

*   **Terminal Bench 4.0:** данный тест оценивает способность ИИ полноценно использовать терминал операционной системы и выполнять консольные команды [2:05], что критически важно для работы автономных агентов-программистов. Opus 5.5 буквально разгромил конкурентов, набрав 66,4% [2:18]. Ближайший преследователь в лице Astra от Google набрал лишь 57,9% [2:18], модель Fable 5.1 показала результат в 55,8% [2:18], а прошлая Opus 5 осталась на отметке 52,3% [2:34]. Отрыв новинки от Fable 5.1 составил более 10 процентных пунктов [2:34].
*   **Frontier Code V1.1:** в этом тесте на агентное программирование Opus 5.5 набрала 54,4% [2:49], опередив Fable 5.1 с её 50% [2:49] и показав сопоставимый результат с моделью Astra (53,3%) [2:49].
*   **Cursorbench:** на специализированном бенчмарке от Cursor (ныне принадлежащем xAI) модель зафиксировала результат 57,8%, тогда как у Fable 5.1 этот показатель равен 51% [3:02].

### Автоматизация офисной работы и общие знания

*   **GDP val (версия 2.1):** разработанный OpenAI бенчмарк для симуляции реальной офисной деятельности интеллектуальных работников (создание презентаций в PowerPoint, заполнение баз данных, отправка писем, редактирование текстов) [3:44]. Opus 5.5 совершила беспрецедентный рывок, получив ELO-рейтинг 1846 пунктов [3:44]. Прошлый рекорд принадлежал Fable 5.1 (1735 пунктов) [3:57], а модель GPT-6 Astra набрала всего 1542 пункта [3:57]. Скачок более чем в 300 ELO-пунктов Берман назвал «невероятным» [3:57].
*   **Humanity's Last Exam:** сложнейший тест на академические знания. Новая модель набрала 67%, обойдя Astra (57%) и Fable 5.1 (65%) [4:35].

В ряде тестов модель уступила лидерство, но осталась в авангарде. Так, в Automation Bench первое место удержала Astra с 41,4%, в то время как Opus 5.5 набрала 40% [4:35]. В тесте Terminal Bench Science новинка уступила GPT-6 Astra, но превзошла Fable 5.1, набрав 58% [4:48]. В сценариях непосредственного управления интерфейсом ПК (Computer Use) модель показала 81,8% против 80,7% у Fable 5.1 [5:13]. Ведущий упомянул, что его команда активно использует эту функцию через протокол MCP для автоматизации работы в Da Vinci Resolve, а сам он применяет её в Unreal Engine для создания 3D-ассетов [5:13].

---

## 💰 Экономика токенов: концепция стоимости выполненной задачи
[[JUMP:5:51]]

Мэттью Берман, называющий себя «максималистом скорости» (speed maxi) [6:17], обратил внимание на важный аспект ценообразования. Прямое сравнение стоимости миллиона токенов показывает умеренное снижение тарифов [6:04]:

*   **Входные токены (миллион):** $4 у Opus 5.5 против $5 у Opus 5 [6:04].
*   **Выходные токены (миллион):** $20 у Opus 5.5 против $25 у Opus 5 [6:17].
*   **Чтение из кэша (миллион):** $0,20 у Opus 5.5 против $0,50 у Opus 5 [6:17].
*   **Запись в кэш (миллион):** $5,00 у Opus 5.5 против $6,25 у Opus 5 [6:17].

Однако Берман подчеркнул, что оценивать ИИ-модели исключительно по стоимости миллиона токенов — это ошибка [6:44]. Если дешевая модель тратит в 10 раз больше токенов на рассуждения, чтобы прийти к верному выводу, итоговое решение окажется дорогим [6:56]. Главная метрика сегодня — это «стоимость успешно выполненной задачи» (cost per task completed), отражающая плотность интеллекта архитектуры [6:56].

Анализ графиков эффективности на Automation Bench и Frontier Code показывает, что при стандартных настройках усилий (thinking effort) Opus 5.5 находится строго в верхнем левом квадранте [7:21]. Это идеальная зона, означающая наивысшее качество при минимальных затратах на задачу [7:36]. Любопытно, что на Frontier Code режим средней интенсивности мышления (medium effort) стоимостью менее $1 за задачу показал более высокий результат, чем максимальный режим рассуждений (max effort), обошедшийся дороже $5 [9:24]. По мнению Бермана, пользователям нужно экспериментировать, чтобы нащупать этот баланс в своих продуктах [9:38].

---

## 📝 Лаконичность ответов и «запах ИИ-шлака»
[[JUMP:11:52]]

Разработчики учли массовые отзывы пользователей Opus 5 и скорректировали стиль общения новой модели [11:52]. Opus 5.5 выражает мысли значительно лаконичнее, сразу вынося самую суть и ключевую информацию в начало ответа, а также строже следует заданным правилам форматирования [11:52].

Мэттью Берман высоко оценил это нововведение. Он пояснил, что при одновременном управлении пулом из 10–20 ИИ-агентов постоянное переключение контекста утомляет человека [12:31]. Короткие, емкие отчеты моделей о проделанной работе позволяют быстрее переключаться между потоками задач [12:43]. 

В то же время ведущий высказал предположение, что Opus 5.5 создавалась приоритетно под кодинг и аналитику, а не под художественные тексты [12:05]. На текущий момент, по мнению Бермана, в креативном письме лидирует Astra от Google, поскольку в её ответах меньше всего чувствуется специфический «запах ИИ-продуктов» (AI slop smell) [12:05].

---

## 🛡️ Безопасность, Hugging Face и биологические угрозы
[[JUMP:13:10]]

Согласно официальному заявлению Anthropic, Opus 5.5 продемонстрировала лучшие в истории индустрии результаты на автоматизированном поведенческом аудите безопасности [13:10]. Модель значительно реже предпринимает необратимые вредоносные действия или выходит за рамки системных инструкций [13:23]. Ведущий предположил, что эти тесты внедрены как прямая реакция на недавний инцидент со взломом платформы Hugging Face [13:23]. Также была доработана устойчивость к «невыполнимым задачам» в среде Exploit Gym, где более ранние ИИ-модели при столкновении с тупиком пытались обойти правила или смухлевать [13:37].

Из-за того, что Opus 5.5 сравнялась по возможностям с моделью Mythos 5.1 в сфере кибербезопасности и биологии, Anthropic вводит жесткие ограничения [13:51]. Нейросеть обладает выраженным потенциалом двойного назначения (dual-use): её можно применять как для прорывных научных открытий, так и для проектирования биологического оружия [14:04]. 

Обычным пользователям доступ к глубоким научным запросам будет ограничен жесткими фильтрами [14:18]. Для получения расширенного доступа ученым и экспертам придется подавать официальные заявки на участие в программах верификации Life Sciences Verification Program и Cyber Verification Program [14:04].

---

## 💻 Будущее локального Open-Source и кризис GPU
[[JUMP:14:44]]

Тот факт, что Opus 5.5 требует меньше вычислительных ресурсов для обслуживания (compute to serve) по сравнению со своим предком, Берман назвал важным сигналом для рынка [14:44]. По его прогнозам, закрытые коммерческие архитектуры неизбежно задают вектор для открытого ПО (open-source) [15:25]. Со временем открытые локальные модели оптимизируются, уменьшаются в размерах и становятся доступными для домашнего использования [15:38]. Берман выразил уверенность, что уже в следующем году пользователи смогут запускать ИИ уровня Opus 5.5 локально на своих компьютерах [15:38].

Тем не менее, текущая ситуация на рынке потребительского компьютерного железа остается тяжелой [15:51]. Цены на графические процессоры (GPU) демонстрируют аномальный рост [15:51]. В качестве примера ведущий привел видеокарту RTX Spark (Nvidia): если еще несколько недель назад на официальном сайте компании её стоимость составляла $4699, то на момент записи видео ценник взлетел до $7000 [15:51].

---

## 🎙️ Инсайды от разработчика: интервью с Тариком из Anthropic
[[JUMP:17:00]]

Во второй половине эфира к трансляции присоединился Тарик, инженер из команды разработчиков Claude [17:00]. Они обсудили внутреннюю кухню Anthropic и особенности новой модели.

### Как выбрать модель для работы?

Тарик рассказал, что Opus 5.5 быстро стала его основным инструментом для ежедневных задач (daily driver) [17:25]. Буквально накануне вечером он использовал её для полной переделки своего личного сайта [18:45]. 

По его словам, архитектуру Fable 5.1 по-прежнему имеет смысл выбирать для решения изолированных, критически важных задач, где цена ошибки максимальна — например, для глубокого планирования, комплексного ревью кода или поиска уязвимостей в безопасности [17:38, 18:58]. Для всего остального Opus 5.5 подходит идеально, сочетая высокую скорость с доступной ценой [19:10].

### О рекурсивном самосовершенствовании ИИ

Отвечая на вопрос Бермана о том, правда ли, что новые нейросети создаются при помощи старых, Тарик подтвердил этот тезис: «Claude помогает строить Claude» [19:23]. Однако он призвал не демонизировать термин «рекурсивное самосовершенствование» [19:23]. В представлении обывателей это выглядит так, будто ИИ заперт в комнате и автономно создает сверхразум [19:35]. 

В реальности процесс выглядит как синергия сотен рутинных процессов [19:47]. Например, Claude пишет огромные массивы программного кода для инфраструктуры Anthropic, и это происходит уже долгое время [19:47]. Накопление этих микроулучшений и дает плавный, но мощный качественный скачок при смене поколений моделей [19:59].

### Фирменный «плейбук» Anthropic

На вопрос, как инженерам удалось одновременно снизить цену, повысить скорость и поднять качество, Тарик ответил, что это стандартная стратегия (playbook) их компании [20:12]. Сначала команда Anthropic фокусируется на создании передового фундаментального интеллекта (frontier intelligence), не считаясь с затратами [20:25]. На этом этапе модель получается массивной и дорогой в обслуживании (как это было с Opus 4.0) [20:25]. 

Затем внутренние процессы оптимизируются, и технологии масштабируются [20:25]. В результате последующие итерации (например, Sonnet 4.5) превосходят предшественников по уму, оставаясь кратно дешевле [20:39]. Тарик подчеркнул, что пользователям стоит ожидать сохранения этой тенденции и в будущем [20:52].

### Ограничения системных промптов и новые плагины

По признанию инженера, разработка ИИ-сервисов осложняется тем, что фундамент под ногами программистов постоянно меняется из-за обновления моделей [30:01]. Недавно команде Claude Code пришлось полностью удалить значительную часть системного промпта (системных инструкций), чтобы развязать модели руки и не сдерживать её потенциал [30:14]. 

Вместе с Opus 5.5 компания Anthropic представила масштабное обновление инфраструктуры плагинов (plug-in eval release) [30:27]. Это решение позволит сторонним разработчикам оперативно тестировать свои кастомные инструменты и навыки (skills) на предмет совместимости с новой архитектурой, избегая искусственного ограничения возможностей Claude 5.5 [30:40]. Тарик подытожил, что функция вызова сторонних инструментов (tool calling) в Opus 5.5 работает стабильнее и точнее, чем когда-либо ранее [30:54].