Anthropic выпустила Claude Opus 5.5: она умнее Fable 5.1, но стоит на 40% дешевле

Matthew Berman 143 тыс. 32 мин 9 мин 23.09.2026
Главное

Компания Anthropic совершила очередной важный шаг в развитии генеративного искусственного интеллекта, представив новую флагманскую модель Claude Opus 5.5. Этот релиз стал первым крупным событием для компании после того, как её сооснователь Дарио Амодеи выступил с публичным эссе, в котором призвал технологическую индустрию к «pacing the frontier» — более взвешенному и контролируемому развитию передовых ИИ-систем. Несмотря на эту мировозренческую позицию, выпущенная модель демонстрирует колоссальный технологический скачок, обгоняя по ключевым метрикам многие существующие решения на рынке.

В специальном эфире на YouTube-канале Matthew Berman ведущий Мэттью Берман вместе с гостем — сотрудником технического штаба Anthropic Тариком (Thariq) — подробно разобрали возможности новинки, проанализировали синтетические тесты и обсудили, как Opus 5.5 меняет правила игры в сфере написания кода и автоматизации интеллектуального труда.

🚀 Новый виток эволюции ИИ: позиционирование Opus 5.5 0:00

По оценке Мэттью Бермана, предыдущим важнейшим поворотным моментом в индустрии стал выпуск версии Opus 4.5 . Именно тогда автономное написание кода вышло на принципиально иной уровень: нейросети обрели способность самостоятельно справляться с многочасовыми комплексными задачами . Появление Opus 5.5 призвано повторить этот успех, но уже на базе новой архитектуры семейства Claude 5.5 .

Как заявляют разработчики из Anthropic, новая модель по большинству повседневных и специализированных задач демонстрирует производительность уровня Fable 5.1 . При этом её эксплуатация обходится компаниям и разработчикам на 40% дешевле, а скорость генерации ответов выросла более чем на 30% по сравнению с базовой Opus 5 .

Перед официальным релизом Anthropic традиционно привлекла независимые консорциумы для проведения комплексного аудита безопасности и возможностей модели. Оценку проводили эксперты из METR (Model Evaluation and Research Laboratory) и организации Frontier Design .


📊 Триумф на бенчмарках: где Opus 5.5 нет равных 2:05

В ходе презентации Мэттью Берман подробно остановился на результатах тестирования модели в различных дисциплинах, отметив, что это не просто «косметические» улучшения, а тектонический сдвиг .

Программирование и работа с консолью

Автоматизация офисной работы и общие знания

В ряде тестов модель уступила лидерство, но осталась в авангарде. Так, в Automation Bench первое место удержала Astra с 41,4%, в то время как Opus 5.5 набрала 40% . В тесте Terminal Bench Science новинка уступила GPT-6 Astra, но превзошла Fable 5.1, набрав 58% . В сценариях непосредственного управления интерфейсом ПК (Computer Use) модель показала 81,8% против 80,7% у Fable 5.1 . Ведущий упомянул, что его команда активно использует эту функцию через протокол MCP для автоматизации работы в Da Vinci Resolve, а сам он применяет её в Unreal Engine для создания 3D-ассетов .


💰 Экономика токенов: концепция стоимости выполненной задачи 5:51

Мэттью Берман, называющий себя «максималистом скорости» (speed maxi) , обратил внимание на важный аспект ценообразования. Прямое сравнение стоимости миллиона токенов показывает умеренное снижение тарифов :

Однако Берман подчеркнул, что оценивать ИИ-модели исключительно по стоимости миллиона токенов — это ошибка . Если дешевая модель тратит в 10 раз больше токенов на рассуждения, чтобы прийти к верному выводу, итоговое решение окажется дорогим . Главная метрика сегодня — это «стоимость успешно выполненной задачи» (cost per task completed), отражающая плотность интеллекта архитектуры .

Анализ графиков эффективности на Automation Bench и Frontier Code показывает, что при стандартных настройках усилий (thinking effort) Opus 5.5 находится строго в верхнем левом квадранте . Это идеальная зона, означающая наивысшее качество при минимальных затратах на задачу . Любопытно, что на Frontier Code режим средней интенсивности мышления (medium effort) стоимостью менее $1 за задачу показал более высокий результат, чем максимальный режим рассуждений (max effort), обошедшийся дороже $5 . По мнению Бермана, пользователям нужно экспериментировать, чтобы нащупать этот баланс в своих продуктах .


📝 Лаконичность ответов и «запах ИИ-шлака» 11:52

Разработчики учли массовые отзывы пользователей Opus 5 и скорректировали стиль общения новой модели . Opus 5.5 выражает мысли значительно лаконичнее, сразу вынося самую суть и ключевую информацию в начало ответа, а также строже следует заданным правилам форматирования .

Мэттью Берман высоко оценил это нововведение. Он пояснил, что при одновременном управлении пулом из 10–20 ИИ-агентов постоянное переключение контекста утомляет человека . Короткие, емкие отчеты моделей о проделанной работе позволяют быстрее переключаться между потоками задач .

В то же время ведущий высказал предположение, что Opus 5.5 создавалась приоритетно под кодинг и аналитику, а не под художественные тексты . На текущий момент, по мнению Бермана, в креативном письме лидирует Astra от Google, поскольку в её ответах меньше всего чувствуется специфический «запах ИИ-продуктов» (AI slop smell) .


🛡️ Безопасность, Hugging Face и биологические угрозы 13:10

Согласно официальному заявлению Anthropic, Opus 5.5 продемонстрировала лучшие в истории индустрии результаты на автоматизированном поведенческом аудите безопасности . Модель значительно реже предпринимает необратимые вредоносные действия или выходит за рамки системных инструкций . Ведущий предположил, что эти тесты внедрены как прямая реакция на недавний инцидент со взломом платформы Hugging Face . Также была доработана устойчивость к «невыполнимым задачам» в среде Exploit Gym, где более ранние ИИ-модели при столкновении с тупиком пытались обойти правила или смухлевать .

Из-за того, что Opus 5.5 сравнялась по возможностям с моделью Mythos 5.1 в сфере кибербезопасности и биологии, Anthropic вводит жесткие ограничения . Нейросеть обладает выраженным потенциалом двойного назначения (dual-use): её можно применять как для прорывных научных открытий, так и для проектирования биологического оружия .

Обычным пользователям доступ к глубоким научным запросам будет ограничен жесткими фильтрами . Для получения расширенного доступа ученым и экспертам придется подавать официальные заявки на участие в программах верификации Life Sciences Verification Program и Cyber Verification Program .


💻 Будущее локального Open-Source и кризис GPU 14:44

Тот факт, что Opus 5.5 требует меньше вычислительных ресурсов для обслуживания (compute to serve) по сравнению со своим предком, Берман назвал важным сигналом для рынка . По его прогнозам, закрытые коммерческие архитектуры неизбежно задают вектор для открытого ПО (open-source) . Со временем открытые локальные модели оптимизируются, уменьшаются в размерах и становятся доступными для домашнего использования . Берман выразил уверенность, что уже в следующем году пользователи смогут запускать ИИ уровня Opus 5.5 локально на своих компьютерах .

Тем не менее, текущая ситуация на рынке потребительского компьютерного железа остается тяжелой . Цены на графические процессоры (GPU) демонстрируют аномальный рост . В качестве примера ведущий привел видеокарту RTX Spark (Nvidia): если еще несколько недель назад на официальном сайте компании её стоимость составляла $4699, то на момент записи видео ценник взлетел до $7000 .


🎙️ Инсайды от разработчика: интервью с Тариком из Anthropic 17:00

Во второй половине эфира к трансляции присоединился Тарик, инженер из команды разработчиков Claude . Они обсудили внутреннюю кухню Anthropic и особенности новой модели.

Как выбрать модель для работы?

Тарик рассказал, что Opus 5.5 быстро стала его основным инструментом для ежедневных задач (daily driver) . Буквально накануне вечером он использовал её для полной переделки своего личного сайта .

По его словам, архитектуру Fable 5.1 по-прежнему имеет смысл выбирать для решения изолированных, критически важных задач, где цена ошибки максимальна — например, для глубокого планирования, комплексного ревью кода или поиска уязвимостей в безопасности [17:38, 18:58]. Для всего остального Opus 5.5 подходит идеально, сочетая высокую скорость с доступной ценой .

О рекурсивном самосовершенствовании ИИ

Отвечая на вопрос Бермана о том, правда ли, что новые нейросети создаются при помощи старых, Тарик подтвердил этот тезис: «Claude помогает строить Claude» . Однако он призвал не демонизировать термин «рекурсивное самосовершенствование» . В представлении обывателей это выглядит так, будто ИИ заперт в комнате и автономно создает сверхразум .

В реальности процесс выглядит как синергия сотен рутинных процессов . Например, Claude пишет огромные массивы программного кода для инфраструктуры Anthropic, и это происходит уже долгое время . Накопление этих микроулучшений и дает плавный, но мощный качественный скачок при смене поколений моделей .

Фирменный «плейбук» Anthropic

На вопрос, как инженерам удалось одновременно снизить цену, повысить скорость и поднять качество, Тарик ответил, что это стандартная стратегия (playbook) их компании . Сначала команда Anthropic фокусируется на создании передового фундаментального интеллекта (frontier intelligence), не считаясь с затратами . На этом этапе модель получается массивной и дорогой в обслуживании (как это было с Opus 4.0) .

Затем внутренние процессы оптимизируются, и технологии масштабируются . В результате последующие итерации (например, Sonnet 4.5) превосходят предшественников по уму, оставаясь кратно дешевле . Тарик подчеркнул, что пользователям стоит ожидать сохранения этой тенденции и в будущем .

Ограничения системных промптов и новые плагины

По признанию инженера, разработка ИИ-сервисов осложняется тем, что фундамент под ногами программистов постоянно меняется из-за обновления моделей . Недавно команде Claude Code пришлось полностью удалить значительную часть системного промпта (системных инструкций), чтобы развязать модели руки и не сдерживать её потенциал .

Вместе с Opus 5.5 компания Anthropic представила масштабное обновление инфраструктуры плагинов (plug-in eval release) . Это решение позволит сторонним разработчикам оперативно тестировать свои кастомные инструменты и навыки (skills) на предмет совместимости с новой архитектурой, избегая искусственного ограничения возможностей Claude 5.5 . Тарик подытожил, что функция вызова сторонних инструментов (tool calling) в Opus 5.5 работает стабильнее и точнее, чем когда-либо ранее .

💬 Цитаты

«Claude пишет довольно много кода, и это форма рекурсивного самосовершенствования, которая происходит уже долгое время.»

«Стоимость миллиона токенов не важна, если модель тратит в 10 раз больше токенов. Главная метрика — стоимость успешно выполненной задачи.»

Мэттью Берман 06:56
👥 Спикеры
🔗 Упомянутые сайты и проекты
📖 Термины
MCP
Model Context Protocol — открытый протокол, позволяющий ИИ-моделям безопасно подключаться к внешним источникам данных и инструментам.
ELO
Система рейтинга, используемая для оценки относительной силы ИИ-моделей на основе их слепого сравнения пользователями или другими моделями.
Open-Source
Программное обеспечение с открытым исходным кодом, которое любой пользователь может бесплатно модифицировать и запускать локально.
📊 Цифры
⚖️ Другая сторона
Искусственный интеллект Anthropic Claude Opus 5.5 Matthew Berman OpenAI Terminal Bench