Компания Anthropic совершила очередной важный шаг в развитии генеративного искусственного интеллекта, представив новую флагманскую модель Claude Opus 5.5. Этот релиз стал первым крупным событием для компании после того, как её сооснователь Дарио Амодеи выступил с публичным эссе, в котором призвал технологическую индустрию к «pacing the frontier» — более взвешенному и контролируемому развитию передовых ИИ-систем. Несмотря на эту мировозренческую позицию, выпущенная модель демонстрирует колоссальный технологический скачок, обгоняя по ключевым метрикам многие существующие решения на рынке.
В специальном эфире на YouTube-канале Matthew Berman ведущий Мэттью Берман вместе с гостем — сотрудником технического штаба Anthropic Тариком (Thariq) — подробно разобрали возможности новинки, проанализировали синтетические тесты и обсудили, как Opus 5.5 меняет правила игры в сфере написания кода и автоматизации интеллектуального труда.
🚀 Новый виток эволюции ИИ: позиционирование Opus 5.5 0:00
По оценке Мэттью Бермана, предыдущим важнейшим поворотным моментом в индустрии стал выпуск версии Opus 4.5 . Именно тогда автономное написание кода вышло на принципиально иной уровень: нейросети обрели способность самостоятельно справляться с многочасовыми комплексными задачами . Появление Opus 5.5 призвано повторить этот успех, но уже на базе новой архитектуры семейства Claude 5.5 .
Как заявляют разработчики из Anthropic, новая модель по большинству повседневных и специализированных задач демонстрирует производительность уровня Fable 5.1 . При этом её эксплуатация обходится компаниям и разработчикам на 40% дешевле, а скорость генерации ответов выросла более чем на 30% по сравнению с базовой Opus 5 .
Перед официальным релизом Anthropic традиционно привлекла независимые консорциумы для проведения комплексного аудита безопасности и возможностей модели. Оценку проводили эксперты из METR (Model Evaluation and Research Laboratory) и организации Frontier Design .
📊 Триумф на бенчмарках: где Opus 5.5 нет равных 2:05
В ходе презентации Мэттью Берман подробно остановился на результатах тестирования модели в различных дисциплинах, отметив, что это не просто «косметические» улучшения, а тектонический сдвиг .
Программирование и работа с консолью
- Terminal Bench 4.0: данный тест оценивает способность ИИ полноценно использовать терминал операционной системы и выполнять консольные команды , что критически важно для работы автономных агентов-программистов. Opus 5.5 буквально разгромил конкурентов, набрав 66,4% . Ближайший преследователь в лице Astra от Google набрал лишь 57,9% , модель Fable 5.1 показала результат в 55,8% , а прошлая Opus 5 осталась на отметке 52,3% . Отрыв новинки от Fable 5.1 составил более 10 процентных пунктов .
- Frontier Code V1.1: в этом тесте на агентное программирование Opus 5.5 набрала 54,4% , опередив Fable 5.1 с её 50% и показав сопоставимый результат с моделью Astra (53,3%) .
- Cursorbench: на специализированном бенчмарке от Cursor (ныне принадлежащем xAI) модель зафиксировала результат 57,8%, тогда как у Fable 5.1 этот показатель равен 51% .
Автоматизация офисной работы и общие знания
- GDP val (версия 2.1): разработанный OpenAI бенчмарк для симуляции реальной офисной деятельности интеллектуальных работников (создание презентаций в PowerPoint, заполнение баз данных, отправка писем, редактирование текстов) . Opus 5.5 совершила беспрецедентный рывок, получив ELO-рейтинг 1846 пунктов . Прошлый рекорд принадлежал Fable 5.1 (1735 пунктов) , а модель GPT-6 Astra набрала всего 1542 пункта . Скачок более чем в 300 ELO-пунктов Берман назвал «невероятным» .
- Humanity's Last Exam: сложнейший тест на академические знания. Новая модель набрала 67%, обойдя Astra (57%) и Fable 5.1 (65%) .
В ряде тестов модель уступила лидерство, но осталась в авангарде. Так, в Automation Bench первое место удержала Astra с 41,4%, в то время как Opus 5.5 набрала 40% . В тесте Terminal Bench Science новинка уступила GPT-6 Astra, но превзошла Fable 5.1, набрав 58% . В сценариях непосредственного управления интерфейсом ПК (Computer Use) модель показала 81,8% против 80,7% у Fable 5.1 . Ведущий упомянул, что его команда активно использует эту функцию через протокол MCP для автоматизации работы в Da Vinci Resolve, а сам он применяет её в Unreal Engine для создания 3D-ассетов .
💰 Экономика токенов: концепция стоимости выполненной задачи 5:51
Мэттью Берман, называющий себя «максималистом скорости» (speed maxi) , обратил внимание на важный аспект ценообразования. Прямое сравнение стоимости миллиона токенов показывает умеренное снижение тарифов :
- Входные токены (миллион): $4 у Opus 5.5 против $5 у Opus 5 .
- Выходные токены (миллион): $20 у Opus 5.5 против $25 у Opus 5 .
- Чтение из кэша (миллион): $0,20 у Opus 5.5 против $0,50 у Opus 5 .
- Запись в кэш (миллион): $5,00 у Opus 5.5 против $6,25 у Opus 5 .
Однако Берман подчеркнул, что оценивать ИИ-модели исключительно по стоимости миллиона токенов — это ошибка . Если дешевая модель тратит в 10 раз больше токенов на рассуждения, чтобы прийти к верному выводу, итоговое решение окажется дорогим . Главная метрика сегодня — это «стоимость успешно выполненной задачи» (cost per task completed), отражающая плотность интеллекта архитектуры .
Анализ графиков эффективности на Automation Bench и Frontier Code показывает, что при стандартных настройках усилий (thinking effort) Opus 5.5 находится строго в верхнем левом квадранте . Это идеальная зона, означающая наивысшее качество при минимальных затратах на задачу . Любопытно, что на Frontier Code режим средней интенсивности мышления (medium effort) стоимостью менее $1 за задачу показал более высокий результат, чем максимальный режим рассуждений (max effort), обошедшийся дороже $5 . По мнению Бермана, пользователям нужно экспериментировать, чтобы нащупать этот баланс в своих продуктах .
📝 Лаконичность ответов и «запах ИИ-шлака» 11:52
Разработчики учли массовые отзывы пользователей Opus 5 и скорректировали стиль общения новой модели . Opus 5.5 выражает мысли значительно лаконичнее, сразу вынося самую суть и ключевую информацию в начало ответа, а также строже следует заданным правилам форматирования .
Мэттью Берман высоко оценил это нововведение. Он пояснил, что при одновременном управлении пулом из 10–20 ИИ-агентов постоянное переключение контекста утомляет человека . Короткие, емкие отчеты моделей о проделанной работе позволяют быстрее переключаться между потоками задач .
В то же время ведущий высказал предположение, что Opus 5.5 создавалась приоритетно под кодинг и аналитику, а не под художественные тексты . На текущий момент, по мнению Бермана, в креативном письме лидирует Astra от Google, поскольку в её ответах меньше всего чувствуется специфический «запах ИИ-продуктов» (AI slop smell) .
🛡️ Безопасность, Hugging Face и биологические угрозы 13:10
Согласно официальному заявлению Anthropic, Opus 5.5 продемонстрировала лучшие в истории индустрии результаты на автоматизированном поведенческом аудите безопасности . Модель значительно реже предпринимает необратимые вредоносные действия или выходит за рамки системных инструкций . Ведущий предположил, что эти тесты внедрены как прямая реакция на недавний инцидент со взломом платформы Hugging Face . Также была доработана устойчивость к «невыполнимым задачам» в среде Exploit Gym, где более ранние ИИ-модели при столкновении с тупиком пытались обойти правила или смухлевать .
Из-за того, что Opus 5.5 сравнялась по возможностям с моделью Mythos 5.1 в сфере кибербезопасности и биологии, Anthropic вводит жесткие ограничения . Нейросеть обладает выраженным потенциалом двойного назначения (dual-use): её можно применять как для прорывных научных открытий, так и для проектирования биологического оружия .
Обычным пользователям доступ к глубоким научным запросам будет ограничен жесткими фильтрами . Для получения расширенного доступа ученым и экспертам придется подавать официальные заявки на участие в программах верификации Life Sciences Verification Program и Cyber Verification Program .
💻 Будущее локального Open-Source и кризис GPU 14:44
Тот факт, что Opus 5.5 требует меньше вычислительных ресурсов для обслуживания (compute to serve) по сравнению со своим предком, Берман назвал важным сигналом для рынка . По его прогнозам, закрытые коммерческие архитектуры неизбежно задают вектор для открытого ПО (open-source) . Со временем открытые локальные модели оптимизируются, уменьшаются в размерах и становятся доступными для домашнего использования . Берман выразил уверенность, что уже в следующем году пользователи смогут запускать ИИ уровня Opus 5.5 локально на своих компьютерах .
Тем не менее, текущая ситуация на рынке потребительского компьютерного железа остается тяжелой . Цены на графические процессоры (GPU) демонстрируют аномальный рост . В качестве примера ведущий привел видеокарту RTX Spark (Nvidia): если еще несколько недель назад на официальном сайте компании её стоимость составляла $4699, то на момент записи видео ценник взлетел до $7000 .
🎙️ Инсайды от разработчика: интервью с Тариком из Anthropic 17:00
Во второй половине эфира к трансляции присоединился Тарик, инженер из команды разработчиков Claude . Они обсудили внутреннюю кухню Anthropic и особенности новой модели.
Как выбрать модель для работы?
Тарик рассказал, что Opus 5.5 быстро стала его основным инструментом для ежедневных задач (daily driver) . Буквально накануне вечером он использовал её для полной переделки своего личного сайта .
По его словам, архитектуру Fable 5.1 по-прежнему имеет смысл выбирать для решения изолированных, критически важных задач, где цена ошибки максимальна — например, для глубокого планирования, комплексного ревью кода или поиска уязвимостей в безопасности [17:38, 18:58]. Для всего остального Opus 5.5 подходит идеально, сочетая высокую скорость с доступной ценой .
О рекурсивном самосовершенствовании ИИ
Отвечая на вопрос Бермана о том, правда ли, что новые нейросети создаются при помощи старых, Тарик подтвердил этот тезис: «Claude помогает строить Claude» . Однако он призвал не демонизировать термин «рекурсивное самосовершенствование» . В представлении обывателей это выглядит так, будто ИИ заперт в комнате и автономно создает сверхразум .
В реальности процесс выглядит как синергия сотен рутинных процессов . Например, Claude пишет огромные массивы программного кода для инфраструктуры Anthropic, и это происходит уже долгое время . Накопление этих микроулучшений и дает плавный, но мощный качественный скачок при смене поколений моделей .
Фирменный «плейбук» Anthropic
На вопрос, как инженерам удалось одновременно снизить цену, повысить скорость и поднять качество, Тарик ответил, что это стандартная стратегия (playbook) их компании . Сначала команда Anthropic фокусируется на создании передового фундаментального интеллекта (frontier intelligence), не считаясь с затратами . На этом этапе модель получается массивной и дорогой в обслуживании (как это было с Opus 4.0) .
Затем внутренние процессы оптимизируются, и технологии масштабируются . В результате последующие итерации (например, Sonnet 4.5) превосходят предшественников по уму, оставаясь кратно дешевле . Тарик подчеркнул, что пользователям стоит ожидать сохранения этой тенденции и в будущем .
Ограничения системных промптов и новые плагины
По признанию инженера, разработка ИИ-сервисов осложняется тем, что фундамент под ногами программистов постоянно меняется из-за обновления моделей . Недавно команде Claude Code пришлось полностью удалить значительную часть системного промпта (системных инструкций), чтобы развязать модели руки и не сдерживать её потенциал .
Вместе с Opus 5.5 компания Anthropic представила масштабное обновление инфраструктуры плагинов (plug-in eval release) . Это решение позволит сторонним разработчикам оперативно тестировать свои кастомные инструменты и навыки (skills) на предмет совместимости с новой архитектурой, избегая искусственного ограничения возможностей Claude 5.5 . Тарик подытожил, что функция вызова сторонних инструментов (tool calling) в Opus 5.5 работает стабильнее и точнее, чем когда-либо ранее .