Мэтью Берман о релизе Claude Opus 5: характеристики, цены и прорывные бенчмарки

Matthew Berman 32,3 тыс. 52 мин 4 мин 24.07.2026
Главное

Революция в мире ИИ: Мэтью Берман о неожиданном релизе Claude Opus 5

Индустрия искусственного интеллекта неожиданно получила мощный толчок в конце рабочей недели. Известный техноблогер Мэтью Берман в ходе своего стрима разобрал внезапный релиз новой флагманской языковой модели от компании AnthropicClaude Opus 5 . Новинка не просто обновила продуктовую линейку компании, но и продемонстрировала выдающиеся результаты, обойдя по ряду ключевых бенчмарков даже передовую модель Fable 5, при этом сохранив значительно более высокую экономичность .

Открытые весовые коэффициенты и стратегический выбор Америки 2:58

Перед тем как перейти к обзору долгожданного релиза от Anthropic, ведущий уделил внимание важному открытому письму руководства Nvidia во главе с Дженсеном Хуангом и других лидеров индустрии в поддержку моделей с открытыми весами (open-weight models) . По мнению автора, развитие экосистемы открытого исходного кода критически важно для технологического суверенитета США и всего мира .

Мэтью Берман подчеркивает ключевые преимущества открытых моделей:

Как отмечает ведущий, хотя Nvidia объективно выигрывает от распространения ИИ вне зависимости от архитектуры (ведь инфраструктурные чипы покупают преимущественно у них), поддержка открытого кода создает здоровую рыночную среду .

Знакомство с Claude Opus 5 и первые впечатления 8:36

Главной сенсацией стрима стал анонс модели Claude Opus 5 от Anthropic, которую автор назвал полной неожиданностью . Хотя блогер успел протестировать систему лишь поверхностно из-за позднего получения доступа, опубликованные бенчмарки и внутренние тесты компании произвели фурор в сообществе .

Исторически линейка моделей Anthropic включала модели Haiku, Sonnet и топовый уровень Opus, поверх которого позже расположилась модель Fable . Однако пятое поколение Opus неожиданно продемонстрировало превосходство над Fable 5 практически на всех основных бенчмарках .

Основные показатели производительности Claude Opus 5:

Экономика задач: почему «стоимость за токен» уходит в прошлое 13:27

Важнейшим открытием презентации стала фокусная демонстрация метрики стоимости за выполненную задачу (cost per task), а не просто цены за миллион токенов . Мэтью Берман отмечает, что предыдущие релизы (например, модели сторонних разработчиков) могли казаться дешевыми по прайсу за токены, но тратили вдвое больше ресурсов на достижение результата .

Claude Opus 5 предлагает принципиально иную экономику: модель демонстрирует более высокий уровень успешности прохождения тестов при меньшей или сопоставимой стоимости выполнения конкретной задачи . Розничная стоимость модели составляет $5 за миллион входных токенов и $25 за миллион выходных токенов — ровно столько же, сколько стоила прошлая версия Opus 4.8, и вдвое дешевле флагманской Fable .

Безопасность и архитектурные компромиссы 21:23

Несмотря на доминирование в общих и кодировочных тестах, в сфере кибербезопасности модель демонстрирует сознательное ограничение способностей . Согласно бенчмаркам автоматических поведенческих аудитов, показатель успешности создания эксплойтов у Opus 5 составляет всего 4 балла против 13 у специализированных исследовательских моделей серии Mythos, хотя это выше показателя версии 4.8 .

По мнению автора, инженеры Anthropic целенаправленно встроили жесткие защитные барьеры против киберугроз, при этом избежав традиционного для индустрии падения общей производительности модели . Дополнительно в API реализована система автоматического резервного маршрутирования: если запросы пользователя попадают под защитные классификаторы Opus 5, они безопасно перенаправляются на модель Opus 4.8 (с применением тарификации фоллбэк-версии) .

Enterprise-тесты и мнение экспертов 34:30

Корпоративные партнеры, включая платформу Box, провели собственное тестирование Claude Opus 5 на реальных документарных задачах в 12 индустриях . Тестирование включало чтение сложных исходных документов, сверку финансовых данных, проведение due diligence и юридический анализ :

Президент ARC Prize Грег подтвердил ведущему стрима в личных сообщениях, что результаты Opus 5 в тестах ARC-AGI 3 стали самым впечатляющим достижением среди всех существующих ИИ-систем, превзойдя даже начальные версии архитектуры Fable . Экспертное сообщество сходится во мнении, что релиз меняет расстановку сил на рынке, делая Opus 5 новым стандартом для повседневной работы разработчиков и аналитиков .

💬 Цитаты

«Open source is good for America. Open source is good for the world.»

Мэтью Берман 04:28

«Opus 5 is also highly efficient. It outperforms other models for a similar or lower cost per task.»

Мэтью Берман 13:27

«Opus 5. Here's what you need to know. It is now the best model on the planet and half the price of Fable.»

Мэтью Берман 43:06
👥 Спикер
🔗 Упомянутые сайты и проекты
📖 Термины
Инференс
Процесс генерации ответа обученной языковой моделью на основе поданного пользователем запроса.
ARC-AGI 3
Сложный бенчмарк, проверяющий способность искусственного интеллекта решать принципиально новые логические задачи и игры без предварительного обучения конкретным правилам.
📊 Цифры
⚖️ Другая сторона
Искусственный интеллект Claude Opus 5 Matthew Berman Anthropic Fable 5 ARC-AGI 3