Anthropic выпустила Claude Opus 5 24 июля 2026 года. Цена та же, что у предыдущей версии: $5 за миллион входных токенов, $25 за миллион выходных. Но главное не в прайсе. Модель иначе работает на длинных цепочках действий — планирует, вызывает инструменты, ловит собственные ошибки и возвращается к исправлению, а не рапортует о завершении при первой удачной компиляции.
Разработчикам, которые используют Claude не как чат-ассистента, а как рабочего участника процесса, это меняет контракт взаимодействия. Модель сама определяет глубину размышлений, сама сверяет результат и сама продолжает работу. Задача человека — задать критерий готовности и не дёргать.
Что произошло
Релиз состоялся 24 июля 2026 года. Идентификатор модели в API — claude-opus-5. Доступ через Claude API, Amazon Bedrock, Google Cloud и Microsoft Foundry.
Базовые параметры: контекстное окно 1 млн токенов, максимальный вывод 128 000 токенов. Цена входа-выхода не изменилась. Пять градаций усилия: от low до max. Быстрый режим (Fast mode) ускоряет ответы примерно в 2,5 раза и стоит вдвое дороже базового — $10/$50 за миллион токенов. Пока это исследовательский предпросмотр, доступный только через Claude API.
Важно: Рассуждение включено по умолчанию. На Opus 4.8 без явного параметра thinking запросы шли без размышления. Теперь модель сама решает, насколько глубоко думать, а effort превращается в главную ручку управления качеством, скоростью и расходом.
Контекст
Предшественник — Opus 4.8. Название говорит о шаге версии, но реальный разрыв — в поведении, когда задача требует много шагов.
Но ведь это просто очередная модель, которая чуть лучше отвечает?
Для разового вопроса — да, разница незаметна. Обе версии пишут текст, объясняют код, анализируют документы. Пропасть раскрывается на многоэтапных задачах. Агент получает задание: внедрить новую функцию в готовый проект. Путь состоит из цепочки — найти связанные файлы, разобраться в архитектуре, поправить несколько модулей, прогнать тесты, прочитать ошибку, исправить реализацию, проверить в браузере. Модель послабее объявляет победу на первом успешном билде. Opus 5 доводит до проверки фактического поведения, а не красивого диффа.
Ключевые факты
| Параметр | Значение |
|---|---|
| Релиз | 24 июля 2026 |
| API ID | claude-opus-5 |
| Контекст | 1 млн токенов |
| Вывод | до 128 000 токенов |
| Вход / выход | $5 / $25 за 1 млн |
| Effort | low, medium, high, xhigh, max |
| Fast mode | ~2,5x, $10/$50 |
| Thinking | по умолчанию |
Сравнение с Opus 4.8:
| Параметр | Opus 4.8 | Opus 5 |
|---|---|---|
| Рассуждение | Требовало thinking | Включено всегда, глубина через effort |
| Верхний effort | Ниже | max |
| Контекст | Большое окно | 1 млн как стандарт |
| Кэш промпта | от 1024 токенов | от 512 токенов |
| Инструменты в диалоге | Фиксированы на сессию | Меняемые без сброса кэша (бета) |
| Цена | $5/$25 | $5/$25 |
Главный сдвиг для существующих интеграций — рассуждение по умолчанию. Раньше effort был вспомогательной настройкой. Теперь это основной рычаг: качество, задержка и стоимость токенов зависят от него напрямую. Параметр thinking можно опустить — модель подберёт глубину сама.
Внимание: Комбинация thinking: {“type”: “disabled”} с effort “xhigh” или “max” вызывает ошибку 400. При отключённом рассуждении потолок — high. Anthropic советует для агентных задач не отключать рассуждение, а уменьшать расход через low или medium при сохранении качества.
Как это влияет на практику
Миграция: что менять в коде
Сменить идентификатор модели — минимум. Для стабильного результата стоит параллельно зафиксировать уровень усилия и поднять max_tokens, поскольку теперь этот лимит покрывает и рассуждение, и ответ целиком.
{
"model": "claude-opus-5",
"max_tokens": 64000,
"output_config": {
"effort": "high"
},
"messages": [
{
"role": "user",
"content": "Проверь архитектуру проекта, внеси изменения, запусти тесты и объясни, что осталось проверить вручную."
}
]
}
thinking здесь опущен сознательно: адаптивное рассуждение запускается само. Стартовая точка для простых задач — medium. Для рефакторинга и сложного анализа — high. Два верхних уровня (xhigh, max) — после валидации на своих данных: они могут поднять качество, но платите задержкой и токенами.
Три точки в коде, которые нужно проверить перед переключением:
- Парсинг thinking-блоков и tool_use в ответе API.
- Лимит max_tokens — если рассуждение раньше было выключено, старое значение может оказаться слишком тесным.
- Обработка 400-х ошибок и наличие fallback-модели для запросов, которые перехватывают классификаторы безопасности.
Две бета-фичи
Mid-conversation tool changes — смена набора инструментов между ходами диалога без потери кэша промпта. Раньше список инструментов фиксировался на всю сессию. Активируется заголовком mid-conversation-tool-changes-2026-07-01.
Server-side fallback — автоматический резервный маршрут. С заголовком server-side-fallback-2026-07-01 API подбирает рекомендованную модель, если запрос заблокирован классификатором. Для продакшн-агентов это страховка: отказ Opus 5 не обрушивает пользовательский сценарий.
Бенчмарки: вектор, не гарантия
Заявленные результаты Anthropic:
| Бенчмарк | Что показал Opus 5 |
|---|---|
| Frontier-Bench v0.1 | Результат более чем в 2 раза выше Opus 4.8, стоимость задачи ниже |
| CursorBench 3.2 | На max — в 0,5% от пика Fable 5 при вдвое меньшей стоимости |
| ARC-AGI 3 | Оценка примерно втрое выше ближайшего конкурента |
| Zapier AutomationBench | Проходной балл в 1,5 раза выше при той же цене задачи |
| OSWorld 2.0 | Лучший результат при сопоставимой стоимости; обгон Fable 5 при трети его цены |
Цифры показывают направление, но не обещают такого же результата на ваших задачах. Каждый бенчмарк — конкретная версия теста, уровень усилия, число попыток, настройки инструментов и поправки на классификаторы. Модель-лидер по CursorBench не факт, что окажется дешевле или стабильнее в вашем внутреннем агенте.
Инсайт: Opus 5 активнее самопроверяется. Ручки в промпте вроде «обязательно перепроверь через второго агента» теперь создают двойную работу и двойной расход. Описывайте критерий готовности — модель сама решит, когда проверять.
Проверка на своих задачах
Смена модели — не замена одной строки. Возьмите 20–30 реальных запросов из продакшн-логов. Разбейте на категории: код, документы, вызовы инструментов, ошибки, длинные сценарии.
Что замерять для каждой версии:
- сколько задач завершено без ручного вмешательства;
- количество шагов и вызовов инструментов;
- токены и стоимость;
- задержка до первого токена и до финального ответа;
- число правок после тестов;
- сколько раз модель заявила «готово», а это было не так.
Если агент имеет доступ к файлам и продакшн-сервисам — оставьте ручные контрольные точки. Автономность не отменяет права доступа, песочницы, логирования и отката. Особо тщательно — действия, затрагивающие данные, отправку писем, публикацию кода и финансовые операции.
Что смотреть дальше
- Запустите medium на 20–30 контрольных запросах — сравните с текущей моделью по качеству и стоимости
- Аудит кода: парсинг thinking-блоков, max_tokens, обработка 400-х ошибок
- Если набор инструментов меняется по ходу диалога — протестируйте mid-conversation tool changes
- Для продакшн-агентов — включите server-side fallback, чтобы отказ модели не рвал сценарий
- Fast mode пока только в Claude API — следите за появлением на облачных платформах
Ссылки
Ссылки
- Сайт: Introducing Claude Opus 5 — Anthropic
- Документация: What’s new in Claude Opus 5 — Claude Platform
- Документация: Обзор моделей и тарифов Claude
- Документация: Рекомендации по промптам для Claude Opus 5