Anthropic выпустила Claude Opus 5 24 июля 2026 года. Цена та же, что у предыдущей версии: $5 за миллион входных токенов, $25 за миллион выходных. Но главное не в прайсе. Модель иначе работает на длинных цепочках действий — планирует, вызывает инструменты, ловит собственные ошибки и возвращается к исправлению, а не рапортует о завершении при первой удачной компиляции.

Разработчикам, которые используют Claude не как чат-ассистента, а как рабочего участника процесса, это меняет контракт взаимодействия. Модель сама определяет глубину размышлений, сама сверяет результат и сама продолжает работу. Задача человека — задать критерий готовности и не дёргать.

Что произошло

Релиз состоялся 24 июля 2026 года. Идентификатор модели в API — claude-opus-5. Доступ через Claude API, Amazon Bedrock, Google Cloud и Microsoft Foundry.

Базовые параметры: контекстное окно 1 млн токенов, максимальный вывод 128 000 токенов. Цена входа-выхода не изменилась. Пять градаций усилия: от low до max. Быстрый режим (Fast mode) ускоряет ответы примерно в 2,5 раза и стоит вдвое дороже базового — $10/$50 за миллион токенов. Пока это исследовательский предпросмотр, доступный только через Claude API.

Важно: Рассуждение включено по умолчанию. На Opus 4.8 без явного параметра thinking запросы шли без размышления. Теперь модель сама решает, насколько глубоко думать, а effort превращается в главную ручку управления качеством, скоростью и расходом.

Контекст

Предшественник — Opus 4.8. Название говорит о шаге версии, но реальный разрыв — в поведении, когда задача требует много шагов.

Но ведь это просто очередная модель, которая чуть лучше отвечает?

Для разового вопроса — да, разница незаметна. Обе версии пишут текст, объясняют код, анализируют документы. Пропасть раскрывается на многоэтапных задачах. Агент получает задание: внедрить новую функцию в готовый проект. Путь состоит из цепочки — найти связанные файлы, разобраться в архитектуре, поправить несколько модулей, прогнать тесты, прочитать ошибку, исправить реализацию, проверить в браузере. Модель послабее объявляет победу на первом успешном билде. Opus 5 доводит до проверки фактического поведения, а не красивого диффа.

Ключевые факты

ПараметрЗначение
Релиз24 июля 2026
API IDclaude-opus-5
Контекст1 млн токенов
Выводдо 128 000 токенов
Вход / выход$5 / $25 за 1 млн
Effortlow, medium, high, xhigh, max
Fast mode~2,5x, $10/$50
Thinkingпо умолчанию

Сравнение с Opus 4.8:

ПараметрOpus 4.8Opus 5
РассуждениеТребовало thinkingВключено всегда, глубина через effort
Верхний effortНижеmax
КонтекстБольшое окно1 млн как стандарт
Кэш промптаот 1024 токеновот 512 токенов
Инструменты в диалогеФиксированы на сессиюМеняемые без сброса кэша (бета)
Цена$5/$25$5/$25

Главный сдвиг для существующих интеграций — рассуждение по умолчанию. Раньше effort был вспомогательной настройкой. Теперь это основной рычаг: качество, задержка и стоимость токенов зависят от него напрямую. Параметр thinking можно опустить — модель подберёт глубину сама.

Внимание: Комбинация thinking: {“type”: “disabled”} с effort “xhigh” или “max” вызывает ошибку 400. При отключённом рассуждении потолок — high. Anthropic советует для агентных задач не отключать рассуждение, а уменьшать расход через low или medium при сохранении качества.

Как это влияет на практику

Миграция: что менять в коде

Сменить идентификатор модели — минимум. Для стабильного результата стоит параллельно зафиксировать уровень усилия и поднять max_tokens, поскольку теперь этот лимит покрывает и рассуждение, и ответ целиком.

{
  "model": "claude-opus-5",
  "max_tokens": 64000,
  "output_config": {
    "effort": "high"
  },
  "messages": [
    {
      "role": "user",
      "content": "Проверь архитектуру проекта, внеси изменения, запусти тесты и объясни, что осталось проверить вручную."
    }
  ]
}

thinking здесь опущен сознательно: адаптивное рассуждение запускается само. Стартовая точка для простых задач — medium. Для рефакторинга и сложного анализа — high. Два верхних уровня (xhigh, max) — после валидации на своих данных: они могут поднять качество, но платите задержкой и токенами.

Три точки в коде, которые нужно проверить перед переключением:

  • Парсинг thinking-блоков и tool_use в ответе API.
  • Лимит max_tokens — если рассуждение раньше было выключено, старое значение может оказаться слишком тесным.
  • Обработка 400-х ошибок и наличие fallback-модели для запросов, которые перехватывают классификаторы безопасности.

Две бета-фичи

Mid-conversation tool changes — смена набора инструментов между ходами диалога без потери кэша промпта. Раньше список инструментов фиксировался на всю сессию. Активируется заголовком mid-conversation-tool-changes-2026-07-01.

Server-side fallback — автоматический резервный маршрут. С заголовком server-side-fallback-2026-07-01 API подбирает рекомендованную модель, если запрос заблокирован классификатором. Для продакшн-агентов это страховка: отказ Opus 5 не обрушивает пользовательский сценарий.

Бенчмарки: вектор, не гарантия

Заявленные результаты Anthropic:

БенчмаркЧто показал Opus 5
Frontier-Bench v0.1Результат более чем в 2 раза выше Opus 4.8, стоимость задачи ниже
CursorBench 3.2На max — в 0,5% от пика Fable 5 при вдвое меньшей стоимости
ARC-AGI 3Оценка примерно втрое выше ближайшего конкурента
Zapier AutomationBenchПроходной балл в 1,5 раза выше при той же цене задачи
OSWorld 2.0Лучший результат при сопоставимой стоимости; обгон Fable 5 при трети его цены

Цифры показывают направление, но не обещают такого же результата на ваших задачах. Каждый бенчмарк — конкретная версия теста, уровень усилия, число попыток, настройки инструментов и поправки на классификаторы. Модель-лидер по CursorBench не факт, что окажется дешевле или стабильнее в вашем внутреннем агенте.

Инсайт: Opus 5 активнее самопроверяется. Ручки в промпте вроде «обязательно перепроверь через второго агента» теперь создают двойную работу и двойной расход. Описывайте критерий готовности — модель сама решит, когда проверять.

Проверка на своих задачах

Смена модели — не замена одной строки. Возьмите 20–30 реальных запросов из продакшн-логов. Разбейте на категории: код, документы, вызовы инструментов, ошибки, длинные сценарии.

Что замерять для каждой версии:

  • сколько задач завершено без ручного вмешательства;
  • количество шагов и вызовов инструментов;
  • токены и стоимость;
  • задержка до первого токена и до финального ответа;
  • число правок после тестов;
  • сколько раз модель заявила «готово», а это было не так.

Если агент имеет доступ к файлам и продакшн-сервисам — оставьте ручные контрольные точки. Автономность не отменяет права доступа, песочницы, логирования и отката. Особо тщательно — действия, затрагивающие данные, отправку писем, публикацию кода и финансовые операции.

Что смотреть дальше

  • Запустите medium на 20–30 контрольных запросах — сравните с текущей моделью по качеству и стоимости
  • Аудит кода: парсинг thinking-блоков, max_tokens, обработка 400-х ошибок
  • Если набор инструментов меняется по ходу диалога — протестируйте mid-conversation tool changes
  • Для продакшн-агентов — включите server-side fallback, чтобы отказ модели не рвал сценарий
  • Fast mode пока только в Claude API — следите за появлением на облачных платформах