Anthropic выпустила Claude Opus 5.5 — первую модель нового семейства 5.5. Главное здесь не очередные очки в бенчмарках, а три сдвига сразу: задача подешевела на 40%, модель стала писать заметно понятнее, и её впервые до релиза проверили внешние оценщики.

Когда выходит новая топовая модель, первым делом смотрят на графики бенчмарков. Anthropic в этот раз сама оговаривается: на уровне Opus 5.5 разрывы в тестах перестают быть надёжным ориентиром. Разница между Opus 5.5 и предыдущей топовой моделью Claude Fable 5.1 в реальной работе, по её же словам, уже, чем показывают цифры.

Поэтому смысл релиза не в том, что модель стала умнее. Он в трёх вещах, которые для тех, кто запускает агентов в продакшене, важнее очков в тесте: задача подешевела, работу модели стало проще проверять, и её впервые проверили снаружи до выхода. Разберём по порядку.

Задача подешевела на 40% — за счёт цены и экономии токенов

Opus 5.5 требует меньше вычислений на обслуживание, и это отражается в цене. Входной токен стоит 4 доллара за миллион, выходной — 20. Это на 20% дешевле, чем у Opus 5. Чтение кэша — 0,20 доллара за миллион токенов, на 60% дешевле. Ответ модель выдаёт более чем на 30% быстрее.

Claude Opus 5.5Claude Opus 5
Чтение кэша$0.20$0.50
Входные токены$4$5
Выходные токены$20$25
Запись кэша$5$6.25

Плюс к этому модель тратит меньше токенов на ту же задачу. В сумме с более низким тарифом это даёт снижение стоимости примерно на 40% на типичных нагрузках — Anthropic называет эффективность самым однозначным преимуществом модели.

Разницу хорошо видно на длинных задачах. Во внутреннем тесте Opus 5.5 и Fable 5.1 переводили HAProxy — софт, который распределяет веб-трафик между серверами, — с C на Rust. Обе версии прошли почти все регрессионные тесты HAProxy, но Opus 5.5 уложилась в 9,5 часа против 12 у Fable 5.1 и обошлась на 51% дешевле. Другой ранний тестер отдал ей аудит и правки кодовой базы на 200 000 строк: она справилась меньше чем за три часа, тогда как у Opus 5 на это ушло больше 20 часов и в 2,5 раза больше токенов.

Модель стало проще проверять — и это отдельная ставка

Вторая и, пожалуй, самая недооценённая перемена — связность. Opus 5.5 пишет заметно понятнее, чем Opus 5: выносит главное вперёд, реже скатывается в жаргон и странные формулировки, следует правилам оформления, которые ей задают. Это прямой ответ на самую частую претензию к Opus 5.

Почему это важно не только для эстетики. Когда агент часами работает без присмотра, понятный вывод — это возможность дёшево проверить его работу. Anthropic прямо говорит, что работу Opus 5.5 стало легче отслеживать и проверять, и называет это не только практическим, но и безопасностным сдвигом. Один из ранних тестеров сформулировал короче: «она пишет так же, как я». Это меняет и то, как Claude Code ведёт долгий проект.

Первый релиз после призыва «притормозить» — с проверкой снаружи

Это первый релиз Anthropic после того, как её CEO Дарио Амодей призвал «притормозить» развитие передовых моделей, чтобы практики безопасности успевали за возможностями. И по форме релиза это видно: Opus 5.5 до выхода протестировали внешние оценщики — Frontier Design и METR.

На автоматическом аудите поведения — самом полном тесте на выравнивание, который проводит компания, — Opus 5.5 показала сильнейший результат из всех моделей на сегодня. Она заметно реже, чем последние модели, делает трудновосстановимые действия или выходит за заданные границы, и устойчивее Opus 5 к промпт-инъекциям.

Поскольку по способностям в биологии и кибербезопасности Opus 5.5 сравнима с Claude Mythos 5.1, её выпустили с защитой уровня Fable 5.1. Поиск и исправление багов в своём коде остаются доступными, но большинство киберзадач перенаправляется на Opus 4.8. Для биологии действует Life Sciences Verification Program — проверенные организации могут подать заявку на полный доступ. Плюс включена защита от дистилляции preserved thinking для API-аккаунтов, созданных после 31 августа 2026 года, и водяные знаки для соответствия AI Act ЕС.

Где модель всё ещё упирается

Есть и честные ограничения. Режим «thinking» больше нельзя выключить — тем, кто полагался на эту возможность, придётся перестроить интеграции. Защитникам, которым нужны кибервозможности, придётся ждать расширения Cyber Verification Program. А главная нерешённая проблема — оценка поведения в реальном мире: Anthropic признаёт, что модель часто подозревает, что её тестируют, и это мешает понять, как она поведёт себя в обычных условиях.

Что это меняет для тех, кто строит агентов

Сначала проверьте на одном длинном сценарии, сколько реально стоит задача с новым тарифом, и сравните с тем, что было. Заявленные 40% — это оценка на типичных нагрузках, а не гарантия для каждого случая. Но направление понятно: агентная работа на топовой модели перестаёт быть роскошью.

Второй шаг — пересмотреть связность как критерий выбора. Если команда держит агентов в длинных автономных сессиях, где работу надо проверять, понятный вывод Opus 5.5 экономит не меньше, чем скидка на токены. Модель уже доступна на всех платформах — AWS, Google Cloud и Microsoft Azure, а на Claude Platform она называется claude-opus-5-5.

Гонка бенчмарков уступает место проверяемости

Opus 5.5 — это не очередной скачок интеллекта, а то, что на топовом уровне значит больше, чем очки в тестах: цена задачи, понятность и внешняя проверка безопасности. Anthropic впервые ставит проверяемость в один ряд с возможностями. Следом выйдут Sonnet 5.5 и Haiku 5.5 — с теми же сдвигами в эффективности и безопасности. Рынок топовых моделей явно переходит от гонки бенчмарков к гонке за то, чтобы мощную модель было выгодно и безопасно запускать в реальной работе.

Ссылки

Ссылки