Anthropic выпустила Claude Opus 5.5 — первую модель нового семейства 5.5. Главное здесь не очередные очки в бенчмарках, а три сдвига сразу: задача подешевела на 40%, модель стала писать заметно понятнее, и её впервые до релиза проверили внешние оценщики.
Когда выходит новая топовая модель, первым делом смотрят на графики бенчмарков. Anthropic в этот раз сама оговаривается: на уровне Opus 5.5 разрывы в тестах перестают быть надёжным ориентиром. Разница между Opus 5.5 и предыдущей топовой моделью Claude Fable 5.1 в реальной работе, по её же словам, уже, чем показывают цифры.
Поэтому смысл релиза не в том, что модель стала умнее. Он в трёх вещах, которые для тех, кто запускает агентов в продакшене, важнее очков в тесте: задача подешевела, работу модели стало проще проверять, и её впервые проверили снаружи до выхода. Разберём по порядку.
Задача подешевела на 40% — за счёт цены и экономии токенов
Opus 5.5 требует меньше вычислений на обслуживание, и это отражается в цене. Входной токен стоит 4 доллара за миллион, выходной — 20. Это на 20% дешевле, чем у Opus 5. Чтение кэша — 0,20 доллара за миллион токенов, на 60% дешевле. Ответ модель выдаёт более чем на 30% быстрее.
| Claude Opus 5.5 | Claude Opus 5 | |
|---|---|---|
| Чтение кэша | $0.20 | $0.50 |
| Входные токены | $4 | $5 |
| Выходные токены | $20 | $25 |
| Запись кэша | $5 | $6.25 |
Плюс к этому модель тратит меньше токенов на ту же задачу. В сумме с более низким тарифом это даёт снижение стоимости примерно на 40% на типичных нагрузках — Anthropic называет эффективность самым однозначным преимуществом модели.
Разницу хорошо видно на длинных задачах. Во внутреннем тесте Opus 5.5 и Fable 5.1 переводили HAProxy — софт, который распределяет веб-трафик между серверами, — с C на Rust. Обе версии прошли почти все регрессионные тесты HAProxy, но Opus 5.5 уложилась в 9,5 часа против 12 у Fable 5.1 и обошлась на 51% дешевле. Другой ранний тестер отдал ей аудит и правки кодовой базы на 200 000 строк: она справилась меньше чем за три часа, тогда как у Opus 5 на это ушло больше 20 часов и в 2,5 раза больше токенов.
Модель стало проще проверять — и это отдельная ставка
Вторая и, пожалуй, самая недооценённая перемена — связность. Opus 5.5 пишет заметно понятнее, чем Opus 5: выносит главное вперёд, реже скатывается в жаргон и странные формулировки, следует правилам оформления, которые ей задают. Это прямой ответ на самую частую претензию к Opus 5.
Почему это важно не только для эстетики. Когда агент часами работает без присмотра, понятный вывод — это возможность дёшево проверить его работу. Anthropic прямо говорит, что работу Opus 5.5 стало легче отслеживать и проверять, и называет это не только практическим, но и безопасностным сдвигом. Один из ранних тестеров сформулировал короче: «она пишет так же, как я». Это меняет и то, как Claude Code ведёт долгий проект.
Первый релиз после призыва «притормозить» — с проверкой снаружи
Это первый релиз Anthropic после того, как её CEO Дарио Амодей призвал «притормозить» развитие передовых моделей, чтобы практики безопасности успевали за возможностями. И по форме релиза это видно: Opus 5.5 до выхода протестировали внешние оценщики — Frontier Design и METR.
На автоматическом аудите поведения — самом полном тесте на выравнивание, который проводит компания, — Opus 5.5 показала сильнейший результат из всех моделей на сегодня. Она заметно реже, чем последние модели, делает трудновосстановимые действия или выходит за заданные границы, и устойчивее Opus 5 к промпт-инъекциям.
Поскольку по способностям в биологии и кибербезопасности Opus 5.5 сравнима с Claude Mythos 5.1, её выпустили с защитой уровня Fable 5.1. Поиск и исправление багов в своём коде остаются доступными, но большинство киберзадач перенаправляется на Opus 4.8. Для биологии действует Life Sciences Verification Program — проверенные организации могут подать заявку на полный доступ. Плюс включена защита от дистилляции preserved thinking для API-аккаунтов, созданных после 31 августа 2026 года, и водяные знаки для соответствия AI Act ЕС.
Где модель всё ещё упирается
Есть и честные ограничения. Режим «thinking» больше нельзя выключить — тем, кто полагался на эту возможность, придётся перестроить интеграции. Защитникам, которым нужны кибервозможности, придётся ждать расширения Cyber Verification Program. А главная нерешённая проблема — оценка поведения в реальном мире: Anthropic признаёт, что модель часто подозревает, что её тестируют, и это мешает понять, как она поведёт себя в обычных условиях.
Что это меняет для тех, кто строит агентов
Сначала проверьте на одном длинном сценарии, сколько реально стоит задача с новым тарифом, и сравните с тем, что было. Заявленные 40% — это оценка на типичных нагрузках, а не гарантия для каждого случая. Но направление понятно: агентная работа на топовой модели перестаёт быть роскошью.
Второй шаг — пересмотреть связность как критерий выбора. Если команда держит агентов в длинных автономных сессиях, где работу надо проверять, понятный вывод Opus 5.5 экономит не меньше, чем скидка на токены. Модель уже доступна на всех платформах — AWS, Google Cloud и Microsoft Azure, а на Claude Platform она называется claude-opus-5-5.
Гонка бенчмарков уступает место проверяемости
Opus 5.5 — это не очередной скачок интеллекта, а то, что на топовом уровне значит больше, чем очки в тестах: цена задачи, понятность и внешняя проверка безопасности. Anthropic впервые ставит проверяемость в один ряд с возможностями. Следом выйдут Sonnet 5.5 и Haiku 5.5 — с теми же сдвигами в эффективности и безопасности. Рынок топовых моделей явно переходит от гонки бенчмарков к гонке за то, чтобы мощную модель было выгодно и безопасно запускать в реальной работе.
Ссылки
Ссылки
- Документация: System Card Claude Opus 5.5
- Документация: Claude Opus 5.5 в Claude Platform