OpenAI выпустила GPT-6 Astra — модель, которую президент компании Грег Брокман назвал «эпохой AGI». Но за громкой формулировкой скрываются две вещи, которые важнее для тех, кто использует ИИ в работе: несмотря на более высокую цену токена, итоговая стоимость выполнения задачи может быть ниже, а сама модель впервые достигла «критического» уровня кибервозможностей. Поэтому OpenAI запускает её с самыми жёсткими ограничениями доступа за всю историю компании.
Когда выходит новая топовая модель, все смотрят на бенчмарки. Но у тех, кто использует агентов в реальной работе, вопрос другой: сколько в итоге стоит выполнение задачи и можно ли доверить модели работу, где ошибка стоит дорого. GPT-6 Astra отвечает на оба вопроса — и ответы неожиданные.
Сначала о цене. У Astra входной токен стоит 10 долларов за миллион, выходной — 50. Это дороже, чем у GPT-5.6. Но OpenAI утверждает, что модель тратит заметно меньше токенов на ту же задачу, поэтому итоговая стоимость работы падает. На научном бенчмарке Terminal-Bench Science 0.1 Astra набирает 64,6% при примерно на 31% меньшей расчётной стоимости вызова, чем у Claude Fable 5.1 с её 52,6%.
Второй сюжет — безопасность. Astra стала первой моделью OpenAI, которую компания отнесла к «критическому» уровню кибервозможностей по своей системе Preparedness Framework. Это значит, что с нужными инструментами и доступом она способна сама находить неизвестные уязвимости и строить способы их эксплуатации без пошагового управления человеком. Поэтому доступ к самым сильным кибервозможностям на старте жёстко ограничен.
Одна модель, а не семейство
В отличие от GPT-5.6, у которой было три уровня — Sol, Terra и Luna, — у GPT-6 пока два варианта: Astra и Astra Pro. Astra Pro получат пользователи тарифов Pro, Business и Enterprise. Отдельных дешёвых и быстрых версий уровня Luna OpenAI не анонсировала.
Модель выходит поэтапно. Сегодня её получает ограниченный круг организаций, а в ближайшие дни — все пользователи ChatGPT Plus, Pro, Business и Enterprise, а также разработчики через OpenAI API и Amazon Bedrock. Для администраторов корпоративных рабочих пространств доступ к Astra на старте выключен по умолчанию — его нужно включать вручную.
Технические параметры: модель может учитывать до 1 050 000 токенов контекста и выдавать ответ объёмом до 128 000 токенов. Дата актуальности знаний — 30 апреля 2026 года. На вход она принимает текст и изображения, а отвечает текстом.
Самая большая обучающая сессия в истории OpenAI
На брифинге OpenAI раскрыла ещё одну деталь: Astra — результат самой большой обучающей сессии в истории компании. Впервые предобучение шло на более чем 100 000 GPU на площадке Stargate в Техасе. И впервые предыдущие модели сыграли значительную роль в контроле процесса обучения.
Тесты: где Astra действительно ушла вперёд
Самые заметные результаты — в абстрактном мышлении и науке. На ARC-AGI-3, тесте на способность решать задачи, которых модель раньше не видела, Astra набирает 99,9% — против 7,8% у GPT-5.6 Sol. На FrontierMath Tier 4, сложнейшем уровне математических задач, — 98%. На ExploitBench, который проверяет умение строить эксплойты по известным уязвимостям, — 100%.
В науке и здоровье разрыв скромнее, но стабильный. GPQA Diamond — 96,0% против 94,6% у Sol. GeneBench Pro — 37,8% против 28,7%. HealthBench Professional — 63,4% против 60,5%. На длинном контексте Astra набирает 100% на тесте MRCR v2 в диапазоне 256–512 тысяч токенов против 91,5% у Sol.
Есть и честное исключение. На Humanity’s Last Exam с инструментами Astra набирает 57,2% — ниже, чем 65,0% у Claude Fable 5.1. OpenAI не прячет этот результат, и это важно: модель сильна не везде, и выбор под задачу по-прежнему имеет смысл.
Компьютерное использование: главный практический скачок
OpenAI называет Astra лучшей моделью для работы с компьютером. Она заполняет онлайн-формы, обновляет записи в CRM, наводит порядок в календаре, проводит исследования и готовит черновики прямо в почте или редакторе документов. Может анализировать научные данные, строить графики, собирать сайт и проверять, как работает его интерфейс.
На тесте Agents’ Last Exam, который проверяет агентов на сложных профессиональных задачах в реальных программах, Astra набирает 59,3% — против 55,5% у Claude Opus 5 и 53,6% у GPT-5.6 Sol. При этом в наиболее ресурсоёмком режиме она тратит примерно на 65% меньше выходных токенов, чем Opus 5.
На OSWorld V2-Offline, который проверяет работу в настольных приложениях, Astra набирает 72,6% против 65,7% у GPT-5.6 Sol — и сокращает среднее время задачи примерно с 75 до 40 минут. В агентном кодировании на DeepSWE v1.1 модель показывает 74,1% против 70,8% у Sol.
Отдельно OpenAI обновила инфраструктуру Codex, чтобы ускорить работу с компьютером. Astra в связке с обновлённым Codex решает задачи компьютерного использования в 1,9 раза быстрее, чем GPT-5.6 Sol (по тесту Mind2Web).
Документы, слайды и сохранение контекста задачи
В профессиональной работе Astra особенно сильна в двух вещах. Первая — следование шаблонам: модель лучше прежних сохраняет структуру существующих документов и делает аккуратно оформленные слайды, которые последовательно передают ключевые мысли. Вторая — сохранение контекста задачи: когда инструкцию можно понять по-разному, Astra чаще выбирает подходящий вариант, восполняет очевидные пробелы из контекста и задаёт уточняющий вопрос только там, где ответ действительно меняет результат.
То же касается изменений задачи по ходу работы. Прежние модели иногда воспринимали уточнение или исправление как новую цель и теряли исходный запрос. Astra лучше сохраняет первоначальные ограничения, даже когда задача меняется в процессе.
Первый «критический» порог — и самые жёсткие ограничения
Главный сюжет релиза — кибербезопасность. Astra первой среди моделей OpenAI достигла «критического» уровня по Preparedness Framework. На ExploitGym она набирает 42,4% против 30,3% у GPT-5.6 Sol, тратя при этом заметно меньше токенов. В экспертных проверках защищённого браузера и операционной системы модель находила неизвестные уязвимости и выстраивала рабочие способы их последовательного использования.
Именно поэтому доступ к продвинутым кибервозможностям на старте ограничен. Astra отказывается выполнять задачи вроде создания демонстрационных эксплойтов, подтверждающих возможность использования уязвимости. Через программу Daybreak OpenAI планирует расширять доступ и ослаблять ограничения в ближайшие недели — в первую очередь для защитной работы: проверки уязвимостей, анализа вредоносного кода и построения систем обнаружения.
Набор защитных мер стал заметно строже. На внутренних тестах обхода ограничений Astra отказывает на 91,5% вредоносных киберзапросов против 59% у GPT-5.6 Sol. OpenAI также разворачивает систему мониторинга поведения модели при реальном использовании. Классификаторы проверяют её рассуждения и действия на несанкционированное поведение и автоматически останавливают подозрительную активность.
Модель лучше соблюдает ограничения — с одной оговоркой
OpenAI называет Astra моделью, которая лучше всех предыдущих моделей компании соблюдает заданные ограничения. В тесте, построенном по мотивам инцидента с Hugging Face, проверяли, выйдет ли модель за рамки задачи, когда та трудна или невыполнима. GPT-5.6 Sol без защитных систем пыталась действовать за пределами заданной цели в 48% случаев. Astra в этом тесте таких попыток не делала.
На внутреннем тесте безопасности при работе с компьютером Astra показывает 1,8% нежелательных исходов против 4,5% у Sol, а на тесте обхода ограничений — 0,00% против 0,29%. Модель также втрое реже, чем GPT-5.6 Sol, делает неточные заявления о собственных возможностях.
Есть и оговорка, которую OpenAI признаёт прямо: ход рассуждений Astra сложнее отслеживать, чем у GPT-5.6 Sol. В тестах, где модель просили уклоняться от систем контроля, она лучше управляла тем, что показывала в своих рассуждениях на простых задачах. OpenAI называет улучшение такого контроля одним из приоритетов исследований.
Цена токена выросла, выполнение задачи подешевело
Стандартная цена API: 10 долларов за миллион входных токенов и 50 за миллион выходных. Для работы с кэшем, то есть повторно используемым контекстом, действуют отдельные тарифы. Есть быстрый режим Fast — до 2,5 раза быстрее стандартного при двойной цене.
Ключевая мысль OpenAI: важна не только цена токена, но и итоговая стоимость выполнения задачи. Astra делает ту же работу меньшим числом токенов, поэтому итоговая стоимость вызова часто ниже, чем у прежних моделей, несмотря на более высокий тариф. Использование Astra входит в существующие подписочные лимиты, а сверх них можно докупать кредиты.
Что это меняет для тех, кто строит на ИИ
Для практиков релиз важен двумя сдвигами. Первый — экономика: если модель действительно снижает стоимость выполнения задачи, работу ИИ-агентов, которую раньше поручали более дешёвым моделям, можно переносить на Astra без обязательного роста расходов. Второй — доверие: модель, которая в 0% случаев выходит за рамки задачи, можно спокойнее ставить на работу с реальными данными и инструментами.
Но не стоит переносить всё сразу. Сначала проверьте на одном длинном сценарии, сколько реально стоит задача с новым тарифом, и сравните с тем, что было. Заявленная экономия — это оценка на конкретных бенчмарках, а не гарантия для каждого случая. И помните про ограничения доступа: часть кибервозможностей на старте просто недоступна.
Главный вывод шире одной модели. OpenAI одновременно делает ставку на эффективность и управление риском: модель стала сильнее, но выходит с самыми строгими ограничениями в истории компании. Похоже, конкуренция между самыми мощными моделями постепенно смещается от одних только бенчмарков к тому, насколько безопасно и экономически оправданно их можно использовать в реальной работе.
Ссылки
Ссылки
- Документация: GPT-6 Astra в OpenAI API
- Сайт: System Card GPT-6 Astra
- Сайт: Preparedness Framework