Google представила две версии Gemini 3.8 Flash. Обычная 3.8 Flash предназначена для программирования, ИИ-агентов и сложных многошаговых задач. 3.8 Flash Cyber специализируется на поиске и автоматическом исправлении уязвимостей. В основе версий лежит общая базовая модель, но Cyber доступна только одобренным участникам программы Fairwind.

Темп обновления линейки Flash сам по себе стал новостью. 3.8 Flash — третий релиз Flash за шесть недель, а 3.7 Flash вышла всего тремя неделями ранее. Это похоже на переход к коротким итерациям: версии выходят с интервалом в несколько недель, а Google заявляет заметный прирост результатов между релизами.

Но главное в этом релизе не скорость выхода, а смена подхода. Google прямо говорит: на сложных задачах 3.8 Flash выполняет больше шагов рассуждения и чаще обращается к инструментам, иногда тратя больше токенов ради качества. Это осознанный обмен эффективности на результат, и он меняет то, как стоит считать экономику агентных систем.

Вторая половина релиза — Flash Cyber. Она продолжает подход Google с ограниченным доступом к специализированным кибермоделям: модель умеет находить и чинить уязвимости на уровне флагманских моделей, поэтому доступ к ней дают только доверенным защитникам.

Три релиза за шесть недель

3.8 Flash выходит по той же вводной цене, что и 3.7 Flash: $0,75 за миллион входных токенов и $3,75 за миллион выходных. Вводная цена действует до 31 декабря 2026 года, а с 1 января 2027 года вырастет до $1,50 и $7,50 соответственно. Заявленная скорость и цена за токен остались на уровне 3.7 Flash, но итоговая стоимость сложного запроса может вырасти, если модель использует больше токенов.

В основе обеих версий лежит общая базовая модель. Google также пишет о длинных агентных циклах, которые многократно оценивают результат и помогают улучшать модели, но не раскрывает детали этой процедуры. Часть прироста в программировании и рассуждениях компания связывает с интенсивным обучением на задачах кибербезопасности — то есть специализированное направление помогло улучшить и обычную 3.8 Flash.

Больше шагов ради качества

Ключевое решение в 3.8 Flash можно сформулировать просто: на сложных задачах модель выполняет дополнительные шаги рассуждения и несколько раз обращается к инструментам. Из-за этого она может расходовать больше токенов, особенно при высоком уровне усилия (high effort). В API доступны уровни low, medium и high: они позволяют выбирать баланс между качеством, задержкой и расходом токенов.

Это важный сдвиг в экономике использования модели. Линейка Flash остаётся быстрой и сравнительно недорогой, но документация теперь прямо предупреждает: на сложной задаче 3.8 Flash может использовать больше токенов ради лучшего результата. Разработчик управляет этим компромиссом через уровень усилия.

Если главное ограничение — стоимость вычислений, можно выбрать низкий уровень усилия, чтобы сократить расход токенов. Другой вариант — остаться на Gemini 3.7 Flash, которую Google продолжает поддерживать для сценариев с приоритетом эффективности. Уровень усилия становится явным параметром архитектуры, а не скрытой настройкой.

Инсайт: 3.8 Flash нельзя свести к формуле «умнее за те же деньги». Цена за токен не изменилась, но токенов на сложную задачу может понадобиться больше. Поэтому агентные системы полезнее сравнивать по стоимости успешно выполненной задачи, а не только по тарифу за миллион токенов.

Бенчмарки: где 3.8 Flash обходит предшественника

По данным Google, на DeepSWE v1.1 — бенчмарке долгих инженерных задач — 3.8 Flash обходит большинство более крупных флагманских моделей в автономном решении задач от начала до конца и обходится дешевле. Этот тест оценивает не отдельный фрагмент кода, а способность пройти длинный инженерный маршрут. Как и любой бенчмарк, он не гарантирует такой же результат на конкретном проекте.

В опубликованных Google результатах 3.8 Flash также обходит 3.7 Flash и ряд флагманских моделей на Vals Finance Agent V2 и Harvey’s Legal Agent Benchmark. На HLE-Verified модель набирает 54,9%. Эти тесты охватывают финансовые, юридические, научные и другие профессиональные задачи, но переносить их результаты на рабочий процесс стоит только после собственной проверки.

Google показывает и демонстрации, которые сложно свести к цифрам. 3.8 Flash собрала игру с головоломками и автоматической генерацией текстур по простому запросу с циклической инструкцией в Google Antigravity. Другой пример — полностью рабочая DOS-версия Google Maps с местами, маршрутами и Street View, созданная одним запросом. Ещё модель строит интерактивные 3D-визуализации разборки устройств в Google AI Studio.

Flash Cyber: модель только для защитников

Gemini 3.8 Flash Cyber — специализированная модель для кибербезопасности. Она доступна только одобренным участникам программы Fairwind и предназначена для поиска уязвимостей и автоматического исправления кода. Google позиционирует её как модель для быстрых итераций с затратами уровня линейки Flash.

На стандартном отраслевом бенчмарке поиска уязвимостей CyberGym модель показывает уровень флагманских моделей в автономном обнаружении уязвимостей, обходя и 3.5 Flash Cyber, и заметно более крупные флагманские модели.

CyberGym ограничен кодом на C и C++, поэтому Google дополнительно оценила модель на внутреннем бенчмарке, где нужно находить уязвимости в сложных кодовых базах на 20 языках программирования. Здесь модель делает заметный скачок относительно предыдущих версий и находит уязвимости более чем в 70% случаев.

Отдельный акцент — автоматическое исправление. Google сознательно вложилась в починку уязвимостей с самого начала и поставила её выше наступательных возможностей вроде использования уязвимостей для атаки. На внешнем бенчмарке CWE-Bench, который проводит Collinear, модель показывает результат, близкий к лучшему при заметно меньшей цене: с первой попытки она исправляет уязвимость в 47,2% случаев против 47,8% у лидирующей флагманской модели.

Как Cyber проверяют на реальных задачах

Google приводит три результата использования Flash Cyber: два получены командами Google, ещё один — компанией Wiz. Это практические испытания, но их подробная методика и исходные данные не опубликованы.

  • Команда безопасности Chrome обнаружила, что 3.8 Flash Cyber выдаёт в 2,6 раза больше корректных исправлений уязвимостей в Chrome, чем лучшие коммерческие модели, которые при этом заметно крупнее.
  • По данным Wiz, на внутреннем бенчмарке компании полнота обнаружения у модели была выше на 7,5–9,7%, а стоимость — в 2,3–5,2 раза ниже, чем у других ведущих моделей.
  • Команда Google Cloud Vulnerability Research с помощью модели нашла критическую системную уязвимость менее чем за два часа. Google утверждает, что исследование и обнаружение уязвимости такого класса обычно занимает месяцы.

Важно: эти цифры — заявления Google и её партнёров, а не независимые тесты. Они показывают направление, но для собственного решения стоит проверять модель на своих кодовых базах, а не переносить чужие проценты на свой контекст.

Безопасность: кому и что разрешено

3.8 Flash поставляется с защитой от злоупотреблений в областях химического, биологического, радиологического и ядерного оружия, а также от наступательных действий в киберпространстве — в соответствии с Frontier Safety Framework. При этом полезные сценарии остаются доступными.

В Flash Cyber часть ограничений на киберзадачи мягче, чем в обычной 3.8 Flash. Благодаря этому одобренные специалисты получают более полный набор защитных возможностей, но одновременно растёт риск злоупотреблений. Поэтому модель доступна только проверенным организациям через Fairwind, а не всем пользователям Gemini API.

Обе модели сделали значительный скачок в устойчивости к инъекциям запросов — атакам, при которых в текст подмешивают вредоносные инструкции. Устойчивость оценивалась на бенчмарке Gray Swan IPI, который используется для проверки сопротивляемости моделей атакам через инъекции инструкций.

Цены и доступность

Вводная цена 3.8 Flash — $0,75 за миллион входных токенов и $3,75 за миллион выходных, как у 3.7 Flash. С 1 января 2027 года цена вырастет до $1,50 и $7,50. Это стоит учитывать при планировании долгосрочных проектов: вводный тариф — временный.

Доступ различается по аудитории. Разработчики могут строить на 3.8 Flash и пробовать агентные сценарии в Google Antigravity, начать работу в Gemini API через Google AI Studio и Android Studio или генерировать интерфейсы в Stitch. Предприятия получают доступ через Gemini Enterprise.

Для обычных пользователей 3.8 Flash доступна подписчикам Google AI Pro и Ultra в приложении Gemini, AI Mode в Google Search и Gemini в Google Sheets. Доступ к Flash Cyber выдаётся по заявке через Fairwind. В приоритете — государственные органы, операторы критической инфраструктуры и организации, которые поддерживают важные программные платформы.

Что осталось за кадром

Первое ограничение — цена вырастет вдвое с 1 января 2027 года. Если 3.8 Flash становится основой продукта, бюджет нужно закладывать с учётом удвоения, а не вводного тарифа.

Второе — дополнительные шаги рассуждения означают непредсказуемый расход токенов. На сложных задачах модель может потратить больше токенов, чем ожидалось, особенно на высоких уровнях усилия. Для систем с жёстким бюджетом на запрос это требует либо низких уровней усилия, либо перехода на 3.7 Flash.

Третье — Flash Cyber недоступна широкой аудитории. Если вам нужна модель для поиска уязвимостей, придётся проходить отбор через Fairwind, и нет гарантии, что доступ дадут. Это ограничение по замыслу, но оно сужает применимость модели для небольших команд.

Четвёртое — часть заявленных результатов опирается на внутренние бенчмарки и данные партнёров, которые нельзя воспроизвести независимо. Внутренний бенчмарк на 20 языках и цифры Wiz — это заявления, а не публичные тесты.

Кому подходит и как проверить

3.8 Flash стоит тестировать, если вы строите агентов для работы с кодом, документами или внешними инструментами и допускаете повышенный расход токенов на сложных запросах. По опубликованным Google результатам модель может стать более дешёвой заменой части флагманских сценариев, но это нужно проверять на собственных задачах.

Минимальный сценарий проверки: выберите один повторяющийся процесс — код-ревью, анализ документа или подготовку отчёта. Соберите 20–30 реальных примеров и сравните 3.8 Flash с текущей моделью по четырём метрикам: качество результата, доля успешно завершённых задач, время выполнения и денежная стоимость одного запуска. Отдельно измерьте расход токенов на уровнях low, medium и high.

Flash Cyber имеет смысл рассматривать только если вы — команда безопасности, оператор критической инфраструктуры или сопровождающий открытого ПО, и готовы пройти отбор Fairwind. Для всех остальных это релиз, за которым стоит наблюдать, а не инструмент, который можно взять в работу прямо сейчас.

Цена качества стала явной

Gemini 3.8 Flash — это не только очередной прирост в бенчмарках. В этом релизе Google прямо предупреждает: качество на сложных задачах может потребовать дополнительных токенов, а управлять этим компромиссом разработчик должен через уровень усилия. Вариант Cyber показывает вторую линию разделения: модели различаются не только по цене и скорости, но и по допустимым сценариям и условиям доступа.

Для агентных систем главный вывод проще: низкая цена токена ещё не означает низкую стоимость результата. Считать стоит стоимость успешно выполненной задачи — с учётом повторных попыток, задержки и всех токенов, которые модель использовала по пути.

Ссылки

Ссылки