Google выпустила Gemini 3.7 Flash — новую модель серии Gemini 3, заточенную под агентные сценарии: код, многошаговые задачи, оркестрацию инструментов. Контекст — 1 048 576 токенов, цена — $0,75 за миллион входных. Бенчмарки показывают скачок по сравнению с 3.6 Flash почти во всех агентных дисциплинах.

Линейка Flash у Google всегда была про баланс цены и скорости. 3.6 Flash подняла планку качества, но осталась моделью общего назначения. 3.7 Flash смещает акцент: разработчики явно нацелились на сценарии, где модель не просто отвечает, а работает — вызывает инструменты, удерживает длинный контекст, доводит многошаговую задачу до конца.

На бенчмарках это видно. DeepSWE — бенчмарк долгих программистских задач — 3.7 Flash набирает 65,3% против 48,6% у 3.6 Flash. Terminal-bench 2.1 — агентское программирование в терминале — 85,8% против 78,0%. AutomationBench — автоматизация корпоративных процессов — 30,4% против 17,0%. Прирост не маргинальный, а кратный.

Параллельно модель удерживает цену на уровне прошлого поколения: $0,75 за вход и $3,75 за выход до конца 2026 года. Claude Sonnet 5 при сопоставимом индексе интеллекта стоит $2 и $10. GPT-5.6 Terra — $2 и $12. Разрыв в цене — двукратный и более.

Контекст на миллион и три уровня размышления

Gemini 3.7 Flash принимает на вход текст, изображения, видео, аудио и PDF. Контекстное окно — 1 048 576 токенов (1 млн), лимит генерации — 65 536 токенов. Модель нативно мультимодальная: не подключает отдельные модули для разных типов данных, а обрабатывает всё в едином контексте.

Режим размышления (thinking) поддерживает три уровня: low, medium, high. Уровень minimal не поддерживается и возвращает ошибку. Thinking — механизм, при котором модель предварительно прогоняет цепочку рассуждений перед ответом. Выше уровень — больше времени и токенов на обдумывание, но точнее результат для сложных задач.

Из возможностей, которые важны для агентных сценариев: кэширование контекста, выполнение кода, вызов внешних функций (function calling), поиск файлов, структурированный вывод, поиск через Google Search и Google Maps. Computer Use — управление компьютером — доступен в режиме предварительной версии.

Важно: модель не поддерживает генерацию аудио, изображений и Live API — интерфейс для потоковой двусторонней голосовой связи. Это модель для работы с данными и инструментами, а не для голосовых ассистентов.

Что модель умеет делать с инструментами

Gemini 3.7 Flash поддерживает полный набор инструментов для агентных сценариев. Перечислим основные, с объяснением каждого.

  • Кэширование контекста — модель сохраняет ранее загруженный контекст и переиспользует его при повторных запросах. Это снижает стоимость и задержку для длинных диалогов и больших документов.
  • Выполнение кода — модель может запускать Python-код в песочнице и использовать результат для последующих шагов рассуждения.
  • Вызов функций (function calling) — модель обращается к внешним API и инструментам, получает результат и продолжает работу на его основе. Основа любого агентного сценария.
  • Поиск файлов — модель может искать по загруженным документам, не требуя внешней системы поиска.
  • Структурированный вывод — модель возвращает результат в формате JSON Schema, что позволяет парсить ответ программно без дополнительной обработки.
  • Поиск через Google Search — модель может искать актуальную информацию в интернете. 5 000 бесплатных запросов в месяц, далее $14 за 1 000 запросов.
  • Контекст URL — модель может читать содержимое веб-страниц по ссылке и использовать его в ответе.
  • Batch API — обработка больших объёмов запросов асинхронно, вдвое дешевле стандартного тарифа.
  • Flex inference — гибкий режим вывода с пониженным приоритетом, тоже вдвое дешевле. Подходит для некритичных по времени задач.

Бенчмарки: где 3.7 Flash обходит предшественника

Google приводит сравнение с четырьмя моделями: Gemini 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra и Muse Spark 1.2. Цель — показать, что 3.7 Flash достигает уровня более дорогих моделей при вдвое меньшей цене.

Индекс интеллекта Artificial Analysis — композитная метрика качества — у 3.7 Flash равен 56. У 3.6 Flash — 52, у Claude Sonnet 5 — 55, у GPT-5.6 Terra — 57. Модель обходит предшественника на 4 пункта и практически сравнивается с Claude Sonnet 5.

Сильнее всего 3.7 Flash проявляет себя в агентных и кодовых задачах. FrontierCode 1.1 — качество продакшен-кода — 43,6% против 34,4% у 3.6 Flash. DeepSWE — долгие программистские задачи — 65,3% против 48,6%. Terminal-bench 2.1 — агентское программирование в терминале — 85,8% против 78,0%. Code Arena — веб-разработка — 1588 Elo против 1538.

В автоматизации корпоративных процессов разрыв максимальный. AutomationBench — 30,4% против 17,0% у 3.6 Flash и 10,7% у Claude Sonnet 5. GPT-5.6 Terra набирает 23,6%, но стоит в разы дороже.

В задачах с длинным контекстом — GDM-MRCR v2, тест с 8 иглами на 128K — 3.7 Flash набирает 97,0% против 91,8% у 3.6 Flash. Это значит, что модель надёжно удерживает информацию даже в конце большого контекста. LVBench — понимание длинного видео — 85,4% против 84,2%.

Инсайт: главный скачок 3.7 Flash — не в рассуждениях как таковых, а в способности доводить многошаговую агентную задачу до конца. Именно это отличает демо от продакшена.

Тарифы: вводная цена и что будет дальше

До 31 декабря 2026 года действует вводная цена: $0,75 за 1 млн входных токенов и $3,75 за 1 млн выходных. С 1 января 2027 года цена удваивается: $1,50 за вход и $7,50 за выход. Кэширование контекста — $0,075 за 1 млн токенов до конца года, $0,15 после.

Стоимость хранения кэша — $0,50 за 1 млн токенов в час. С 1 января — $1,00. Это плата за удержание контекста между запросами, а не за сам запрос. Если кэш не используется — плата не начисляется.

Batch API — вдвое дешевле: $0,375 за вход и $1,875 за выход до конца года. Flex — аналогично. Priority — дороже: $1,35 за вход и $6,75 за выход. Бесплатный уровень доступен: запросы не тарифицируются, но данные используются для улучшения продуктов Google.

Совет: вводная цена действует до конца 2026 года. Если вы планируете долгосрочный проект на 3.7 Flash, закладывайте бюджет на удвоенную стоимость с января 2027.

Что говорят команды, которые уже тестировали

Box — платформа для работы с корпоративными документами — сообщила, что 3.7 Flash точнее и быстрее предшественника, с наибольшим приростом на самых сложных аналитических задачах. Browser Use зафиксировал снижение стоимости агента на 35% и рост попаданий в кэш на 8 процентных пунктов.

Harvey — платформа для юридической работы — заявил о росте показателя all-pass на 2,6 пункта по сравнению с 3.6 Flash на бенчмарке Legal Agent Bench. LangChain отметил, что 3.7 Flash справился с задачами, на которых провалились все остальные модели в сравнении.

Nunu.ai отметил паритет с GPT-5.6 Terra при стоимости в два раза ниже. OpenCode — реализация Figma-дизайнов в коде с точностью, которую другие фронтовые модели не демонстрируют. Databricks — модель подходит для запросов к большим массивам корпоративных данных: прогнозы выручки, поиск ключевых клиентов, решения об инвестициях.

Где это применимо в реальной работе

Сценарий первый — агент-программист. Модель получает задачу, читает кодовую базу через длинный контекст, вызывает инструменты для запуска тестов и проверки результатов. DeepSWE и Terminal-bench показывают, что 3.7 Flash доводит такие задачи до конца чаще предшественника.

Сценарий второй — анализ документов. PDF-отчёты, годовые отчёты, договоры на сотни страниц. 1 млн токенов контекста позволяет загрузить документ целиком. GDP.pdf — бенчмарк понимания PDF — 34,0% против 22,0% у 3.6 Flash. Harvey LAB-AA — юридические задачи — 90,7%.

Сценарий третий — оркестрация субагентов. Google демонстрирует примеры: 3D-игра, сгенерированная через оркестрацию субагентов, интерактивный лендинг, интерактивный годовой отчёт из PDF. Модель выступает как мастер-агент, распределяющий задачи между субагентами и собирающий результат.

Сценарий четвёртый — мультимодальный анализ. Видео, изображения и аудио обрабатываются в едином контексте. LVBench — 85,4%, CharXiv — 84,5% без инструментов и 88,7% с инструментами. Модель понимает графики, диаграммы и видео, не требуя отдельных моделей для каждого типа данных.

Что не работает и о чём стоит знать

Первое ограничение — цена удваивается с 1 января 2027 года. Вводный тариф — маркетинговый ход. Если 3.7 Flash становится основой вашего продукта, закладывайте удвоенный бюджет с нового года.

Второе — модель не генерирует изображения и аудио. Для визуального контента нужен отдельный вызов Nano Banana или Gemini Omni. Для голоса — Gemini 3.1 Flash Live или Flash TTS. Оркестрация нескольких моделей усложняет архитектуру.

Третье — режим minimal в thinking не поддерживается. Если вы рассчитывали на минимальное обдумывание для скорости — придётся использовать low или отключать thinking полностью. Среднее и высокое обдумывание увеличивает расход выходных токенов.

Четвёртое — Live API не поддерживается. Для потоковой двусторонней голосовой связи нужна другая модель. 3.7 Flash — для работы с данными, а не для разговорных интерфейсов.

Пятое — Computer Use доступен в режиме предварительной версии. Это значит, что функция может измениться, содержать ошибки и не подходит для продакшена без тщательного тестирования.

Шестое — на бесплатном уровне данные используются для улучшения продуктов Google. Платный уровень — нет. Если вы работаете с конфиденциальными данными, бесплатный уровень не подходит.

Кому подходит и как проверить

Модель стоит тестировать, если вы строите агентов, которые работают с кодом, документами или оркестрацией инструментов. 1 млн контекста, низкая цена и сильные бенчмарки в агентных задачах делают её кандидатом для замены более дорогих моделей.

Минимальный сценарий проверки: возьмите один повторяющийся процесс — анализ договора, код-ревью, генерация отчёта из данных. Загрузите 20–30 реальных примеров. Сравните 3.7 Flash с вашей текущей моделью по трём метрикам: точность результата, время выполнения, стоимость одного ответа в токенах.

Если модель справляется не хуже текущей, а стоит вдвое меньше — это рабочий аргумент для переключения. Но проверяйте на реальных задачах, а не на синтетических бенчмарках. Бенчмарки показывают потенциал, а не гарантированный результат в вашем конкретном процессе.

Модель, которая доросла до агента

Gemini 3.7 Flash — не очередная итерация с парой процентов качества. Это шаг от модели-генератора к модели-исполнителю. Кратный рост на DeepSWE и AutomationBench говорит о том, что Google целенаправленно тренировал модель на многошаговых задачах, где нужно вызывать инструменты, проверять результат и доводить дело до конца.

Главный вопрос не в том, умнее ли модель. А в том, готова ли ваша инфраструктура к агенту, который работает достаточно долго, чтобы результат имел значение. Дешёвая модель, которая не бросает задачу на полпути, меняет экономику агентных систем — но только если дать ей правильные инструменты и правильный процесс.

Ссылки

Ссылки