Google выпустила Nano Banana 2.1 — обновлённую модель для генерации и редактирования изображений в семействе Gemini. Она развивает Nano Banana 2 (Gemini 3.1 Flash Image) и сохраняет скорость и стоимость, характерные для Flash-линейки. При этом в ней появились функции, которые раньше были доступны в более дорогой Pro-модели: работа с 14 референсными изображениями, привязка к поиску Google (grounding), режим Thinking и метка подлинности C2PA.

Для бизнеса генерация изображений редко бывает разовой задачей. Каталоги товаров, рекламные макеты и карточки маркетплейсов требуют десятков или сотен изображений, где важно сохранять одних и тех же персонажей, товары и пропорции от кадра к кадру. Быстрые и недорогие модели обычно справлялись с этим хуже, а более стабильные Pro-версии стоили заметно дороже. Приходилось выбирать между скоростью, ценой и стабильностью.

Nano Banana 2.1 как раз пытается закрыть этот разрыв. Google объединила скорость Flash-модели с функциями, которые нужны для серийной работы с изображениями. Разберу, что изменилось, какие ограничения остались и кому это обновление действительно полезно.

Раздел Nano Banana image generation в официальной документации Google AI for Developers: описание моделей линейки и примеры генераций

Чем 2.1 отличается от прошлой версии

Nano Banana 2.1 — обновление Nano Banana 2, известной в линейке Gemini как Gemini 3.1 Flash Image. Google позиционирует её как альтернативу более дорогой Gemini 3 Pro Image (Nano Banana Pro). По данным Google, качество и реализм изображений выросли в разрешениях 1K, 2K и 4K. Разрешение 1K по-прежнему используется по умолчанию.

  • лучше следует сложным промптам и сохраняет персонажей при последовательном редактировании;
  • лучше генерирует текст внутри изображений и собирает инфографику;
  • может использовать до 14 референсных изображений; Google заявляет, что модель способна сохранять согласованность до 4 персонажей и 10 объектов;
  • может опираться на актуальные данные и изображения из Google Search и Image Search (grounding);
  • поддерживает режим Thinking с уровнями minimal, medium (по умолчанию) и high.
Спецификации Nano Banana 2.1 в документации Google: поддержка до 14 референсных изображений, лимиты согласованности объектов и персонажей

Google также исправила артефакты в широких и панорамных форматах 1:4, 4:1, 1:8 и 8:1 при разрешениях 2K и 4K. Раньше на таких изображениях могли появляться заметные дефекты по краям кадра. По документации, в версии 2.1 эти проблемы исправлены.

Что модель умеет и чего в ней нет

Модель принимает текст, изображения, PDF и видео. На выходе она может генерировать изображения и текст. Контекстное окно — 131 072 токена, максимальный текстовый вывод — 32 768 токенов. Поддерживаются многошаговое редактирование, генерация изображения из видео, чередование текста и изображений (interleaved), виртуальная примерка (virtual try-on) и метка подлинности C2PA Content Credentials. Для серийной работы доступны пакетная обработка (batch inference) и Provisioned Throughput — заранее зарезервированная пропускная способность. Генерация и редактирование в одном инструменте для этого класса моделей уже стали обычной возможностью.

Есть и ограничения. Модель не поддерживает генерацию аудио, function calling, Gemini Live API, structured output, тонкую настройку и URL context. Параметры seed, topK, topP, temperature и logprobs тоже отключены. Если передать любой из них, API вернёт ошибку. Поэтому точно повторить генерацию с помощью seed не получится: стабильность серии зависит от референсов и последовательных правок, а не от детерминированного вывода.

Где это меняет рабочий процесс

Практический смысл обновления хорошо виден на сценарии каталога. Вы передаёте модели фотографии товара и референсы персонажа, а затем последовательно редактируете сцену. Модель должна сохранять ключевые объекты на протяжении серии правок, а привязка к поиску Google позволяет использовать актуальные данные и изображения. Это особенно полезно, когда результат должен соответствовать реальному товару или узнаваемому месту, а не создаваться только по текстовому описанию.

Режим Thinking позволяет выбирать баланс между скоростью и качеством: minimal подходит для быстрых черновиков, medium используется по умолчанию, high — для сложных запросов, где важна точная передача сцены. Такой же подход к глубине рассуждения Google уже использует в других моделях линейки Gemini.

Что пока не подтверждено и что стоит проверить

Все цифры и возможности выше взяты из официальной документации Google. Независимых тестов на момент публикации нет. Заявленную стабильность до четырёх персонажей и десяти объектов в серии правок лучше проверять на собственных сценах: реальная сложность кадра, ракурсы и освещение могут сильно отличаться от демонстрационных примеров.

Ещё один фактор — расход токенов при высоком разрешении. По документации, одно входное изображение учитывается как 1 120 токенов, а сгенерированное — от 1 120 токенов в 1K до 3 780 в 4K. При серийной генерации расход быстро растёт, поэтому перед внедрением лучше посчитать его на типовом сценарии.

Кому присмотреться и как проверить

Модель может быть полезна командам, которые регулярно создают каталоги, карточки маркетплейсов, рекламные материалы или контент с повторяющимися персонажами. Если изображения нужны время от времени и строгая стабильность серии не важна, разница с обычной генерацией по текстовому описанию будет менее заметной.

Проверять модель лучше на одном сценарии с повторяющимся персонажем или товаром. Соберите серию из 5–10 правок с референсами и посмотрите, насколько стабильно сохраняются персонаж и объекты. Одновременно оцените расход токенов на нужном разрешении: именно он заметно влияет на стоимость серийной работы.

Сдвиг порога, а не новый флагман

Nano Banana 2.1 не выглядит новым флагманом. Скорее, Google переносит часть функций для серийной генерации изображений из более дорогого Pro-класса в быстрый Flash-класс. Для бизнеса это может быть важнее очередного прироста качества: при выборе модели имеет значение не только то, насколько красиво она рисует, но и насколько стабильно сохраняет персонажа, товар или сцену в серии правок и сколько такая серия стоит. Это лучше проверять на собственном сценарии, а не только по документации и демонстрационным изображениям.