Black Forest Labs выпустила FLUX 3 Image — часть мультимодальной модели FLUX 3, отвечающую за картинки. Главное здесь не сама генерация, а управление композицией: сцену раскладывают по прямоугольным боксам, каждый элемент получает своё место, а правки применяют точечно, не перерисовывая кадр целиком.

Точечная правка изображения — давняя боль генеративных моделей. Помещаешь в промпт «поменяй цвет куртки, остальное не трогай», а модель послушно перерисовывает фон, меняет свет и сдвигает соседние объекты. Для картинки в ленту это досадно, для каталога или рекламного макета — почти всегда неприемлемо: правка одной детали не должна менять всё остальное. Часть моделей уже пытается совместить генерацию и редактирование в одном инструменте, но контроль композиции остаётся отдельной задачей.

FLUX 3 Image отвечает именно на это. Black Forest Labs выносит в основу продукта не скорость или «качество по бенчмаркам», а контроль композиции через bounding boxes — прямоугольные области, по которым раскладывают сцену. Это сдвиг от «модель решает за тебя» к «ты задаёшь раскладку, модель её наполняет».

Image-компонент мультимодальной FLUX 3

FLUX 3 Image — не отдельная линейка, а часть модели FLUX 3, которую Black Forest Labs анонсировала 23 июля как единую мультимодальную систему: видео, аудио, изображения и предсказание действий внутри одной архитектуры. Для изображений тогда пообещали отдельный выпуск, и теперь он появился. Компания позиционирует FLUX 3 Image как инструмент и для генерации с нуля, и для редактирования уже готовых картинок.

По заявленным возможностям модель умеет text-to-image, image-to-image и точечное редактирование, принимает до десяти референсных изображений на вход и выдаёт нативный вывод в 2K и 4K. Отдельно компания подчёркивает работу с текстом внутри изображения и фотореалистичные сцены. API уже доступен, для компаний есть отдельная лицензия на веса под запуск на собственной инфраструктуре.

Композиция через bounding boxes

Механика устроена просто. Полотно — это сетка от 0 до 1000 по обеим осям, независимо от выбранного соотношения сторон. Для каждого важного элемента рисуют прямоугольный бокс и описывают, что внутри него должно быть. Затем сцене дают одну строку-подпись, которая связывает все элементы между собой, — и модель рендерит кадр так, чтобы каждый объект оказался внутри своего бокса.

Под капотом это выглядит как так называемый layout prompt из двух частей: общий параграф-описание всей картинки и таблица элементов, где у каждого есть id, координаты бокса в формате [y_min, x_min, y_max, x_max] и текстовое описание. Подпись ссылается на элементы по их id — например, animal_1. Сами боксы до модели доходят дословно: компания прямо пишет, что нарисованный бокс не меняется, даже если внутренний «промпт-апсемплер» допишет вокруг него дополнительные элементы.

Это же устройство открывает путь агентам: компании не обязательно вручную рисовать каждый бокс. Можно отдать агенту одну строку и соотношение сторон, и языковая модель сама спланирует раскладку — напишет подпись и таблицу элементов. Потом любой бокс остаётся редактируемым: не понравилась раскладка — двигаешь отдельные элементы, остальное стоит на месте.

Управление композицией через bounding boxes на официальной странице FLUX 3 Image

Правка боксом, а не всем кадром

Вторая ключевая возможность — пошаговое редактирование готового изображения. Каждый бокс можно переописать, заменить на другой объект или сдвинуть, при этом всё, что не трогали, остаётся на месте. На странице продукта это показано на примере сёрфера: меняют цвет гидрокостюма и доски на красный, а волна, небо и остальная чёрно-белая композиция помечены как «заблокировано, без изменений».

Здесь нужна аккуратность в формулировках. Обещание «правка одной детали оставляет всё остальное как было» — это заявление самой Black Forest Labs, а не независимо подтверждённый факт. Без собственных тестов корректнее писать так: модель позиционируется как инструмент точечных правок с сохранением остальных областей кадра. Насколько строго сохраняются «заблокированные» пиксели в реальной работе — это стоит проверить руками на собственном сценарии.

Где такой контроль меняет рабочий процесс

Смысл боксов в том, что они дают повторяемость. В рекламе и каталогах это верстка сцены, которую можно воспроизводить и менять по частям: обновили цвет продукта, подвинули подпись, заменили фон — не пересобирая макет заново. Для дизайна это композиции, где у каждого элемента строгое место: наборная вёрстка вокруг фотографии, коллажи, сетки панелей, редакционные развороты.

Для продуктовых пайплайнов важнее связка с агентами. Одна строка и соотношение сторон — всё, что получает агент, дальше он сам планирует раскладку и отдаёт её модели. Это позволяет генерировать изображения в цикле, без человека в роли оператора, который вручную расставляет объекты. Там, где важны повторяемость, верстка сцены и аккуратные правки без визуального дрейфа, такой инструмент ложится в конвейер заметно легче, чем просто «сгенерируй картинку по тексту». Тем, кто уже встраивает генерацию картинок в продуктовые сценарии, стоит смотреть на это в связке с общим трендом на единые мультимодальные модели, которые объединяют картинку, видео и звук.

Что пока не подтверждено и что стоит проверить

Независимых тестов на момент публикации нет, поэтому сравнительных цифр по качеству компания не даёт в открытом виде — анонс сосредоточен на самой механике, а не на бенчмарках. Ключевое обещание про неизменность остальных пикселей при точечной правке остаётся заявлением разработчика, и именно его стоит проверять первым на собственном сценарии.

Стоит разделять и два режима доступа. API доступен сразу, но с оплатой по факту генерации; до 8 октября действует скидка 50%, дальше цена вырастет примерно вдвое. Для компаний отдельно предлагают лицензию на веса с дообучением и запуском на своей инфраструктуре. Открытую версию весов (FLUX 3 Dev) компания обещает в ближайшие недели — это план, а не уже выпущенный артефакт.

Тарифы и условия использования FLUX 3 Image на странице цен Black Forest Labs

Кому присмотреться и как проверить

Инструмент имеет смысл в первую очередь тем, у кого правки изображений — регулярный процесс: дизайнерам, командам, собирающим каталоги и рекламные материалы, и тем, кто встраивает генерацию картинок в продуктовый пайплайн. Если картинки нужны разово и без жёстких требований к компоновке, проще обойтись обычным text-to-image без лишней настройки.

Проверять стоит на одном повторяющемся сценарии, где важна сохранность остальной сцены: возьмите готовое изображение, поменяйте один бокс и сравните «до» и «после» по неизменённым областям. Заодно оцените цену — скидка до 8 октября делает такой тест дешевле, чем он будет позже.

От генератора к управляемому производственному инструменту

FLUX 3 Image — это шаг от «модель выдала картинку» к «модель собрала картинку по заданной раскладке». Боксы здесь не деталь интерфейса, а способ перенести контроль композиции от модели к человеку или агенту. Для задач, где важны повторяемость, верстка сцены и аккуратные правки без визуального дрейфа, это более пригодная для production форма генеративного изображения.

Останется ли эта ставка сильной — покажут не пресс-релизы, а то, насколько строго «заблокированные» области действительно не меняются в реальной работе. Это проверяемая гипотеза с понятным способом проверки: один сценарий, одно изображение, одна точечная правка и честное сравнение «до» и «после».