Black Forest Labs выпустила Flux 3 Image — картинки, которые не «плывут» при правках
Привет, друзья! Помните, я в июле писала про Flux 3 от Black Forest Labs — первую нативно мультимодальную модель, где изображение, видео, аудио и предсказание действий для роботов обучались в одной архитектуре? Тогда до публики добралась только «видео-половина» — Flux 3 Video. И вот, 1 октября 2026, вышла вторая: Flux 3 Image. «Картиночная» часть семейства. И она, по-моему, получилась интереснее, чем многие ждали.
Новость свежая — анонс вышел буквально сегодня, 1 октября 2026. У модели уже открыт публичный доступ через сайт Black Forest Labs и платформы-партнёры.
Что вообще нового
Главное отличие Flux 3 Image от всего, что мы видели раньше у BFL, — это не качество картинки (хотя и оно подтянулось), а контроль над результатом. Модель заточена под три сценария, которые раньше требовали ручной перерисовки или долгих итераций:
— Раскладка сцены через bounding boxes. Вы сами рисуете прямоугольники под каждый объект и описываете, что в них должно быть. Нейросеть заполняет рамки по вашему описанию, а не выдумывает композицию сама. Для тех, кто не хочет рисовать руками, есть агентский режим: любая LLM получает одну строку описания и нужное соотношение сторон, сама планирует раскладку, а вы потом двигаете то, что не понравилось.
— Пошаговое редактирование, которое не трогает остальное. Каждый бокс можно переописать, заменить или переместить. Картинка выдерживает серию правок подряд и не «плывёт». По заявлению команды, это главный прорыв — раньше большинство моделей при правке одного элемента перекраивали всё изображение целиком.
— До 10 референсов в одном кадре. Каждый референс получает имя вроде ref_image_0, ref_image_1 и так далее, в порядке добавления. В промпте можно ссылаться на конкретный референс.
И сверху — генерация до 4K (нативные 5456×3072 пикселей, около 16,8 мегапикселей). BFL специально показывает в демо, что текст высотой ~225 пикселей на вывеске или бумажном фонарике читается при сильном зуме.
Контекст: что такое Flux 3 вообще
Если кто-то пропустил — Flux 3 от Black Forest Labs вышел 23 июля 2026 как первая нативно мультимодальная модель BFL. До этого каждое направление (картинки, видео, аудио) делалось отдельно. В Flux 3 всё обучалось в одной архитектуре — единый мультимодальный flow matching. Это и есть главное отличие семейства от того, что было раньше.
В августе до публики дошёл видео-блок — Flux 3 Video: клипы до 20 секунд в HD или Full HD, нативный звук, диалоги с липсинком на 14+ языках. Он уже доступен через API BFL и партнёров, идёт в продакшне у Picsart, Nous Research и других.
Теперь, 1 октября — картинки. По словам BFL, в ближайшие недели выйдут ещё два блока: Flux 3 Action (предсказание действий для роботов, первыми получат Mimic Robotics) и Flux 3 Dev с открытыми весами мультимодального backbone.
Контекст: конкуренты не спят
И вот тут, по-моему, начинается самое интересное. Black Forest Labs анонсировала Flux 3 Image, и буквально перед этим Ideogram (один из главных конкурентов в редактировании изображений) объявил Ideogram 4.5 — тоже с акцентом на пошаговое редактирование и тоже со скорым релизом открытых весов. То есть мы сейчас наблюдаем, как две сильные компании одновременно увидели одну и ту же проблему: «картинки красивые, но контроля над ними нет» — и одновременно предложили решения.
У Google, кстати, на той же неделе вышел Gemini 4 Argon, который тоже показал лучший результат на бенчмарке LVBench по пониманию длинных видео (91,7%). То есть мультимодальные модели в целом сейчас переживают перелом — они начинают понимать, где и как их результат «плывёт» при правках. И каждый крупный игрок пытается эту проблему решить по-своему.
Доступ и цены
Модель уже появилась в нескольких местах. На официальном сайте Black Forest Labs — с бесплатным демо. API со скидкой 50% до 8 октября. Доступ также открыт через платформы-партнёры BFL. Для тех, кто хочет коммерчески использовать или запускать у себя — есть лицензия на коммерческие веса (on-premise, fine-tuning, всё как полагается).
Версия с открытыми весами — обещают в ближайшие недели. Это важный момент: BFL исторически не закрывает модели, и именно поэтому вокруг FLUX выросла большая экосистема локальных форков, LoRA-адаптеров и интеграций. Ждём.
Почему это важно
Для меня лично главное — что bounding boxes и пошаговое редактирование наконец-то становятся нормой, а не фичей одной модели. Когда я в последний раз пробовала генерировать картинку с точной композицией (например, «человек слева, дерево справа, текст в центре»), это превращалось в 30 попыток с переписыванием промпта. Теперь, если BFL не врёт, можно просто нарисовать три прямоугольника и сказать «вот это — человек, вот это — дерево, вот тут — текст». И модель не будет каждый раз рандомно тасовать элементы.
Это, по-моему, тот же сдвиг, что мы наблюдали в коде, когда агентские режимы Claude Code и Cursor перестали быть игрушкой и стали рабочим инструментом. В изображениях мы только в начале этого пути.
Что делать нам
Если вы работаете с изображениями профессионально — Flux 3 Image надо щупать. Бесплатное демо есть на сайте BFL, через платформы-партнёры — по их ценам. Скидка 50% на API действует до 8 октября, так что есть окно попробовать «по дешке».
Если вы ждёте открытых весов — осталось потерпеть. Скорее всего, в течение октября FLUX 3 Dev станет доступен для локального запуска, и мы получим все привычные плюшки: LoRA, ControlNet, интеграции в ComfyUI и Automatic1111. По опыту с FLUX 2 это вопрос дней, а не месяцев.
Я ставлю на то, что к концу октября мы увидим первые посты с заголовком вроде «Flux 3 Image + мой локальный LoRA = идеальная картинка для моего магазина». Следите за обновлениями.
С вами была я, Ками. Пока-пока!
Источники: официальная страница Flux 3 на BFL, блог BFL про анонс Flux 3 в июле, The Decoder. Первоисточник на русском: статья на Хабре.
Комментарии ()