Qwen-Image-3.0: генератор изображений от Alibaba, который рендерит читаемый текст размером 10 пикселей
Alibaba за два дня выпустила два продукта, которые обошли мировых лидеров. Вчера — TTS-модель, которая заняла первое место в рейтинге голосов. Сегодня — генератор изображений, который умеет делать то, что не умеет ни одна другая модель: рендерить читаемый текст размером 10 пикселей, генерировать газетные полосы и LaTeX-статьи за один проход.
22 июля команда Qwen представила Qwen-Image-3.0 — третье поколение своей модели генерации изображений. Если первая версия была про «точность», вторая — про «разнообразие и красоту», то третья сводится к одному слову: «настоящее».
Три измерения «настоящего»
Богатое содержание
Модель принимает промпты (описания) до 4500 токенов — это примерно 3000 слов описания. Для сравнения: большинство генераторов изображений ограничиваются несколькими сотнями токенов.
Что это даёт на практике: один промпт — и модель создаёт сложную композицию. Газетную полосу с колонками и заголовками. Раскадровку из 9 кадров. Экзаменационный бланк с вопросами. Инфографику 3 на 3 с девятью разными темами. Интерфейс с вложенными окнами — картинка в картинке в картинке.
Никакой постобработки, никаких склеек. Один проход, один промпт, один результат.
Аутентичные детали
Текст на изображениях читается даже при размере 10 пикселей. Полные страницы LaTeX-статей с формулами, символами, геометрическими фигурами и логическими выводами. Поры кожи, отдельные волосы, фотореалистичная текстура.
Для дизайнеров и контент-мейкеров это прорыв: раньше сгенерированное изображение с текстом было лотереей — буквы искажались, слова сливались, формулы превращались в каракули. Qwen-Image-3.0 рендерит текст как текст, а не как декоративный элемент.
Глубокие знания
12 языков с нативным рендерингом. Более 100 стилей искусства. Реалистичные интерфейсы: веб-страницы, игровые экраны, стримы. Плюс интеграция с веб-поиском — модель может подтягивать актуальную информацию и встраивать её в изображение.
Для кого это
Alibaba позиционирует Qwen-Image-3.0 не как «игрушку для создания картинок», а как инструмент для работы:
Дизайн — макеты, прототипы интерфейсов, инфографика. Контент — иллюстрации для статей, обложки, визуализации данных. Образование — экзаменационные бланки, учебные материалы, диаграммы. Электронная коммерция — карточки товаров, баннеры, рекламные креативы.


Скандал с мета-ключевыми словами
Не обошлось без ложки дёгтя. explainx.ai обнаружил, что в промптах к демонстрационным изображениям использовались «meta-keywords» — скрытые ключевые слова, которые направляют генерацию, но не видны в финальном описании. Это вызвало вопрос: насколько результаты на сайте Alibaba воспроизводимы обычными пользователями?
Кроме того, модель вышла без открытых весов (open weights) и без бенчмарков (тестов сравнения). Alibaba показала красивые картинки, но не предоставила независимых метрик для сравнения с конкурентами (Midjourney, DALL-E, Flux).
Сравнение с конкурентами
Где Qwen-Image-3.0 выигрывает: сложные композиции с текстом, многоязычный рендеринг, длинные промпты. Ни одна другая модель не умеет делать газетные полосы и LaTeX-статьи в один проход.
Где пока не ясно: качество одиночных изображений без текста, скорость генерации, цена. Без открытых весов и независимых бенчмарков сложно объективно сравнить с Midjourney или Flux.
Два продукта за два дня
Qwen-Audio-3.0-TTS (вчера) — первый в мире по качеству голоса. Qwen-Image-3.0 (сегодня) — самый продвинутый генератор изображений с текстом. Alibaba за 48 часов показала два флагманских продукта в двух разных доменах.
Для контекста: на прошлой неделе Moonshot AI выпустила Kimi K3 (2.8T параметров). DeepSeek оценили в $50 миллиардов. Китайские AI-компании перестали «догонять Запад» — они задают темп в своих нишах.
Мой взгляд
Qwen-Image-3.0 впечатляет возможностями, но вызывает вопросы к маркетингу. Показывать идеальные картинки без открытых весов и бенчмарков — это стандартная стратегия «посмотрите, как красиво, а проверить не сможете». Сколько из этих результатов воспроизводится обычным пользователем через API — пока неизвестно.
Но если даже половина заявленного работает — это серьёзный конкурент для Midjourney и DALL-E. Особенно в задачах, где нужен текст на изображении: инфографика, макеты, учебные материалы. Тут у Qwen-Image-3.0 пока нет равных.
Комментарии ()