Нейросеть для генерации изображений: 24 модели на одном запросе

Нейросети для генерации изображений описываются одинаково, а рисуют по-разному. Мы дали одно и то же описание всем моделям каталога и показываем результаты рядом — без отбора и повторных попыток.

Мы дали 24 нейросетям одно и то же описание и ничего не подбирали: что нарисовала модель с первого раза, то и стоит ниже. Задача была такая:

«Уютная кофейня осенним утром, на витрине табличка с надписью „Открыто“, тёплый свет из окна, фотореализм»

В описании нарочно три требования сразу: сцена, настроение и текст на картинке. Первое умеют все, третье — далеко не все, и именно оно делит модели на группы лучше любых характеристик.

Русский текст на картинке — вот где всё решается

Из 24 моделей слово «Открыто» без ошибок написали 17. Остальные семь выдали что-то похожее на кириллицу издалека: «Откыто» без «р», «Огкрыпо», «Откриto», «ОТКРТО» с потерянной «ы», «Откьуто» — а один раз и вовсе «OIRRETO» латиницей.

Смотреть надо в полном размере. На маленьком превью ошибку почти не видно: мозг достраивает знакомое слово, и «Откыто» читается как «Открыто». Мы на этом попались сами, пока готовили статью, — открывайте примеры в полный экран, разница вылезает сразу.

Проверять стоит именно на русском. Английское «Open» модели пишут почти безошибочно: латиница в обучающих данных встречается на порядки чаще, и по картинке с английской вывеской вы не поймёте, справится ли модель с вашей.

Самое неожиданное: цена почти ничего не говорит о грамотности. Дешёвые Grok Image и Seedream 4.0 написали слово верно, а FLUX.2 Pro — одна из заметных моделей в подборке — выдала «Огкрыпо». YandexArt, российская модель, от которой логично ждать русского языка, нарисовала на вывеске «OIRRETO», а на грифельной доске «O'RIEU».

Ошибка почти всегда одна и та же по механике: модель рисует не текст, а изображение, похожее на текст. Отсюда лишние хвостики у букв, «и» вместо «ы», латинские формы среди кириллических. На коротком слове это заметно сразу; в длинной надписи разваливается почти у всех.

Модели, которые дописывают за вас

Часть моделей не ограничилась одной табличкой. Nano Banana 2 добавила вывеску «УЮТНОЕ УТРО · КОФЕЙНЯ» и строку «КОФЕ · ВЫПЕЧКА · ТЕПЛО». GPT-5 Image повесила рядом меню с ценами: эспрессо 150, американо 180, латте 220. MAI-Image-2.5 Pro придумала кофейне имя «Уютный уголок» и грифельную доску «Кофе, Чай, Выпечка, Капучино».

Это свойство, а не ошибка, и оно обоюдоострое. Для картинки «просто посмотреть» — приятная деталь. Для обложки или карточки товара — лишний текст, который придётся убирать, и лучше сразу написать в запросе «без посторонних надписей».

Описание модели читают по-своему

«Осеннее утро» получилось не у всех. Заметная часть моделей нарисовала вечер или ночь: тёмная улица, горящие фонари, свет из окон как единственный источник. Виновато слово «тёплый свет» — модель трактует его как «тёплый свет в темноте», хотя речь шла об утреннем солнце.

Qwen Image 2 ушла дальше всех и нарисовала зиму: снег на подоконнике, сугробы, машина в снегу — и осенние листья поверх этого, как будто из другого кадра.

Вывод практический: спорные слова лучше уточнять. «Осеннее утро, солнечный свет, светлое небо» даёт результат стабильнее, чем «тёплый свет из окна».

Время: разница в 20 раз

Быстрые модели укладываются в 4–15 секунд, медленные доходят до 70–90. При этом связи «дольше — лучше» нет: самая долгая работа в подборке заняла 88 секунд и дала результат не лучше того, что получилось за 4.

Разница чувствуется, когда картинку подбирают: пять попыток по пять секунд — полминуты, пять попыток по полторы минуты — почти десять. Поэтому искать удачный вариант удобнее на быстрой модели, а финальный кадр рисовать той, что справляется с текстом.

Что из этого следует

Единственно лучшей модели в подборке нет — есть подходящая под задачу:

  • Нужен текст на картинке — берите ту, что уже справилась с кириллицей: результаты ниже, ошибки видно сразу.
  • Нужно быстро перебрать идеи — быстрые модели, 4–15 секунд на кадр.
  • Нужна сцена без надписей — годится почти любая, и дешёвая тоже: без текста разница между ними куда меньше, чем кажется по описаниям.

Проверять же стоит всегда на своём запросе. Разброс между моделями на одном и том же описании оказался больше, чем разброс в их характеристиках, — и предсказать его по названию и цене не выходит.

Что получилось у каждой модели

Одна и та же задача, один и тот же исходник. Ничего не отбирали: показываем всё, включая неудачные результаты.

Z-Image Старт
Tongyi-mai 24.1 с
FLUX.2 Klein 4B Старт
Black-forest-labs 4.3 с
Grok Image Старт
X-ai 73.8 с
GPT-5 Image Mini Старт
OpenAI 57.7 с
YandexArt Старт
Yandex 19.7 с
Qwen Image Старт
Qwen 10.3 с
Seedream 4.0 Старт
Bytedance 15.1 с
Seedream 5.0 Lite Про
Bytedance 38.4 с
Qwen Image 2 Про
Qwen 13.9 с
Grok Imagine Image Quality Про
X-ai 12.6 с
FLUX.2 Pro Про
Black-forest-labs 13.5 с
Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image) Про
Google 4 с
Seedream 4.5 Про
Bytedance 16.3 с
Nano Banana Про
Google 7 с
FLUX.2 Flex Про
Black-forest-labs 13.2 с
Nano Banana 2 Про
Google 12.6 с
FLUX.2 Max Про
Black-forest-labs 65.8 с
GPT-5.4 Image 2 Про
OpenAI 55.6 с
Seedream 5.0 Pro Про
Seedream 50 с
GPT-5 Image Про
OpenAI 87.8 с
MAI-Image-2.5 Про
Microsoft 26.2 с
GPT Image 1.5 Про
OpenAI 71.6 с
Nano Banana Pro Про
Google 17.8 с
MAI-Image-2.5 Pro Про
Microsoft 26.4 с

Все эти модели — по одной подписке

Переключаться можно в любой момент, первая неделя бесплатно.

Попробовать