most-AI.com

GPT Image 2 или Nano Banana 2: что под текст, что под фото товара

Денис Коростелёв9 мин

Зачем сравнивать именно эту пару

В генераторе изображений Most AI сейчас двадцать две позиции, и общая матрица «какая модель под какую задачу» уже разобрана в статье сравнение моделей картинок. Здесь я её не переписываю. Задача другая и уже: взять две модели, между которыми чаще всего мечутся в рабочей переписке, и прогнать их через три конкретные задачи одним и тем же промтом.

Пара выбрана не случайно. GPT Image 2 и Nano Banana 2 — это две модели, которые обычно оказываются в шорт-листе у человека, которому нужна не «красивая картинка вообще», а картинка с надписью, с товаром или с правкой поверх уже готового кадра. Что нового появилось в самой Nano Banana 2, я разбирал отдельно в новостном обзоре модели — здесь только поведение на задачах.

Сразу о том, чего в статье не будет. Никаких чужих бенчмарков и процентов вида «обходит на двадцать пунктов»: сопоставимых замеров по этой паре нет, а придуманные числа хуже, чем их отсутствие. Никаких рассуждений об архитектуре и обучении — на выбор модели в кабинете это не влияет. И никакого вывода «одна лучше». Вывод будет другой: под текст беру эту, под товар — эту.

Условия, без которых сравнение бессмысленно

Правила простые, но их обычно нарушают в мелочах, и потом спорят о результате, который ничего не значит.

  • Один и тот же промт, слово в слово. Ни одной правки между запусками. Если поменять формулировку, вы уже не знаете, что дало разницу — модель или новая фраза.
  • По три дубля на каждой модели. Одна генерация — это лотерея. Разница видна не на «какой кадр красивее», а на том, насколько стабильно модель попадает в нужное.
  • Свой типовой материал, а не эффектная сцена. Тестируйте то, что реально делаете каждую неделю, иначе вывод не переносится на работу.
  • Смотреть на кадры рядом, а не по очереди. Откройте оба результата в соседних окнах. По памяти разницу всегда преувеличивают.

Дальше — три задачи. Промты даю целиком, чтобы можно было повторить прогон у себя и получить свой ответ, а не поверить мне на слово.

Задача первая: надпись внутри кадра

Это единственное место, где я гоняю тест на текст в картинке. Общие приёмы — как формулировать надпись, куда её ставить и почему модель «съедает» буквы — лежат в статье про текст на картинке без ошибок, и повторять их тут нет смысла. Здесь только то, как на одной и той же надписи ведут себя две модели.

Промт для прогона — с латиницей и кириллицей одновременно, чтобы не разносить тест на два захода:

Постер для кофейни, вертикальный формат. На верхней трети крупная надпись
латиницей MORNING BLEND. Ниже строка кириллицей: «Обжарка каждый вторник».
Фон — тёплый бежевый, чашка кофе снизу справа, много воздуха.
Шрифт — плотный гротеск, буквы чёткие, без искажений.

Что смотреть в результатах: целостность букв, отсутствие лишних символов, совпадение текста с промтом до знака, и отдельно — как выглядит кириллица рядом с латиницей в одном кадре.

Главное наблюдение по паре: латиница у обеих моделей выходит заметно ровнее кириллицы, и это не особенность одной из них. Если латинская строка получилась с первого дубля у обеих — не спешите делать вывод, разница между моделями на этой задаче проявляется именно на кириллице и именно на длинных строках. Короткое слово из шести букв обе выдают чисто, и здесь честнее сказать прямо: разницы почти нет, выбирать можно по цене.

На длинной кириллической строке картина расходится. Смотрите не на первый кадр, а на три подряд: важно, сколько из трёх дублей пришлось выбросить. Именно доля брака, а не лучший кадр из серии, определяет, на какой модели вы будете делать двадцать постеров. И если у вас в макете надпись задаётся не картинкой, а слоем текста поверх, весь этот тест вам не нужен — генерируйте фон на любой из двух.

Задача вторая: фото товара на однотонном фоне

Вторая задача ближе к деньгам, чем первая. Предметка на однотонной подложке — это карточки, каталог и обложки, то есть та работа, которая идёт партиями. Отдельный разбор всего процесса — в статье про фото товара для маркетплейса; тут только поведение двух моделей на одном промте.

Предметная съёмка: керамическая кружка молочного цвета на ровном светло-сером
фоне, без градиента. Мягкий рассеянный свет слева, лёгкая тень справа снизу.
Кружка целиком в кадре, ручка повёрнута вправо, центр композиции.
Реалистичная фактура глазури, никаких надписей и логотипов.

Проверять здесь нужно четыре вещи, и лучше по списку, а не «на глаз»:

  1. Ровность фона. Появился ли ненужный градиент, виньетка или еле заметная текстура, которую потом придётся вычищать.
  2. Геометрия предмета. Симметрия, форма ручки, отсутствие второй ручки и прочих подарков.
  3. Тень. Есть ли она вообще, и совпадает ли направление с описанным светом.
  4. Повторяемость. Три кадра подряд должны быть похожи настолько, чтобы стоять в одном каталоге.

Четвёртый пункт важнее первых трёх. Одиночная красивая кружка не стоит ничего, если следующие пять предметов встанут в другом свете. При партийной работе выигрывает не та модель, у которой лучший кадр, а та, у которой три кадра из трёх можно поставить рядом. Именно на этом критерии пара обычно и расходится сильнее всего — сильнее, чем на надписи.

Отдельно отмечу: если фон вам нужен идеально чистый, никакая модель не даст его надёжнее, чем готовый инструмент «Удаление фона» в кабинете. Генерируете предмет как угодно, затем срезаете фон отдельным шагом и подкладываете свой. Это дешевле любых попыток вымучить ровную подложку промтом.

Задача третья: правки готового кадра словами

Третий заход — не про приёмы редактирования. Как формулировать правки, что писать, чтобы модель поняла «убери, а не перерисуй», разобрано в промтах для редактирования фото. Здесь один вопрос: держится ли объект между итерациями.

Механика теста такая. Берёте один готовый кадр из второй задачи, загружаете его в обе модели и даёте обеим одну и ту же правку. Затем поверх результата — вторую правку. Затем третью. Итого три шага.

Шаг 1: смени фон на светло-бежевый, кружку и свет не трогай.
Шаг 2: добавь тонкую тень под кружкой, направление света сохрани.
Шаг 3: сделай кадр немного шире, кружка остаётся в центре и без изменений.

Смотреть надо на одно: насколько кружка на третьем шаге похожа на кружку с нулевого. Модели, которые честно правят фон, оставляют предмет практически нетронутым. Модели, которые каждый раз пересобирают кадр заново, дадут после трёх итераций уже другую кружку — другой оттенок глазури, чуть другую форму ручки. На одной правке это незаметно, на трёх — очевидно.

Практический смысл теста: если вы делаете серию из одного исходника, дрейф предмета между шагами дороже любой разницы в качестве первого кадра. Проверять это надо до того, как вы начали партию, а не на пятнадцатой картинке.

Цена и что она значит на партии

Числа беру из актуального прайсинга, не по памяти. Генерация в GPT Image 2 стоит от 3 ₽, в Nano Banana 2 — от 8 ₽. Разница в цене одного кадра выглядит мелочью, пока вы делаете один кадр.

Считаем на партии из двадцати картинок. Двадцать генераций — это 60 ₽ против 160 ₽. Но партия из двадцати картинок никогда не делается двадцатью генерациями: с тремя дублями на кадр это уже шестьдесят запусков, то есть 180 ₽ против 480 ₽. Разница около трёхсот рублей на одну партию — величина, которую видно в месячном расходе, но которая мгновенно перекрывается, если на более дорогой модели вы выбрасываете вдвое меньше дублей.

Отсюда правило, к которому сводится вся арифметика: сравнивать надо не цену генерации, а цену годного кадра. Если модель дороже вдвое, но брака у неё втрое меньше, она дешевле. Считайте долю выброшенных дублей на своём материале — она у каждого своя и зависит от типа задачи сильнее, чем от модели.

Короткая сводка

Задача Что берём Почему
Надпись внутри кадра GPT Image 2 Цена дубля ниже, а на надписи всё равно приходится перебирать варианты
Фото товара на однотонном фоне Nano Banana 2 На партии важнее повторяемость кадров, чем стоимость одной генерации
Правки готового кадра словами Та, что удержала предмет на трёх шагах Проверяется тестом выше, у разных типов предметов ответ разный

Таблица — это отправная точка, а не приговор. На иллюстрациях, портретах или сложных сценах порядок может оказаться другим, и единственный способ это узнать — прогнать свой материал через обе модели.

Что в итоге

Под текст в кадре я по умолчанию беру GPT Image 2: перебор дублей на этой задаче неизбежен, и дешёвая генерация тут решает больше, чем аккуратность отдельного кадра. Под предметку партиями — Nano Banana 2, потому что в каталоге ценится не лучший кадр, а одинаковые кадры. Под правки — та из двух, которая на вашем предмете не поплыла за три итерации; универсального ответа тут нет.

И честная оговорка, без которой сравнение превращается в рекламу. На коротких латинских надписях разницы между моделями практически нет. На простых сценах без текста и без строгих требований к повторяемости — тоже. Если ваша задача попадает в эту зону, берите ту, что дешевле, и не тратьте время на тест. Обе модели живут в одном кабинете, оплата в рублях, без VPN, переключение между ними стоит один клик — так что и проверка обходится в несколько десятков рублей и пятнадцать минут.

Частые вопросы

Можно ли сравнить эти модели бесплатно?

В бесплатной дневной квоте есть Nano Banana — четыре изображения в день. Это соседняя модель, а не Nano Banana 2, поэтому полноценного парного теста на квоте не получится. Для честного сравнения нужны платные генерации обеих моделей, но три задачи по три дубля обходятся в сумму порядка нескольких сотен рублей.

Сколько дублей нужно, чтобы вывод был надёжным?

Минимум три на каждую модель и каждую задачу. На одном дубле вы сравниваете удачу, а не модели. Если после трёх дублей результаты выглядят одинаково — это тоже результат: значит, на вашей задаче разницы нет и можно выбирать по цене.

Почему кириллица получается хуже латиницы?

Это общая особенность генерации текста в кадре, а не свойство конкретной модели из этой пары. Практический вывод простой: длинную кириллическую строку надёжнее не генерировать, а положить текстовым слоем поверх готового фона в любом редакторе.

Что делать, если нужен и чистый текст, и идеальный товар в одном кадре?

Разделить задачу. Сгенерировать предмет на нейтральном фоне, отдельно убрать фон готовым инструментом кабинета, а надпись добавить слоем. Попытка получить всё за одну генерацию почти всегда стоит больше дублей, чем три отдельных шага.

Стоит ли смотреть другие модели, кроме этих двух?

Да, если задача выходит за рамки текста и предметки. В каталоге есть Nano Banana Pro, Seedream 5.0 Lite, Flux 2 Pro и другие позиции, и на иллюстрациях или портретах шорт-лист будет другим. Общая матрица выбора разобрана в отдельной статье, ссылка на неё в начале материала.

Как понять, что пора пересмотреть выбор?

Когда меняется задача или в каталоге появляется новая версия одной из моделей. Пересматривать выбор ради самого факта обновления не нужно: если серия уже идёт на одной модели, переключение посреди партии даст заметный шов в стиле. Доводите серию до конца, а тест новой версии ставьте перед следующей.

Проверьте приём на своём фото

Откройте редактор и прогоните описанный приём на своём снимке — результат видно сразу, а не в теории.

Открыть редакторРусский интерфейс, оплата в рублях

Денис Коростелёв

Продуктовый аналитик

Сравнивает модели на одинаковых промтах и считает себестоимость результата. Не верит сравнениям без методики — включая собственные.