Текст на картинке без ошибок: как добиться этого от нейросети
Маша Семёнова9 мин

Самая частая претензия к генераторам картинок звучит так: «картинка красивая, а надпись — набор закорючек». Буквы удваиваются, хвосты обрезаются, вместо «Открытие» получается «Оттркытиее», а на фоне сама собой появляется какая-то вывеска на несуществующем языке. Это не поломка и не ваша ошибка в настройках — так устроена генерация изображений. Но повлиять на результат можно, и довольно сильно: формулировка промта меняет качество надписи заметно больше, чем кажется. Разберём, почему буквы плывут, как просить надпись правильно, что делать отдельно с кириллицей и в какой момент честнее перестать бороться и добавить текст самому.
Почему буквы вообще плывут
Объяснение проще, чем принято думать. Модель, которая рисует картинки, не умеет писать. Она умеет рисовать формы. Буква для неё — такой же объект, как чашка, ветка или складка на ткани: набор чёрточек определённой конфигурации, который часто встречается в определённых местах — на вывесках, обложках, упаковке.
Когда вы просите надпись, модель не набирает текст шрифтом, а рисует то, что, по её опыту, выглядит похоже на эту надпись. Отсюда все типовые сбои: лишняя палочка в букве, слипшиеся знаки, буква, которая по форме почти правильная, но развёрнута зеркально. С точки зрения модели ошибки нет — форма похожа. С точки зрения человека, который умеет читать, всё сломано.
Отсюда главный практический вывод: чем короче и проще строка, тем выше шанс, что модель нарисует её правильно. Одно слово она держит несравнимо лучше, чем предложение на всю ширину кадра.
Как писать промт, если нужна надпись
Большинство промтов с текстом ломаются на одной и той же ошибке: человек описывает надпись словами вместо того, чтобы дать саму строку. «Добавь поздравление с днём рождения» — это описание смысла, и модель честно рисует что-то поздравительное по духу, придумывая буквы на ходу. Нужна ровно та строка, которая должна оказаться в кадре, поданная как строка.
Дайте точную строку в кавычках. Кавычки в промте работают как сигнал: это не описание, это буквальный текст. Плюс отдельная фраза о том, что менять его нельзя.
Постер кофейни, тёплый свет, деревянная стойка.
В верхней части кадра крупная надпись ровно такая: "ОТКРЫТО".
Никакого другого текста в кадре нет.
Укажите язык надписи. Это одна из самых недооценённых строчек в промте. Если не сказать, что надпись на русском, модель может смешать алфавиты и подставить латинскую «C» вместо русской «С» — визуально почти то же самое, а слово уже сломано. Фраза «надпись на русском языке, кириллицей» стоит одну строку и убирает часть ошибок сразу.
Одна короткая фраза вместо абзаца. Два-три слова — рабочий объём. Пять слов — уже риск. Предложение с запятыми и переносом на вторую строку — почти гарантированный брак. Если текста больше, его нужно резать, а не уменьшать кегль.
Скажите, где надпись и какого она размера. Модель заполняет кадр деталями по всей площади, и надпись, для которой не отведено место, вписывается куда придётся — поверх лица, на границе объектов, наполовину за краем. Опишите зону: «в нижней трети кадра, на ровном тёмном фоне без деталей», «крупно по центру, занимает примерно треть ширины». Мелкий текст модель рисует хуже крупного просто потому, что на маленькой площади меньше места для формы букв.
Запретите лишний текст. Строка «больше никаких надписей и вывесок в кадре» убирает случайные слова на фоне.
Собранный вместе промт выглядит примерно так:
Вертикальная афиша концерта, тёмный фон, световые лучи, минимализм.
В центре кадра крупная надпись на русском языке кириллицей,
ровно такая: "ВЕСНА".
Простой рубленый шрифт, буквы одинаковой высоты, белый цвет.
В нижней трети — свободное пространство без деталей.
Другого текста в кадре нет.
Про общие принципы формулировок — почему описание намерения работает хуже прямого указания и как не превращать промт в поток сознания — есть отдельный разбор в статье про типичные ошибки новичка в промтах. Правила там те же, просто на надписях они видны особенно наглядно.
Кириллица: честно о том, что с ней не так
Латиница у моделей выходит стабильнее кириллицы. Короткое английское слово получается ровным заметно чаще, чем такое же по длине русское. Причина всё та же: форм латинских букв в материале, на котором учились модели, банально больше — надписей, вывесок, обложек на английском в мире несопоставимо больше.
Обещать, что русская надпись выйдет идеально, нельзя. Но кириллицу можно сильно подстраховать, и вот что реально помогает.
Резать длину. Для русского текста порог ниже, чем для английского. Одно слово — почти надёжно, два — обычно нормально, дальше начинается лотерея. «АКЦИЯ» лучше, чем «БОЛЬШАЯ РАСПРОДАЖА», а «БОЛЬШАЯ РАСПРОДАЖА» лучше, чем «Большая распродажа до конца недели».
Просить крупный кегль. Чем крупнее буквы в кадре, тем больше пикселей на каждую и тем аккуратнее форма. Мелкая подпись внизу афиши почти всегда получается хуже, чем заголовок во всю ширину.
Просить простой шрифт. Формулировки вроде «простой рубленый шрифт без засечек, буквы одинаковой высоты, без наклона» дают более предсказуемый результат, чем «рукописный каллиграфический шрифт с росчерками». Декоративные начертания модель воспроизводит фантазийно, и отличить в них ошибку от задумки сложно даже глазом.
Отказаться от редких символов. Твёрдый знак, «ё», кавычки-ёлочки, тире, многоточие, цифры вперемешку с буквами — всё это источники сбоев. Если можно обойтись без них, лучше обойтись.
Не допускать переносов. Строка, которая не влезает и разрывается на две, ломается почти всегда: модель теряет связь между частями слова. Лучше короче в одну строку, чем красиво в две.
Писать заглавными. Прописные буквы кириллицы получаются ровнее строчных: у них меньше хвостиков и петель, которые модель любит дорисовывать не туда.
Буквы всё равно поплыли: что делать
Допустим, промт собран по всем правилам, а надпись всё равно кривая. Это нормально, генерация вероятностная. Дальше есть три шага, и делать их лучше именно в этом порядке — не меняя модель, потому что дело обычно не в ней.
Шаг первый: просто перегенерировать тот же промт. Звучит банально, но это самый эффективный ход. Один и тот же запрос даёт разные картинки, и на трёх-четырёх попытках часто попадается вариант с чистыми буквами. Смысл в том, чтобы не переписывать промт после первой неудачи: вы рискуете сломать удачную композицию, борясь со случайностью.
Шаг второй: упростить саму строку. Если после нескольких попыток буквы стабильно ломаются в одном и том же месте — например, всегда в длинном слове или на стыке с цифрой, — проблема в строке, а не в удаче. Сократите: уберите предлог, замените длинное слово коротким, выкиньте знаки препинания. Было «Мастер-класс по керамике 12 мая» — стало «КЕРАМИКА». Разница в результате обычно разительная.
Шаг третий: вынести часть текста из кадра. Самый недооценённый приём. В кадре остаётся только то, что обязано быть частью картинки — одно слово или короткий заголовок. Всё остальное — дата, адрес, время, имена, ссылка — не генерируется вообще. В промте на их месте просят пустую плашку, ровный фон или свободную полосу. Подписи добавляются позже, и там они получаются идеальными по определению.
План Б, который часто и есть план А
Теперь честно. Для афиши, обложки, приглашения и любого макета, где текст обязан быть безупречным, правильный путь чаще всего такой: сгенерировать кадр без надписи и добавить текст поверх самому.
Это не поражение и не костыль, а обычное разделение труда. Нейросеть отлично делает то, чего вы не сделаете руками — сцену, свет, фактуру, настроение. Набрать пять слов ровным шрифтом умеет любой редактор, включая бесплатные и встроенные в телефон. Пытаться получить от модели идеальную многострочную типографику — это тратить время на задачу, которая решается за минуту другим инструментом.
Практически это выглядит так: в промте вы просите не надпись, а место под неё — «в нижней трети ровный тёмный градиент без деталей», «пустая белая плашка по центру, без текста». Получаете чистую картинку с готовой зоной и вписываете туда что угодно, без риска, что буква перевернётся.
Тот же подход подробно разобран в материале про открытки к празднику — там место под поздравление закладывается в промт с самого начала. И в разборе обложек для YouTube: превью читается на экране телефона размером с ноготь, и там любая кривая буква видна сразу.
Какая именно модель в разделе изображений устойчивее держит буквы — вопрос отдельный, и решать его перебором в лоб не стоит: приёмы из этой статьи работают одинаково везде, а разница между попытками на одной модели обычно больше, чем между моделями.
Чек-лист перед публикацией
Кривую надпись легко не заметить: глаз достраивает знакомое слово целиком и проскакивает мимо ошибки. Поэтому проверять надо прицельно и по пунктам.
- Лишние и удвоенные буквы. Читайте слово по буквам, а не целиком. «Кофеейня» и «Расспродажа» на общем плане выглядят нормально.
- Зеркальные символы. Чаще всего страдают «Я», «И», «Б», «З», а из цифр — «3» и «5».
- Обрезанные хвосты. Нижние выносные элементы у «у», «д», «р», «ц», «щ» модель любит подрезать или терять.
- Разная высота знаков. Если одна буква в слове выше или толще остальных — надпись сразу читается как сгенерированная.
- Случайные слова на фоне. Проверьте вывески, корешки книг, упаковку, футболки — там часто заводится текст, которого вы не просили.
- Свежий глаз. Покажите картинку человеку, который не знает, что там должно быть написано. Он прочитает то, что реально нарисовано, а не то, что вы задумали.
Частые вопросы
Почему одна и та же надпись то получается, то нет?
Генерация вероятностная: каждый запуск строит картинку заново, и форма букв каждый раз собирается чуть иначе. Поэтому при неудаче первым делом стоит просто перезапустить тот же промт несколько раз, а не переписывать его. Переписывать имеет смысл, когда ошибка повторяется в одном и том же месте строки.
Кириллица правда хуже латиницы?
Да, короткие английские слова в среднем выходят ровнее русских — просто потому, что примеров таких надписей в обучающем материале было больше. Это не значит, что русский текст безнадёжен: короткая строка заглавными, крупным простым шрифтом и без редких символов получается вполне прилично. Гарантий по-прежнему нет ни для одного языка.
Сколько слов можно просить в кадре?
Практический ориентир — одно-два слова для русского текста и не больше короткой фразы для латиницы. Всё, что длиннее, лучше выносить из генерации и добавлять поверх. Дата, адрес, время и ссылка в кадре не генерируются никогда — их набирают вручную.
Можно ли попросить конкретный шрифт?
Прямо задать шрифт по названию нельзя — модель рисует форму, а не подставляет файл шрифта. Зато работает описание характера: рубленый без засечек, широкий, узкий, с толстыми штрихами, все буквы одной высоты. Чем проще описанное начертание, тем меньше ошибок.
Что делать, если модель дорисовывает текст, которого я не просила?
Добавьте в промт прямой запрет: «в кадре нет никаких надписей, вывесок, подписей и логотипов». Это помогает не всегда, но заметно снижает количество случайного текста. Оставшиеся мелкие вывески на фоне проще убрать в редакторе, чем выпрашивать чистый кадр у модели.
Есть ли способ получить надпись гарантированно без ошибок?
Только один — не генерировать её. Кадр без текста плюс подпись, набранная поверх в любом редакторе, даёт стопроцентно читаемый результат и полную свободу в шрифте и знаках препинания. Для афиш, обложек и приглашений это не запасной вариант, а основной рабочий способ. Стоимость самих генераций при этом считается по актуальному прайсингу, а лишние попытки добиться идеальных букв — это ровно те генерации, которые можно не тратить.
Ещё больше готовых образов
В «Трендах» — сотни готовых фотосессий. Выберите образ, приложите своё фото и получите кадр за пару секунд, без промта.
Открыть ТрендыПервые генерации — бесплатно


