Скан не читается: как распознать текст с фото страницы
Катя Долгих9 мин

Ситуация знакомая до зубовного скрежета: нужен текст, а есть скан. Методичка, которую кафедра выложила фотографиями страниц. Страница книги, снятая с рук в библиотеке. Договор, отсканированный в позапрошлом десятилетии на аппарате с полосой посередине. Копировать из этого нечего — это картинка, а не текст.
Нейросети такую задачу решают, и решают неплохо: текстовые модели умеют принимать изображение вместе с вопросом и выдавать содержимое страницы буквами, которые уже можно править, искать по ним и вставлять куда угодно. Но у этого способа есть особенность, о которой обычно узнают поздно и неприятно. Модель не сообщает, что чего-то не разобрала. Она дописывает. И дописанное выглядит ровно так же уверенно, как честно прочитанное.
Ниже — практическая часть: как подготовить исходник, как сформулировать запрос, что делать с наклоном и тенью, почему сыплются таблицы и формулы и как организовать вычитку так, чтобы она не съела всё сэкономленное время.
Сначала исходник, потом промт
Главная ошибка — пытаться вытянуть промтами то, чего физически нет в кадре. Если строка утоплена в тень и не видна человеческому глазу, ни одна формулировка не заставит модель её прочитать — заставит только выдумать. Поэтому порядок действий такой: сначала добиваемся приличной картинки, потом занимаемся текстом.
Если у вас на руках бумажный оригинал, переснять его заново почти всегда быстрее, чем чинить плохую копию. Пять минут на нормальный кадр экономят полчаса вычитки. Вот что реально влияет на результат.
Свет. Рассеянный дневной свет от окна — лучшее, что бывает. Лампа сверху и чуть сбоку — тоже нормально. Встроенная вспышка — почти всегда плохо: она даёт белое пятно в центре, которое съедает несколько строк, а на глянцевой бумаге ещё и отражается. Собственная тень от руки или головы — вторая по частоте причина потерянного текста, поэтому свет должен падать не из-за вашей спины.
Ракурс. Камера строго над страницей, плоскость снимка параллельна плоскости листа. Снятая с кресла страница уходит в трапецию: дальний край мельче ближнего, строки сходятся. Модель с таким кадром справится, но точность просядет — особенно на верхней и нижней строках.
Разворот. Толстую книгу лучше снимать по одной странице, а не разворотом. У корешка бумага загибается, буквы там растягиваются и уходят в тень; если прижать страницу рукой или снимать книгу, положив её на стол под собственным весом, полоса у корешка читается заметно лучше.
Резкость и размер. Наводите фокус тапом по тексту, а не полагайтесь на автомат — он часто цепляется за край стола. Кадрируйте так, чтобы страница занимала почти весь кадр: половина фотографии, занятая столешницей, — это выброшенное разрешение. Сжимать файл перед загрузкой не нужно, мелкий шрифт первым страдает от компрессии.
Если оригинала нет. Когда есть только чужой файл — скан от коллеги, старая копия, кадр из мессенджера, — работать придётся с тем, что есть. Тогда хотя бы разверните изображение в правильную ориентацию, обрежьте лишние поля и прогоните через базовое улучшение: в каталоге Most AI для этого есть готовые инструменты «Улучшить фото» и «Увеличить размер фото», они работают без промта — загрузили картинку, получили результат. Иногда этого хватает, чтобы полоса мелкого шрифта стала различимой.
Как просить распознавание
Простое «что тут написано» работает, но даёт самый рискованный результат: модель отвечает свободным пересказом и легко подменяет непрочитанное правдоподобным. Полезнее задать рамку — что делать с непонятными местами, как размечать структуру, чего не делать вовсе.
Базовая формула, с которой стоит начинать:
На фото страница печатного текста. Перепечатай её содержимое дословно,
сохраняя порядок абзацев и разбивку на строки заголовков.
Ничего не сокращай, не пересказывай и не исправляй стиль.
Если фрагмент не читается, поставь на его месте [нечитаемо]
и не подставляй свой вариант.
В конце отдельным списком перечисли все места, помеченные [нечитаемо],
и напиши, что именно мешает их прочитать.
Три вещи здесь важны. «Дословно» отсекает пересказ. Метка [нечитаемо] даёт вам карту дырок — без неё вы просто не узнаете, где текст настоящий, а где восстановленный. Финальный список нечитаемых мест — самая полезная часть ответа: по нему сразу видно, стоит ли переснимать страницу или проще дописать три слова руками.
Для распознавания годятся текстовые модели, принимающие изображение. Бесплатный чат ChatGPT в Most AI доступен без ограничения по количеству запросов, так что прогонять страницы по одной можно сколько угодно; на сложных сканах — рукописные пометки, плотная вёрстка, мелкая таблица — имеет смысл попробовать ту же страницу на Gemini или Claude и сравнить два ответа между собой. Расхождение двух моделей на одном и том же месте — надёжный признак, что там как раз дырка. Сколько стоит запрос к конкретной модели, всегда видно в актуальном прайсинге.
Наклон, тень и обрывы строк
Три типовые беды скана лечатся по-разному.
Наклон портит порядок чтения: модель может перепутать колонки или начать читать строку с середины. Если перекос небольшой, достаточно предупредить об этом в запросе — попросить читать колонки последовательно, левую целиком, потом правую. Если страница снята откровенно вкось, лучше потратить полминуты и выровнять её штатным кадрированием в галерее телефона: почти во всех редакторах есть поворот с сеткой.
Тень и затемнённый край дают самый коварный эффект. Текст в тени не исчезает полностью — он превращается в что-то смутно похожее на буквы, и модель охотно достраивает из этого осмысленную фразу. Именно в затенённых зонах чаще всего оказываются фразы, которых в оригинале нет. Если тень занимает край страницы, снимите этот край отдельным кадром и распознайте его вторым запросом.
Обрывы — когда строка обрезана краем кадра, заклеена или заляпана. Здесь модель как раз может помочь, но просить надо явно и отдельно, а не смешивая с распознаванием:
Вот распознанный текст страницы, в нём есть пропуски, помеченные [нечитаемо].
Не переписывай текст целиком. Для каждого пропуска предложи
2-3 варианта того, что там могло быть по смыслу и по грамматике,
и укажи, сколько примерно знаков помещается в пропуск.
Ясно помечай, что это предположение, а не прочитанный текст.
Разделение на два шага — распознали, потом отдельно восстанавливаем — принципиально. Когда обе задачи в одном запросе, восстановленное сливается с прочитанным в один ровный текст, и отличить одно от другого уже невозможно.
Почему едут таблицы и формулы
Тут никакой магии: таблица и формула держат смысл на расположении элементов в пространстве, а ответ модели — это линейная последовательность символов. Между этими двумя форматами всегда происходит перевод, и он теряет часть информации.
С таблицами типичные потери такие: объединённые ячейки разъезжаются по соседним строкам, пустая ячейка молча пропускается, и все значения справа от неё сдвигаются на один столбец влево, многоуровневая шапка схлопывается в одну строку. Отдельная беда — числа: разряды, разделённые пробелом, могут склеиться или разделиться не там.
Что помогает: просить выдать таблицу в явном построчном виде с разделителем, заранее сообщить количество столбцов и их названия, отдельно попросить не оставлять пустых мест — вместо пропуска ставить прочерк.
На фото таблица из 5 столбцов: Дата, Наименование, Количество, Цена, Сумма.
Перенеси её построчно, разделяя значения символом |.
Каждая строка — ровно 5 значений. Если ячейка пустая, поставь прочерк.
Числа переноси точно, разряды не склеивай и не добавляй.
Не считай итоги сам — перенеси то, что напечатано.
Последняя строка не лишняя. Если попросить «перенеси таблицу», модель может заодно пересчитать итоговую строку — и её арифметика не всегда совпадёт с тем, что стоит в документе.
С формулами всё ещё жёстче. Индексы и степени различаются только положением символа, а на скане они мелкие; дробная черта, скобки и границы интеграла легко теряются. Практическое правило: любая формула из скана проверяется человеком целиком, знак за знаком, потому что здесь ошибка в одном символе меняет смысл полностью, а выглядит абсолютно нормально. Просить модель заодно объяснить формулу словами — хороший приём проверки: если словесное описание не сходится с тем, что вы видите на бумаге, значит распознано неверно.
Вычитка — не опция
Это главное, что стоит унести из статьи. Распознанный текст нельзя пускать в работу непрочитанным. Не потому, что модели плохие, а потому, что устроены они иначе, чем сканер: сканер на нечитаемом месте оставит мусор, который сразу бросается в глаза, а модель на том же месте поставит гладкую осмысленную фразу. Ошибка распознавания у нейросети выглядит не как ошибка, а как нормальный текст — и в этом вся проблема.
Разумный минимум проверки такой. Сверьте начало и конец каждого абзаца с оригиналом — обрывы чаще всего случаются на границах. Проверьте все цифры, даты, фамилии, номера пунктов и единицы измерения: это то, что модель не может достроить по смыслу, и то, где ошибка дороже всего. Пробегите глазами места, помеченные [нечитаемо]. Отдельно посмотрите на подозрительно ровные куски: если в тексте, снятом с мятой страницы, вдруг идёт безупречно гладкий абзац без единой шероховатости, есть шанс, что он написан заново.
Полезный приём — попросить модель самой указать на слабые места:
Ты только что распознал эту страницу. Теперь перечитай свой ответ
и отметь фрагменты, в которых ты не уверен: где буквы читались плохо,
где ты достроил слово по контексту, где мог перепутать цифру.
Дай список таких мест с указанием строки. Сам текст не переписывай.
Ответ на такой запрос — не гарантия, но он обычно точно указывает на проблемные зоны, и вычитка становится прицельной: вместо перечитывания десяти страниц вы проверяете двадцать конкретных мест.
Что делать с текстом дальше
Как только страница стала текстом, с ней работает всё остальное. Конспект, выжимка, перевод, поиск нужного пункта — это уже обычные задачи текстовых моделей, и для документов посложнее есть отдельный разбор с готовыми формулировками в статье про промты для анализа документов.
Если конечная цель — слушать материал, а не читать, распознанный и вычитанный текст можно отдать голосовой модели. Это отдельная тема со своими тонкостями — ударения, сокращения, темп чтения, — и она подробно разобрана в материале о том, как сделать аудиокнигу из учебника для поездки. Важно только одно: озвучивать имеет смысл уже вычитанный текст, иначе диктор ровным голосом прочитает вам всё, что модель дописала за автора.
Частые вопросы
Сколько страниц можно распознать за один раз?
Практичнее всего — по одной странице на запрос. Когда в одно сообщение загружают пять фотографий, модель начинает экономить: сокращает середину, сливает абзацы, теряет строки на стыках. По одной странице дольше, но результат стабильнее, а нумерация не съезжает.
Модель распознаёт рукописный текст?
Разборчивый почерк — часто да, беглый конспект — как повезёт. Рукописное распознавание почти всегда требует более плотной вычитки: там, где печатная буква либо видна, либо нет, рукописная всегда допускает несколько прочтений, и модель выберет самое привычное. Имена собственные и числа в рукописи проверяйте поголовно.
Что делать, если модель отказалась распознавать страницу?
Чаще всего дело в качестве кадра — слишком мелко, слишком темно, слишком сильный наклон. Переснимите страницу при другом свете, обрежьте её до одного столбца текста или разбейте на два кадра. Помогает и смена модели: одна и та же страница на другой модели каталога нередко читается без возражений.
Стоит ли доверять распознанным цифрам в договоре или отчёте?
Нет, не проверив по оригиналу. Цифры — это ровно тот случай, где модель не может опереться на смысл и где ошибка не видна в тексте. Сумма, дата, номер пункта, процент — всё это сверяется с исходником вручную, независимо от того, насколько хорошо распознан остальной текст.
Можно ли попросить сразу перевести распознанный текст?
Можно, но лучше в два шага: сначала получить оригинальный текст, вычитать, потом переводить. При переводе в один заход вы теряете возможность проверить распознавание — сверять перевод с фотографией на чужом языке заметно сложнее, а ошибка чтения становится ошибкой смысла.
Нужна ли отдельная платная модель или хватит бесплатной?
Для обычных печатных страниц бесплатного чата ChatGPT в Most AI обычно достаточно, тем более что он без ограничения по количеству запросов. Более сильные модели имеют смысл на сложных случаях: плотные таблицы, формулы, мелкий шрифт, старая печать. Разумная тактика — начинать с бесплатного варианта и переходить к платному только там, где результат явно не устраивает.
Пройдите это по шагам в кабинете
Всё из инструкции — текст, картинки, видео и звук — в одном кабинете: одна регистрация, один баланс, одна история.



