most-AI.com

Что на фото: как нейросеть распознаёт растения и этикетки

Маша Семёнова9 мин

Самый частый способ применения нейросети дома — даже не генерация чего-либо, а простой вопрос «что это такое». Незнакомое растение у соседей на клумбе, состав на банке мелким шрифтом, деталь из коробки со старым хламом, вывеска на языке, которого вы не знаете. Раньше это решалось поисковиком по описанию словами, и получалось плохо: попробуйте загуглить «зелёное с зубчиками по краю и красными прожилками». Сейчас достаточно сфотографировать и спросить.

Работает это неплохо, но с важной оговоркой, ради которой стоит дочитать до середины: у распознавания по фото есть чёткая граница, за которой ответу нейросети верить нельзя вообще. Разберём сначала сценарии, где всё нормально, а потом — где нет.

Что на самом деле происходит, когда вы загружаете фото

Полезно понимать механику, потому что из неё вытекают все ограничения. Модель не сверяет ваш снимок с базой эталонов и не «узнаёт» конкретный объект. Она описывает то, что видит, и выдаёт наиболее вероятное объяснение — версию, которая лучше всего согласуется с формой, цветом, текстурой, контекстом кадра и всем, что модель усвоила на этапе обучения.

Отсюда два практических следствия. Первое: модель почти никогда не отвечает «не знаю». Ей проще выдать правдоподобный вариант, чем признать нехватку данных, и звучать он будет так же уверенно, как верный ответ. Второе: качество ответа очень сильно зависит от кадра. Размытая фотография листа издалека даёт модели меньше опор, а меньше опор — больше догадки в ответе. Подробнее про природу таких ошибок и способы их ловить есть отдельный разбор — почему нейросеть ошибается и как это проверять.

Технически для распознавания по фото используют не генераторы картинок, а текстовые модели, которые умеют принимать изображение вместе с вопросом. В каталоге Most AI это, например, бесплатный чат ChatGPT, а также Gemini и Claude — вы прикладываете снимок и пишете вопрос обычными словами.

Растение: что растёт на подоконнике и в саду

Самый безобидный и самый частый сценарий. Досталось растение от прежних хозяев квартиры, подарили безымянный горшок, во дворе вылезло что-то незнакомое — хочется понять название, чтобы разобраться с поливом и светом.

Здесь нейросеть работает достойно, особенно с распространёнными комнатными и садовыми видами. Но ответ заметно улучшается, если снимок даёт модели больше признаков. Снимайте при дневном свете, крупно и в фокусе; сделайте кадр листа целиком, включая край и то, как лист крепится к стеблю; если есть цветок или плод — обязательно отдельным кадром, это самый сильный признак. Полезно добавить кадр всего растения целиком: размер и форма куста отсекают половину неверных версий.

Формула запроса, которая даёт более осторожный и полезный ответ:

На фото комнатное растение. Предположи, что это может быть.
Дай 2-3 наиболее вероятных варианта, а не один.
Для каждого напиши, по каким признакам на фото ты так решаешь
и какой признак нужно проверить, чтобы отличить варианты между собой.
Отдельно укажи, чего на фото не видно и что мешает ответить точнее.

Просьба дать несколько вариантов вместо одного — главный приём во всём распознавании по фото. Она переводит модель из режима «уверенно назову» в режим «перечислю возможное», а вы получаете список, который можно проверить самостоятельно. Просьба назвать признаки полезна не меньше: если модель пишет «опушённые листья», а у вашего растения листья гладкие, версия отпадает сразу, и это видно без всякой ботаники.

Состав на этикетке: прочитать и объяснить

Второй массовый сценарий — этикетка. Мелкий шрифт на банке крема, состав корма, таблица пищевой ценности, значки на бирке одежды. Задача обычно двойная: сначала прочитать нечитаемое, потом объяснить прочитанное человеческим языком.

С чтением текста с фотографии модели справляются хорошо, если снимок резкий и не под острым углом. Кладите упаковку на ровную поверхность, снимайте сверху, а не сбоку, при хорошем свете и без бликов от вспышки — блик на глянцевой этикетке съедает целую строку. Если состав идёт по кругу банки, снимите его в несколько кадров с перекрытием.

На фото этикетка. Сначала выпиши состав как есть, построчно,
ничего не добавляя от себя. Если какое-то слово не читается,
отметь его как нечитаемое, а не угадывай.
Затем объясни простыми словами, что означает каждый пункт
и для чего он в составе. Отдельно отметь, чего в составе неожиданно много.

Ключевая часть здесь — «не угадывай». Без этой оговорки модель может «дочитать» смазанное слово по контексту, и вы даже не узнаете, что часть текста восстановлена по догадке. Отдельно попросив пометить нечитаемое, вы получаете честную карту того, что реально видно на фото.

Осторожно с обратной задачей. «Подходит ли мне этот состав», «не аллергично ли это для ребёнка», «безопасна ли эта добавка» — вопросы, на которые модель ответит охотно, но такой ответ уже не про чтение этикетки, а про здоровье. Об этом ниже отдельно.

Незнакомая деталь: что это и как называется

Сценарий, где нейросеть выигрывает у поисковика с огромным отрывом, потому что проблема ровно в том, что вы не знаете слова для поиска. Странный крепёж из коробки с мебельной фурнитурой, разъём на старой технике, ключ непонятного стандарта, отвалившаяся пластиковая деталь от чего-то.

Здесь критичен масштаб: положите рядом монету, линейку или хотя бы палец. Без опорного объекта модель не поймёт, перед ней двухсантиметровый винт или двадцатисантиметровый болт, а от этого зависит вся версия. Второй важный момент — контекст. Напишите, откуда деталь: «нашёл в коробке от кухонного гарнитура», «отвалилось от стиральной машины», «лежало в ящике с автоинструментом». Контекст сужает поле вариантов сильнее, чем любой дополнительный ракурс.

На фото деталь, рядом монета для масштаба.
Нашёл её [откуда именно]. Предположи, что это и как называется
профессионально, чтобы я мог найти такую же в магазине.
Дай несколько вариантов с названиями и объясни, чем они отличаются.
Напиши, какие размеры мне нужно измерить, чтобы выбрать точно.

Обратите внимание на последнюю строку: часто самое ценное в ответе — не название, а список того, что надо померить перед покупкой. Это то, что легко проверяется штангенциркулем или линейкой и не зависит от того, угадала модель или нет.

Надпись на иностранном языке

Вывеска, меню, инструкция к технике, состав на упаковке из зарубежного магазина. Задача снова двойная — распознать символы и перевести. С языками на латинице модели работают уверенно, с иероглифами и арабской вязью сложнее, но обычно тоже читаемо, если снимок резкий.

Полезный приём — просить не только перевод, но и исходный текст. Тогда видно, что именно модель прочитала, и можно перепроверить сомнительный кусок отдельно. И обязательно указывайте контекст: «это меню в кафе», «это кнопки на стиральной машине», «это инструкция к обогревателю» — одно и то же слово переводится по-разному в зависимости от того, где оно написано. Если переводов много и они регулярные, посмотрите отдельный разбор про то, как переводить текст нейросетью — там про работу с длинными текстами и стилем.

Где распознавание по фото заканчивается

Теперь главное. Есть категория вопросов, где нейросети по фотографии верить нельзя — не «желательно перепроверить», а именно нельзя опираться на ответ при принятии решения.

Грибы. Никогда. Съедобный и смертельно ядовитый гриб бывают внешне похожи настолько, что различаются деталями, которых на фотографии в принципе не видно: цветом среза, запахом, наличием кольца или вольвы под землёй, оттенком пластинок. Модель выдаст уверенный ответ и на плохом снимке тоже — а цена ошибки здесь необратимая. Определением грибов занимаются люди с опытом и с грибом в руках, а не программа по фото.

Дикие ягоды и незнакомые растения, которые вы собираетесь съесть. Та же логика. Отдельно: не проверяйте по фото и безопасность растения для ребёнка или животного — если есть подозрение на отравление, это вопрос к врачу или ветеринару, а не к чату.

Лекарства. Не спрашивайте по фото таблетки «что это за препарат», чтобы принять его. Таблетки без упаковки бывают неразличимо похожи, а ошибка означает неверное действующее вещество или неверную дозу. Название препарата определяется по упаковке, маркировке и через аптеку или врача.

Всё, что касается здоровья. Родинки, сыпь, отёки, глаза, зубы, любые изменения на коже. Фотография не заменяет осмотр, а уверенный ответ модели опасен именно тем, что успокаивает и откладывает визит к врачу.

Общий признак этой зоны прост: если по ответу вы собираетесь что-то съесть, выпить или не пойти к врачу — ответ нейросети в решении не участвует. Во всех остальных бытовых случаях он экономит время и обычно оказывается полезным.

Как повысить шанс на верный ответ

Несколько правил, которые работают во всех сценариях сразу. Снимайте резко, крупно и при дневном свете — это влияет на ответ сильнее, чем выбор модели. Давайте несколько ракурсов, если объект сложный. Кладите рядом предмет для масштаба. Пишите контекст: откуда взялось, где растёт, где куплено, что рядом.

В самом запросе просите варианты вместо одного ответа, просите назвать признаки, по которым модель решила, и просите отдельно указать, чего на фото не хватает для точности. И проверяйте результат независимо: получив название, посмотрите картинки по этому названию и сравните со своим объектом сами. Это тридцать секунд, и они превращают догадку модели в проверенный факт.

Чем пользоваться и сколько это стоит

Для большинства бытовых вопросов достаточно бесплатного чата ChatGPT в Most AI — он без ограничения по количеству запросов и работает без VPN. Если ответ показался поверхностным, тот же снимок с тем же вопросом можно отдать другой модели — Gemini или Claude — и сравнить версии между собой: расхождение в ответах само по себе полезный сигнал, что объект сложный и стоит перепроверить руками. Платные модели тарифицируются в рублях по факту использования, без месячной подписки; актуальные цифры смотрите в прайсинге.

Частые вопросы

Какая модель лучше распознаёт по фотографии?

Универсального лидера нет: на одних объектах точнее одна модель, на других другая. Практичнее начать с бесплатного чата ChatGPT, а при сомнениях показать тот же снимок второй модели и сравнить ответы. Совпали — версия скорее верная, разошлись — нужна независимая проверка.

Почему нейросеть отвечает уверенно, даже когда ошибается?

Потому что она не сверяет фото с базой эталонов, а строит наиболее правдоподобное объяснение увиденного. Формулировка «скорее всего это X» для неё естественнее, чем «данных не хватает». Уверенный тон ответа не связан с его правильностью, и ориентироваться на него нельзя.

Можно ли определить гриб или ягоду по фото?

Нет, и это не преувеличение. Ядовитые виды бывают внешне почти неотличимы от съедобных, а решающие признаки — срез, запах, основание ножки — на фотографии не видны. Модель всё равно выдаст ответ, но опираться на него при решении «съесть или нет» нельзя.

Что делать, если модель не может прочитать мелкий шрифт на этикетке?

Переснимите: сверху, а не под углом, при рассеянном свете без вспышки, упаковку положите на ровную поверхность. Длинный состав разбейте на несколько кадров с перекрытием. И в запросе попросите пометить нечитаемые слова, а не угадывать их по смыслу.

Нужен ли VPN и подписка для таких вопросов?

Нет. В Most AI модели доступны без VPN и без иностранной карты, бесплатный чат ChatGPT не ограничен по числу запросов. Платные модели оплачиваются в рублях по факту использования, без обязательной месячной подписки.

Как быстро проверить ответ самому?

Возьмите название из ответа и посмотрите изображения по этому запросу, сравнив их со своим объектом. Дополнительно попросите модель назвать один-два отличительных признака, которые можно увидеть вживую, и проверьте именно их. Если признаки не сходятся, версия неверная.

Ещё больше готовых образов

В «Трендах» — сотни готовых фотосессий. Выберите образ, приложите своё фото и получите кадр за пару секунд, без промта.

Открыть ТрендыПервые генерации — бесплатно
Пример готового образа из «Трендов» most-AI

Маша Семёнова

Автор для тех, кто только начинает

Пишет о нейросетях так, чтобы можно было повторить с первого раза. Проверяет каждый шаг руками и не пропускает те места, где обычно застревают.