Словарь новичка: промпт, референс и другие термины нейросетей
Маша Семёнова9 мин
Когда открываешь сервис с десятками нейросетей впервые, обычно спотыкаешься не на кнопках интерфейса, а на словах. Что такое промпт и чем он отличается от обычного запроса в поисковике? Зачем модели просят «референс», если можно просто описать словами? Что значит «дообучение» и надо ли его вообще делать новичку? Эти термины кочуют из статьи в статью, но объясняют их редко и обычно сразу сложными формулировками. Собрали короткий и честный словарь: без академических определений, но с примерами, которые сразу применимы к работе в Most AI.
Промпт — то, что вы пишете нейросети
Промпт — это текстовый запрос, которым вы объясняете нейросети, что от неё нужно. Слово того же корня, что английское «prompt» — подсказка, побуждение к действию. По сути, промпт заменяет собой и техническое задание, и уточняющие вопросы, которые в обычной работе вы задали бы человеку.
Разница между хорошим и слабым промптом — это разница между «нарисуй кота» и «рыжий кот сидит на подоконнике, за окном дождь, мягкий вечерний свет, фотореалистичный стиль». Первый вариант оставляет нейросети слишком много свободы, и результат окажется случайным. Второй задаёт конкретные параметры: объект, окружение, освещение, стиль — и итоговая картинка будет гораздо ближе к тому, что вы представляли.
Промпт нужен и для текста, и для изображений, и для видео, и для голоса — просто в каждом случае он описывает разные вещи. В текстовых моделях промпт — это формулировка задачи и контекст («напиши письмо клиенту с извинением за задержку доставки, тон деловой, без эмодзи»). В генераторах изображений — это описание сцены, стиля и деталей кадра. Готовые формулы для конкретных задач удобно смотреть в статьях с примерами: например, разбор промптов для портретов или промптов для видео — их легко адаптировать под свою задачу, меняя детали.
Отдельно стоит запомнить негативный промпт — список того, что нужно исключить из результата: лишние пальцы на руках, водяные знаки, размытость. Не все модели поддерживают этот параметр отдельным полем, но саму идею можно встроить и в обычный промпт: «без текста на изображении», «без бликов на очках».
Референс — образец, на который нейросеть равняется
Референс — это изображение (реже видео или аудио), которое вы даёте нейросети как пример или отправную точку. Слово пришло из дизайна и иллюстрации, где референсами издавна называли картинки для вдохновения или образец стиля, который нужно повторить.
В работе с нейросетями референс решает задачу, которую словами описать почти невозможно. Можно час подбирать слова для «того самого оттенка бирюзового» или просто приложить картинку с нужным цветом. Можно долго объяснять композицию кадра — а можно скинуть фото с похожим ракурсом и попросить модель ориентироваться на него.
Референсы используют по-разному: как основу для стилизации (взять ваше фото и перерисовать в другом стиле), как источник лица для сохранения похожести (актуально при создании аватарок или деловых портретов), как пример цветовой палитры или композиции. Например, при создании аватарки обычно нужен референс лица — своя фотография, — а дальше промпт описывает уже стиль и настроение. Подробнее это разобрано в статье о том, как сделать аватарку нейросетью.
Важно понимать границу: референс — это не копирование один в один. Модель ориентируется на образец, но не гарантирует пиксель-в-пиксель повторение — итоговый результат зависит и от референса, и от промпта, и от самой модели.
Дообучение — как модель настраивают под конкретную задачу
Дообучение (в английских материалах — fine-tuning) — процесс, при котором уже готовую модель дополнительно тренируют на новых, более узких данных, чтобы она лучше справлялась с конкретной задачей. Базовую модель обучают на огромном массиве общих данных, а дообучение сужает её «специализацию».
Для новичка эта тема скорее фоновая: дообучением на уровне пользователя обычно никто не занимается, это делают разработчики моделей или крупные команды, у которых есть свои датасеты и вычислительные мощности. Но термин полезно понимать, потому что он объясняет, почему разные модели одного поколения ведут себя по-разному. Например, одна текстовая модель может лучше писать код, а другая — художественные тексты, хотя обе относятся к одному семейству: разница часто как раз в том, на каких данных и как их дополнительно настраивали.
Не путайте дообучение с настройкой параметров запроса — выбором модели, стиля или температуры генерации. Это разные уровни: дообучение меняет саму модель «внутри», а настройки запроса лишь влияют на обработку конкретного промпта.
Токен и контекстное окно — из чего «состоит» текст для нейросети
Токен — это единица, на которую текстовая модель разбивает текст перед обработкой. Токен не равен одному слову: короткие слова часто укладываются в один токен, длинные или редкие делятся на несколько частей. Грубый ориентир — один токен в среднем соответствует примерно четырём символам для английского текста и чуть меньше для русского, но это именно ориентир, а не точное правило.
Контекстное окно — это максимальный объём текста (в токенах), который модель может «удержать в голове» одновременно: и вашу переписку, и загруженные файлы, и собственный ответ. Если беседа становится очень длинной, самые старые сообщения могут выпадать из контекста, и модель перестаёт их «помнить» — это не забывчивость в человеческом смысле, а технический предел окна.
Для практики это значит: если нужен длинный связный документ или разбор большого файла, стоит выбирать модель с запасом по контексту и по возможности давать самую важную информацию ближе к текущему сообщению, а не в самом начале длинного диалога.
Галлюцинация — когда нейросеть уверенно ошибается
Галлюцинация — это ситуация, когда нейросеть выдаёт неверную информацию, но формулирует её так же уверенно, как и правду. Модель не «врёт» в человеческом смысле — у неё нет намерения обмануть, — она достраивает наиболее вероятный, по её внутренней логике, ответ, даже если для этого не хватает точных данных.
Чаще всего галлюцинации встречаются там, где нужны точные факты: даты, цифры, цитаты, ссылки на источники, редкие имена. Поэтому для учебных и рабочих задач, где важна фактическая точность, стоит перепроверять конкретные цифры и ссылки, особенно если модель ссылается на источник, который сложно быстро найти самостоятельно. Хорошая практика — просить модель указывать степень уверенности или явно писать «не уверен», а не полагаться на уверенный тон ответа как на признак правильности.
Мультимодальность — когда одна модель понимает разные форматы
Мультимодальная модель — это модель, которая работает не с одним типом данных, а сразу с несколькими: например, принимает на входе и текст, и изображение, а на выходе может выдать текст, картинку или их комбинацию. Раньше отдельная модель писала тексты, отдельная — распознавала изображения, отдельная — генерировала картинки. Сейчас границы всё чаще стираются: можно загрузить фото и попросить модель описать, что на нём, или, наоборот, из текстового описания получить изображение.
Это напрямую касается работы в каталоге: часть моделей ориентирована строго на один формат (например, только на генерацию изображений), а часть можно использовать шире — для анализа загруженного файла, объяснения содержимого картинки или комбинированных задач. Перед выбором модели полезно свериться с её описанием на странице каталога, чтобы понять, какие форматы на входе и выходе она поддерживает.
Апскейл, разрешение и сиды — термины из мира изображений и видео
Апскейл (upscale) — увеличение разрешения готового изображения без потери резкости за счёт «дорисовывания» деталей нейросетью, а не простого растягивания пикселей. Обычная функция для тех, кому нужна картинка не только для экрана, но и для печати или крупного баннера.
Сид (seed) — число, которое определяет «случайность» генерации. При одном и том же промпте и одном и том же сиде многие модели изображений выдадут очень похожий или идентичный результат; при другом сиде — новый вариант. Фиксация сида полезна, когда нужно чуть подправить деталь, сохранив всю остальную композицию.
Инференс — сам процесс генерации ответа моделью: то, что происходит между отправкой запроса и получением результата. Термин технический, на практике пользователю он попадается редко, но иногда встречается в описаниях моделей или тарифов — обычно в контексте того, сколько вычислений требует конкретный запрос.
Кредит — как считается стоимость запроса
Это термин уже не про нейросети в целом, а конкретно про то, как устроена оплата в сервисах вроде Most AI. Разные модели стоят по-разному: генерация видео требует больше вычислений, чем короткий текстовый ответ, поэтому справедливее не выставлять единую цену за «один запрос», а списывать с баланса кредиты — их количество зависит от конкретной модели и типа задачи. Пополнили баланс один раз — и дальше свободно пользуетесь и текстовыми моделями, и генераторами изображений, и видео, и голосом, без отдельной подписки на каждый сервис. Актуальные цены в кредитах и рублях удобно смотреть на странице тарифов.
Как использовать этот словарь на практике
Не обязательно запоминать все термины сразу — они пригодятся по мере того, как вы начнёте пробовать разные типы задач. Проще всего закрепить понимание на практике: открыть студию Most AI, написать простой промпт, посмотреть на результат, затем уточнить формулировку или добавить референс и сравнить, как изменился результат. Такой цикл «промпт → результат → правка промпта» — самый быстрый способ перейти от теории к рабочим навыкам, и уже после двух-трёх таких попыток термины перестают быть абстракцией.
Частые вопросы
Чем промпт отличается от обычного поискового запроса?
Поисковый запрос ищет уже существующую информацию в интернете, а промпт — это инструкция для генерации нового результата: текста, изображения, видео или голоса. Чем подробнее и конкретнее промпт, тем предсказуемее результат, тогда как для поиска, наоборот, обычно достаточно нескольких ключевых слов.
Обязательно ли использовать референс, чтобы получить хороший результат?
Нет, референс не обязателен — многие задачи прекрасно решаются одним текстовым промптом. Референс нужен там, где важно сохранить конкретные детали: лицо, точный оттенок цвета, композицию кадра, — которые сложно точно описать словами.
Можно ли самому дообучить модель под свои задачи?
На уровне обычного пользователя сервисов вроде Most AI дообучение недоступно и обычно не требуется — вместо этого нужный результат достигается точным промптом, подходящим референсом и правильным выбором модели из каталога. Дообучением занимаются разработчики моделей на этапе их создания.
Почему нейросеть иногда придумывает несуществующие факты?
Это и есть галлюцинация: модель формулирует наиболее вероятный, по её внутренней логике, ответ даже тогда, когда точных данных недостаточно, и делает это уверенным тоном. Поэтому конкретные цифры, даты и ссылки на источники в важных задачах стоит перепроверять отдельно.
Что делать, если не понимаю, какой термин означает конкретный параметр в настройках модели?
Большинство параметров в интерфейсе сопровождаются коротким пояснением при наведении или в описании модели в каталоге. Если термина нет в этом словаре, попробуйте начать с самого простого промпта без дополнительных настроек — базовые параметры по умолчанию у большинства моделей подобраны разумно, а точную настройку можно добавлять постепенно.
Нужно ли знать все термины, чтобы начать пользоваться нейросетями?
Нет. Для старта достаточно понимать промпт и референс — этого хватит для большинства задач с текстом и изображениями. Остальные термины из этого словаря скорее помогают разобраться, почему результат получился таким, а не другим, и пригодятся по мере того, как задачи станут сложнее.
