TL;DR
Vision-модели не «понимают» фотографии как люди — они читают сетку визуальных улик.Поэтому промпт должен называть субъект, действие, видимый текст, чтобы навести внимание.А поскольку декодирование изображений сжигает на порядки больше вычислений, чем декодирование слов, каждое вложение стоит реальных денег — и платить стоит только когда изображение само является данными.
Аналогия
Представьте выдающегося учёного, который всю жизнь прожил с повязкой на глазах.
Он прочитал почти все книги на свете — медицину, право, историю искусств, химию — целиком через прикосновения и текст.Однажды повязку снимают.Глаза работают.Но одного не произошло:никто не подарил ему визуального опыта целой жизни.Нет ни чутья на то, что важно в сцене, ни рефлекса «все сначала смотрят на лицо».Зрячий, он — гений, который не знает, куда смотреть.
Поэтому, показав ему фото кухни и спросив «как впечатление?», вы получите прилежное изучение всего.Крана.Окна.Пятна на третьей плитке.У него есть знания, чтобы интерпретировать что угодно, но нет человеческого чувства заметности — и он распределяет гениальность по сцене равномерно.Ответ вернётся исчерпывающе наблюдательным и совершенно расфокусированным.
Ваши слова — это палец, указывающий на важное. «Наклейка на дне сковороды — что написано про покрытие?»— и внезапно самое образованное в мире зрение прилипает именно к тому, что было нужно.
И одна строка из прайса:**держать эту повязку поднятой — дорого.**Чтение изображения требует от учёного в сотню раз больше усилий, чем чтение предложения.Поэтому за каждую минуту разглядывания начисляется премия — и платите вы, независимо от того, является фотография уликой или украшением.
Как это работает и стоимость (Uzu)
Приложив изображение, модель нарезает его на сетку патчей и конвертирует каждый в ту же валюту, что и слова:токены.Одна фотография легко весит сотни токенов ещё до того, как ваш вопрос прочитан — и, как всё остальное в диалоге, пребывает в контекстном окне, столе, который модель перечитывает перед каждым ответом.Изображение не просто стоит тысячи слов — оно занимает тысячу слов на столе.
Поэтому у визуального промпта своя анатомия — три слота, наводящих внимание модели:
| Слот | На какой вопрос отвечает | Пример |
|---|---|---|
| Субъект | О каком предмете на изображении речь? | «предупреждающая наклейка на зарядном устройстве» |
| Действие | Что происходит или нужно сделать? | «переведи» / «есть повреждения?» |
| Текст | Какие видимые буквы важны? | «прочитай серийный номер, начинающийся с SN» |
Названный субъект останавливает усреднение внимания по всей сетке.Данное действие — перевод, идентификация, сравнение, оценка — превращает промпт в промпт одного запроса с глазами.Указанный видимый текст задействует острейший навык vision-моделей:современные модели читают текст в изображениях лучше почти всего остального.
И счёт.Чтение сотен токенов изображения требует реального времени GPU.Поэтому Uzu списывает фиксированные 10 G-Credits за вложение в момент нажатия «отправить».Это не плата за хранение — это стоимость электричества и вычислений, которые модель тратит на разглядывание.Запечённый в цену урок дизайна:**прикладывайте изображение, только когда изображение — это данные.**Фото окна ошибки — данные.Скриншот абзаца, который можно было вставить текстом, — украшение с налогом:тот же ответ прибыл бы по цене обычных слов.И как в ограничении охвата, одно острое визуальное вопрос на вложение побеждает пять расплывчатых:перед отправкой ограничьте субъект, действие и формат вывода.
Рабочее правило:
**Изображение стоит тысячи токенов.**Заставьте модель тратить токены туда, куда направлено ваше внимание — и платите только за пиксели, несущие информацию.
До и после (промпты)
Пример 1 — неопознанный объект
[фото переполненного ящика] Что это?
Модель прилежно составляет опись:кабели, монеты, батарейки, «что-то вроде маленького пульта».Где-то в списке — нужный вам предмет.Наверное.
[то же фото] Определи небольшое чёрное устройство слева вверху, рядом с батарейками. Дай вероятный бренд и назначение в 2 предложениях.
Субъект (чёрное устройство, левый верх), действие (определи бренд и назначение), формат (2 предложения).То же фото — хирургический ответ.
Пример 2 — документ
[фото документа] Посмотришь?
«Посмотришь» — не задача.Если только вам не нужно то самое поле, которое решает всё, модель обобщит документ.
[то же фото] Прочитай и точно перепиши только поле «дата вступления в силу» из рамки в правом верхнем углу этой страницы договора. Неразборчиво — напиши «неразборчиво», дату не выдумывай.
Вершина прокачки текстового слота:одно поле, точная транскрипция и явная защита от выдумки — потому что модель, без швов заполняющая пробелы, — ровно неправильный инструмент для юридической даты.
Пример 3 — ловушка украшения
[скриншот статьи, вложение] Резюмируй это.
Вы только что заплатили цену изображения за текст.Модель читает слова, нарисованные пикселями, — медленнее, дороже и ошибочнее, чем при вставке самих слов.
[без изображения] Резюмируй эту статью в 3 пунктах:[вставленный текст]
Тот же ответ, крошечная доля вычислений и ноль платы за вложение.Скриншот никогда не был данными — он был контейнером для данных.Одна эта привычка — текст вставляй, пиксели прикладывай — крупнейшая экономия визуального промптинга.
Частые ловушки
- **Ждать, что AI «прочувствует» изображение, а не прочитает его.**Vision-модель не переживает ваш закат — она составляет опись улик в сетке.Спросите «какие эмоции это вызывает?» — и получите уверенное клише:тёплые тона, улыбающиеся лица — а не пережитую реакцию.Спрашивайте, что на изображении, а не каково на него смотреть.
- **Прикладывать украшения.**Скриншоты текста, логотипы «для контекста», фото, дублирующее уже напечатанное.Если информация уже была словами, каждое вложение — двойная оплата премиальных вычислений.Прикладывайте только то, что может нести лишь изображение.
- **Расплывчатые указания — «это», «то», «вон та часть».*В текстовом чате «то» указывает на последнее сообщение.На изображении «то» указывает на всё.Используйте существительные и позиции:левый диск,вторая строка чека,*нижний красный кабель.
- **Опускать защиту от выдумки в критичных чтениях.**Серийные номера, даты, ёмкости, цены:под неопределённостью vision-модель сглаживает пробелы так же, как любая другая.Добавьте «перепиши точно; если неразборчиво — скажи об этом» — трюк аренды честности из урока о галлюцинациях, на этот раз с глазами.
- Одно изображение, пять вопросов, одно сообщение.«Что это, сколько стоит, откуда, подлинник ли, и напиши текст для продажи» — размывает внимание в пять раз по всей сетке.Одно вложение — один острый вопрос, потом уточнения.Изображение остаётся на столе, а уточнения едут уже оплаченными токенами.
FAQ
Как делать промпты с изображениями для AI?
Назовите субъект, действие и видимый текст, ограничьте вывод:«Определи [конкретный предмет] в [позиция на изображении], [сделай это], ответь [формат]».Направляйте внимание модели, как направили бы взгляд коллеги — на наклейку, а не на всю кухню.
Почему отправка изображения в AI стоит дороже?
Потому что модель должна сначала конвертировать изображение в сотни токенов визуальных улик, прежде чем обработать вопрос — это в разы больше вычислений, чем эквивалентное предложение.В Uzu эта премия — фиксированные 10 G-Credits за файл:честная цена времени разглядывания на GPU.Текст дёшев; пиксели — работа.
Может ли AI читать текст на изображениях?
Может — и это один из сильнейших навыков vision-моделей:от рукописного ввода до дорожных знаков, от форм до скриншотов.Проблема — точность под неопределённостью:для критичного (даты, серийные номера, ёмкости) не позволяйте модели заполнять пробелы — требуйте точную транскрипцию и явное «неразборчиво, если нечитаемо».
Следующий урок
Заметьте нить через весь урок:вы указывали.Вы выбирали субъект, наводили внимание, поставляли ограничения.Но есть ход, переворачивающий весь диалог — что если AI сначала спросит вас?Один дешёвый раунд, где машина интервьюирует вас, заменяет три дорогих раунда, где вы переобъясняете.
Следующий урок: Техника «Сначала спроси»
Упражнение перед уходом:найдите последнее фото, отправленное AI, и переспросите его трижды — расплывчато, средне и хирургически (субъект + действие + текст + формат).Посмотрите, как ответ становится острым, и заметьте, сколько реально стоила расплывчатая версия.