TL;DR
Un modelo de visión no "entiende" tu foto como una persona — la lee como una cuadrícula de evidencia visual, así que tu prompt debe nombrar el sujeto, la acción y cualquier texto visible para apuntar su atención. Y como decodificar una imagen consume muchísimo más cómputo que decodificar palabras, cada adjunto tiene un costo real que solo debes gastar cuando la imagen misma es el dato.
La Analogía
Imagina a un académico brillante que ha pasado toda su vida con los ojos vendados.
Ha leído todo libro jamás escrito — medicina, derecho, historia del arte, química — enteramente a través del tacto y del texto. Entonces, un día, la venda sale. Los ojos funcionan. Pero esto no ocurrió: nadie le entregó una vida de experiencia visual. No tiene instinto para qué importa en una escena, ningún reflejo que diga "todos miran primero la cara". Con los ojos abiertos, es un genio sin idea de dónde mirar.
Así que cuando le muestras una foto de tu cocina y dices "¿impresiones?" — entra en pánico y estudia todo. El grifo. La ventana. Una mancha en el tercer azulejo. El académico tiene el conocimiento para interpretar cualquiera de esas cosas, pero sin el sentido humano de lo que destaca, distribuye su genio uniformemente por toda la escena. La respuesta que recibes es exhaustivamente observadora y completamente desenfocada.
Tus palabras son el dedo que señala lo que importa. "La etiqueta del fondo de la sartén — ¿qué dice sobre el recubrimiento?" — y de repente los ojos más educados del mundo se fijan exactamente en lo que necesitabas.
Un detalle más, que explica la etiqueta de precio: mantener esa venda fuera es caro. Leer una imagen le cuesta al académico cien veces el esfuerzo de leer una frase. Así que cada minuto de mirada con ojos abiertos se factura a precio premium — y lo pagas tanto si la foto era evidencia como si era decoración.
Cómo Funciona y el Costo (Uzu)
Cuando adjuntas una imagen, el modelo la corta en una cuadrícula de parches y convierte cada parche en la misma moneda que usa para las palabras: tokens. Una foto puede costar fácilmente cientos de tokens antes de que tu pregunta sea leída — y, como todo en la conversación, permanece en la ventana de contexto, el escritorio que el modelo relee antes de cada respuesta. Una imagen no solo vale mil palabras; en ese escritorio, las ocupa.
Es por eso que el prompting visual tiene su propia anatomía — tres espacios que apuntan la atención del modelo:
| Espacio | La pregunta que responde | Ejemplo |
|---|---|---|
| Sujeto | ¿De qué cosa de la imagen se trata? | "la etiqueta de advertencia del cargador" |
| Acción | ¿Qué está pasando, o qué debe hacerse con ello? | "tradúcela" / "¿está dañado?" |
| Texto | ¿Qué palabras visibles importan? | "lee el número de serie que empieza con SN" |
Nombra el sujeto y frenas al modelo de promediar su atención sobre toda la cuadrícula. Da la acción — traducir, identificar, comparar, estimar — y se convierte en un prompt one-shot con ojos. Señala el texto visible y explotas la habilidad más afilada de un modelo de visión: los modelos modernos leen texto dentro de las imágenes mejor que casi cualquier otra cosa que hacen.
Luego llega la cuenta. Leer esos cientos de tokens de imagen requiere tiempo real de GPU, y por eso Uzu cobra una tarifa fija de 10 G-Credits por archivo adjunto, tarifeada en el momento en que presionas enviar. No es una cuota de almacenamiento — es el costo de la electricidad y el cómputo que el modelo gasta mirando. La lección de diseño integrada en ese precio: adjunta la imagen solo cuando la imagen es el dato. Una foto del diálogo de error es un dato. Una captura de pantalla de un párrafo que podrías haber pegado como texto es decoración con impuesto — la misma respuesta, entregada al precio de palabras simples. Y según el limiting scope, una pregunta visual ajustada por adjunto vale más que cinco vagas: restringe el sujeto, la acción y el formato de salida antes de enviar.
La regla de trabajo:
Una imagen vale mil tokens. Asegúrate de que el modelo los gaste donde tú gastarías tu propia atención — y paga solo por píxeles que llevan información.
Antes y Después (Los Prompts)
Ejemplo 1 — el objeto misterioso
[foto de un cajón desordenado] ¿qué es esto?
El modelo inventaría fielmente el cajón: cables, monedas, una batería, "posiblemente un control remoto pequeño". En algún lugar de esa lista está lo que querías decir. Probablemente.
[misma foto] Identifica el pequeño dispositivo negro en la esquina superior izquierda, junto a las pilas. Dime su probable marca y para qué sirve, en 2 frases.
Sujeto (el dispositivo negro, esquina superior izquierda), acción (identificar marca y función), formato (2 frases). Misma foto, respuesta quirúrgica.
Ejemplo 2 — el documento
[foto de un formulario] ¿Puedes ver esto?
"Ver" no es una tarea. El modelo resume el papel genéricamente — lo cual está bien, salvo que necesitabas el único campo que lo decide todo.
[misma foto] Lee solo el campo "Fecha de Vigencia" en el recuadro de la esquina superior derecha de esta página de contrato y transcríbelo exactamente. Si es ilegible, di "ilegible" — no inventes una fecha.
Prompting de espacio de texto en su máxima nitidez: un campo, transcripción exacta y una guarda explícita contra suposiciones — porque un modelo que rellena huecos sin costuras es exactamente la herramienta equivocada para fechas legales no verificadas.
Ejemplo 3 — la trampa de la decoración
[captura de un artículo, adjunta] Resume esto.
Acabas de pagar precios de imagen por texto. El modelo lee píxeles que deletrean palabras — más lento, más caro y más propenso a errores que si hubieras pegado las palabras mismas.
[sin imagen] Resume este artículo en 3 viñetas: [texto pegado]
Respuesta idéntica, una fracción del cómputo, cero cargo por adjunto. La captura nunca fue un dato — era un contenedor de datos. Este único hábito — pega cuando es texto, adjunta cuando son píxeles — es el mayor ahorro del prompting visual.
Errores Comunes
- Esperar que la IA "sienta" la imagen en lugar de leerla. Un modelo de visión no experimenta tu foto del atardecer; cataloga evidencia de una cuadrícula. Pregunta "¿qué emociones evoca?" y recibirás una descripción confiada de convenciones — tonos cálidos, rostros sonrientes — no una reacción sentida. Pregunta qué hay en la imagen, no cómo es verla.
- Adjuntar decoración. Capturas de texto, logotipos "para contexto", fotos que repiten lo que ya escribiste. Cada adjunto es cómputo premium gastado dos veces si la información ya estaba en palabras. Adjunta solo lo que solo la imagen puede portar.
- Referencias vagas — "esto", "eso", "esa parte". En el chat de texto, "eso" apunta al último mensaje. En una imagen, "eso" apunta a todo. Usa sustantivos y posiciones: el dial de la izquierda, la segunda línea del recibo, el cable rojo de abajo.
- Omitir la guarda contra suposiciones en lecturas críticas. Números de serie, fechas, dosis, precios: un modelo de visión bajo incertidumbre rellena huecos con la misma fluidez que cualquier otro modelo. Añade "transcribe exactamente; si no es claro, di 'ilegible'" — el mismo truco de alquilar honestidad de la lección de alucinaciones, ahora con ojos.
- Una imagen, cinco preguntas, un mensaje. Empaquetar "qué es esto, cuánto vale, de dónde es, si es original, escribe un anuncio" diluye la atención por toda la cuadrícula cinco veces. Un adjunto, una pregunta afilada — luego continúa; la imagen permanece en el escritorio, y las preguntas siguientes viajan en tokens que ya pagaste.
Preguntas Frecuentes
¿Cómo hago un prompt de IA con una imagen?
Nombra el sujeto, la acción y cualquier texto visible, luego restringe la salida: "Identifica [la cosa específica] en [la ubicación en la imagen], [haz esto con ella], responde en [formato]." Apunta la atención del modelo como apuntarías los ojos de un colega — a la etiqueta, no a la cocina.
¿Por qué enviar una imagen a la IA cuesta más?
Porque el modelo debe convertir la imagen en cientos de tokens de evidencia visual antes de poder procesar tu pregunta — dramáticamente más cómputo que la frase equivalente. En Uzu, esa prima es una tarifa fija de 10 G-Credits por archivo: el precio honesto del tiempo de GPU gastado mirando. El texto es barato; los píxeles se procesan.
¿Puede la IA leer texto dentro de imágenes?
Sí — y es una de las habilidades más fuertes de los modelos de visión, desde letra manuscrita hasta señales de calle y capturas de formularios. La salvedad es la precisión bajo incertidumbre: para cualquier cosa crítica (fechas, series, dosis), exige transcripción exacta y un explícito "di ilegible si no es claro", en lugar de dejar que el modelo rellene huecos.
Próxima Lección
Nota lo que atravesó esta lección entera: tú hiciste el señalamiento. Elegiste el sujeto, apuntaste la atención, aportaste las restricciones. Pero hay un movimiento que voltea toda la conversación — ¿y si, en lugar de responder preguntas, la IA te hiciera las preguntas a ti primero? Una ronda barata de la máquina entrevistándote puede reemplazar tres rondas caras de ti re-explicando.
Continúa a la próxima lección: La Técnica "Pregúntame Primero"
Ejercicio práctico antes de irte: encuentra la última foto que enviaste a una IA y repite la pregunta de tres formas — vaga, media y quirúrgica (sujeto + acción + texto + formato). Observa la respuesta afilarse con cada una, y luego comprueba cuánto te costó realmente la versión vaga.