TL;DR

Um modelo de visão não "entende" a sua foto como uma pessoa — ele a lê como uma grade de evidências visuais, então seu prompt deve nomear o sujeito, a ação e qualquer texto visível para mirar a atenção dele. E como decodificar uma imagem queima muito mais processamento do que decodificar palavras, cada anexo carrega um custo real que você deve gastar apenas quando a própria imagem é o dado.

A Analogia

Imagine um acadêmico brilhante que passou a vida inteira de vendas nos olhos.

Ele leu todo livro já escrito — medicina, direito, história da arte, química — inteiramente pelo tato e pelo texto. Então, um dia, a venda sai. Os olhos funcionam. Mas eis o que não aconteceu: ninguém lhe entregou uma vida de experiência visual. Ele não tem instinto para o que importa numa cena, nenhum reflexo que diga "todo mundo olha primeiro para o rosto". De olhos abertos, ele é um gênio sem ideia de onde olhar.

Então, quando você mostra uma foto da sua cozinha e diz "opiniões?" — ele entra em pânico e estuda tudo. A torneira. A janela. Uma mancha no terceiro azulejo. O acadêmico tem o conhecimento para interpretar qualquer parte disso, mas sem o senso humano do que é saliente, ele distribui o gênio uniformemente pela cena inteira. A resposta que você recebe é exaustivamente observadora e completamente desfocada.

Suas palavras são o dedo apontando para o que importa. "A etiqueta no fundo da panela — o que ela diz sobre o revestimento?" — e de repente os olhos mais educados do mundo travam exatamente na coisa de que você precisava.

Mais um detalhe, e ele explica a etiqueta de preço: manter essa venda fora é caro. Ler uma imagem custa ao acadêmico cem vezes o esforço de ler uma frase. Então cada minuto de encarar de olhos abertos é cobrado a preço premium — e você paga quer a foto fosse evidência ou só decoração.

Como Funciona & O Custo (Uzu)

Quando você anexa uma imagem, o modelo a fatia numa grade de remendos e converte cada remendo na mesma moeda que usa para palavras: tokens. Uma foto pode facilmente custar centenas de tokens antes mesmo de a sua pergunta ser lida — e, como tudo na conversa, ela fica na janela de contexto, a mesa que o modelo relê antes de cada resposta. Uma imagem não vale apenas mil palavras; nessa mesa, ela as ocupa.

É por isso que o prompting visual tem sua própria anatomia — três slots que miram a atenção do modelo:

SlotA pergunta que ele respondeExemplo
SujeitoDe que coisa na imagem se trata?"a etiqueta de aviso no carregador"
AçãoO que está acontecendo, ou o que fazer com isso?"traduza" / "está danificado?"
TextoQuais palavras visíveis importam?"leia o número de série que começa com SN"

Nomeie o sujeito e você impede o modelo de mediar a atenção dele por toda a grade. Dê a ação — traduzir, identificar, comparar, estimar — e ele se torna um prompt one-shot com olhos. Aponte para o texto visível e você explora a habilidade mais afiada de um modelo de visão: modelos modernos leem texto dentro de imagens melhor do que quase qualquer outra coisa que fazem.

Depois vem a conta. Ler essas centenas de tokens de imagem exige tempo real de GPU, e é por isso que o Uzu cobra um valor fixo de 10 G-Credits por arquivo anexado, precificado no momento em que você aperta enviar. Não é uma taxa de armazenamento — é o custo da eletricidade e do processamento que o modelo gasta encarando. A lição de design embutida nesse preço: anexe a imagem apenas quando a imagem é o dado. Uma foto do diálogo de erro é dado. Uma captura de tela de um parágrafo que você poderia ter colado como texto é decoração com imposto — a mesma resposta, entregue pelo preço de palavras simples. E, conforme o limiting scope, uma pergunta visual enxuta por anexo vale mais que cinco vagas: restrinja o sujeito, a ação e o formato de saída antes de enviar.

A regra de trabalho:

Uma imagem vale mil tokens. Certifique-se de que o modelo os gaste onde você gastaria a sua própria atenção — e pague apenas por pixels que carregam informação.

Antes e Depois (Os Prompts)

Exemplo 1 — o objeto misterioso

[foto de uma gaveta bagunçada] o que é isso?

O modelo inventaria fielmente a gaveta: cabos, moedas, uma bateria, "possivelmente um controle remoto pequeno". Em algum lugar dessa lista está a coisa que você quis dizer. Provavelmente.

[mesma foto] Identifique o pequeno dispositivo preto no canto superior esquerdo, ao lado das pilhas. Diga a provável marca e para que serve, em 2 frases.

Sujeito (o dispositivo preto, canto superior esquerdo), ação (identificar marca e função), formato (2 frases). Mesma foto, resposta cirúrgica.

Exemplo 2 — o documento

[foto de um formulário] Você pode dar uma olhada nisso?

"Olhar" não é uma tarefa. O modelo resume o papel genericamente — o que é ótimo, a menos que você precisasse do único campo que decide tudo.

[mesma foto] Leia apenas o campo "Data de Vigência" na caixa do canto superior direito desta página de contrato e transcreva-o exatamente. Se estiver ilegível, diga "ilegível" — não chute uma data.

Prompting de slot de texto no seu auge: um campo, transcrição exata e uma guarda explícita contra chutes — porque um modelo que preenche lacunas sem costura é exatamente a ferramenta errada para datas jurídicas não verificadas.

Exemplo 3 — a armadilha da decoração

[captura de tela de um artigo, anexada] Resuma isto.

Você acabou de pagar preços de imagem por texto. O modelo lê pixels que soletram palavras — mais lento, mais caro e mais propenso a erro do que se você tivesse colado as próprias palavras.

[sem imagem] Resuma este artigo em 3 bullets: [texto colado]

Resposta idêntica, uma fração do processamento, zero cobrança de anexo. A captura de tela nunca foi dado — era um contêiner para dados. Este único hábito — cole quando é texto, anexe quando são pixels — é a maior economia do prompting visual.

Erros Comuns

  1. Esperar que a IA "sinta" a imagem em vez de lê-la. Um modelo de visão não experiencia a sua foto do pôr do sol; ele cataloga evidências de uma grade. Pergunte "que emoções isso evoca?" e você receberá uma descrição confiante de convenções — tons quentes, rostos sorridentes — não uma reação sentida. Pergunte o que está na imagem, não como é vê-la.
  2. Anexar decoração. Capturas de texto, logotipos "para contexto", fotos que repetem o que você já digitou. Cada anexo é processamento premium gasto duas vezes se a informação já estava em palavras. Anexe apenas o que só a imagem consegue carregar.
  3. Referências vagas — "isso", "aquilo", "aquela parte". No chat de texto, "isso" aponta para a última mensagem. Numa imagem, "isso" aponta para tudo. Use substantivos e posições: o mostrador à esquerda, a segunda linha do recibo, o fio vermelho embaixo.
  4. Pular a guarda contra chutes em leituras críticas. Números de série, datas, dosagens, preços: um modelo de visão sob incerteza preenche lacunas tão suavemente quanto qualquer outro modelo. Adicione "transcreva exatamente; se estiver ilegível, diga 'ilegível'" — o mesmo truque de alugar honestidade da lição de alucinações, agora com olhos.
  5. Uma imagem, cinco perguntas, uma mensagem. Empacotar "o que é isso, quanto vale, de onde é, é original, escreva um anúncio" dilui a atenção por toda a grade cinco vezes. Um anexo, uma pergunta afiada — depois siga com as próximas; a imagem fica na mesa, e as perguntas seguintes viajam em tokens que você já pagou.

FAQ

Como faço um prompt de IA com uma imagem?

Nomeie o sujeito, a ação e qualquer texto visível, depois restrinja a saída: "Identifique [a coisa específica] em [a localização na imagem], [faça isto com ela], responda em [formato]." Aponte a atenção do modelo como você apontaria os olhos de um colega — para a etiqueta, não para a cozinha.

Por que enviar uma imagem para a IA custa mais?

Porque o modelo precisa converter a imagem em centenas de tokens de evidência visual antes de processar a sua pergunta — dramaticamente mais processamento do que a frase equivalente. No Uzu, esse premium é um valor fixo de 10 G-Credits por arquivo: o preço honesto do tempo de GPU gasto encarando. Texto é barato; pixels são processados.

A IA consegue ler texto dentro de imagens?

Sim — e é uma das habilidades mais fortes dos modelos de visão, de letra manuscrita a placas de rua e capturas de formulários. O porém é a precisão sob incerteza: para qualquer coisa crítica (datas, números de série, dosagens), exija transcrição exata e um "diga ilegível se estiver pouco claro" explícito, em vez de deixar o modelo preencher lacunas.

Próxima Lição

Repare no que atravessou esta lição inteira: você fez o apontamento. Você escolheu o sujeito, mirou a atenção, forneceu as restrições. Mas existe um movimento que vira a conversa inteira — e se, em vez de responder perguntas, a IA fizesse as perguntas a você primeiro? Uma rodada barata da máquina te entrevistando pode substituir três rodadas caras de você re-explicando.

Continue para a próxima lição: A Técnica "Pergunte-me Primeiro"

Exercício prático antes de ir: encontre a última foto que você enviou a uma IA e repita a pergunta de três formas — vaga, média e cirúrgica (sujeito + ação + texto + formato). Veja a resposta afiar a cada uma, e depois confira quanto a versão vaga realmente custou.