TL;DR

Model vision tidak "memahami" foto Anda seperti manusia — ia membacanya sebagai grid bukti visual, jadi prompt Anda harus menyebut subjek, aksi, dan teks yang terlihat untuk mengarahkan perhatiannya. Dan karena mendekode gambar membakar jauh lebih banyak komputasi daripada mendekode kata, setiap lampiran membawa biaya nyata yang hanya layak Anda keluarkan saat gambar itu sendirilah datanya.

Analogi

Bayangkan seorang cendekiawan brilian yang seumur hidupnya memakai penutup mata.

Dia telah membaca semua buku yang pernah ditulis — kedokteran, hukum, sejarah seni, kimia — sepenuhnya lewat sentuhan dan teks. Lalu suatu hari, penutup matanya dibuka. Matanya berfungsi. Tapi ada yang tidak terjadi: tak ada yang memberinya pengalaman visual seumur hidup. Ia tak punya insting tentang apa yang penting dalam sebuah pemandangan, tak punya refleks "semua orang melihat wajah dulu". Dengan mata terbuka, ia jenius yang tak tahu harus ke mana melihatnya.

Jadi saat Anda menunjukkan foto dapur Anda dan berkata "pendapat?" — ia mempelajari segalanya dengan panik. Kerannya. Jendelanya. Noda di ubin ketiga. Cendekiawan itu punya pengetahuan untuk menafsirkan salah satunya, tapi tanpa rasa salient milik manusia, ia membagikan kejeniusannya rata ke seluruh pemandangan. Jawaban yang Anda dapat sangat observan dan sepenuhnya tak fokus.

Kata-kata Anda adalah jari yang menunjuk apa yang penting. "Stiker di dasar panci — apa yang tertulis tentang lapisannya?" — dan tiba-tiba mata paling terpelajar di dunia terkunci pada tepat hal yang Anda butuhkan.

Satu detail lagi, dan ini menjelaskan label harganya: membuka penutup itu mahal. Membaca satu gambar menghabiskan seratus kali tenaga membaca satu kalimat. Jadi setiap menit menatap dengan mata terbuka ditagih premium — dan Anda membayarnya entah foto itu bukti atau sekadar hiasan.

Cara Kerjanya & Biayanya (Uzu)

Saat Anda melampirkan gambar, model memotongnya menjadi grid patch dan mengonversi tiap patch ke mata uang yang sama dengan kata: token. Satu foto bisa dengan mudah berbiaya ratusan token bahkan sebelum pertanyaan Anda dibaca — dan seperti segala hal dalam percakapan, ia tinggal di context window, meja yang dibaca ulang model sebelum setiap balasan. Seekar gambar tak hanya berharga seribu kata; di meja itu, ia menempati seribu kata.

Itulah kenapa prompting visual punya anatomi sendiri — tiga slot yang mengarahkan perhatian model:

SlotPertanyaan yang dijawabContoh
SubjekBenda apa dalam gambar yang dimaksud?"label peringatan di charger"
AksiApa yang terjadi, atau apa yang harus dilakukan dengannya?"terjemahkan" / "apakah rusak?"
TeksKata-kata terlihat mana yang penting?"baca nomor seri yang diawali SN"

Sebutkan subjeknya dan Anda menghentikan model dari merata-ratakan perhatiannya ke seluruh grid. Berikan aksinya — terjemahkan, identifikasi, bandingkan, estimasikan — dan ia menjadi prompt one-shot bermata. Tunjuk teks yang terlihat dan Anda memanfaatkan keterampilan tunggal paling tajam model vision: model modern membaca teks di dalam gambar lebih baik daripada hampir semua hal lain yang mereka lakukan.

Lalu ada tagihannya. Membaca ratusan token-gambar itu memakan waktu GPU nyata, itulah kenapa Uzu menagih flat 10 G-Credits per file terlampir, dihargai saat Anda menekan kirim. Itu bukan biaya penyimpanan — itu biaya listrik dan komputasi yang dihabiskan model untuk menatap. Pelajaran desain yang tertanam dalam harga itu: lampirkan gambar hanya saat gambar itulah datanya. Foto dialog error adalah data. Tangkapan layar paragraf yang bisa Anda tempel sebagai teks adalah hiasan berpajak — jawaban yang sama, dikirim dengan harga kata-kata biasa. Dan sesuai membatasi scope, satu pertanyaan visual yang ketat per lampiran mengalahkan lima pertanyaan kabur: batasi subjek, aksi, dan format output sebelum mengirim.

Aturan kerjanya:

Seekar gambar berharga seribu token. Pastikan model membelanjakannya di tempat Anda akan membelanjakan perhatian Anda sendiri — dan bayar hanya untuk piksel yang membawa informasi.

Sebelum & Sesudah (Prompt)

Contoh 1 — benda misterius

[foto laci berantakan] apa ini?

Model dengan tekun menginventarisasi laci: kabel, koin, baterai, "kemungkinan remote kecil". Di suatu tempat dalam daftar itu ada yang Anda maksud. Mungkin.

[foto yang sama] Identifikasi perangkat hitam kecil di kiri atas, di sebelah baterai. Sebutkan merek yang mungkin dan fungsinya, dalam 2 kalimat.

Subjek (perangkat hitam, kiri atas), aksi (identifikasi merek dan fungsi), format (2 kalimat). Foto yang sama, jawaban bedah.

Contoh 2 — dokumen

[foto formulir] Bisa lihat yang ini?

"Melihat" bukan tugas. Model meringkas kertasnya secara generik — tak masalah, kecuali Anda butuh satu kolom penentu segalanya.

[foto yang sama] Baca hanya kolom "Tanggal Berlaku" di kotak kanan atas halaman kontrak ini dan transkripsikan persis. Jika tak terbaca, katakan "tak terbaca" — jangan menebak tanggal.

Prompting slot-teks pada puncak ketajamannya: satu kolom, transkripsi persis, dan pagar anti-menebak eksplisit — karena model yang mengisi celah dengan mulus justru alat yang salah untuk tanggal hukum yang tak boleh dikira-kira.

Contoh 3 — jebakan hiasan

[tangkapan layar artikel, terlampir] Rangkum ini.

Anda baru membayar harga gambar untuk teks. Model membaca piksel yang membentuk kata — lebih lambat, lebih mahal, dan lebih rawan salah daripada jika Anda menempel kata-katanya langsung.

[tanpa gambar] Rangkum artikel ini dalam 3 poin: [teks yang ditempel]

Jawaban identik, sepersekian komputasi, nol biaya lampiran. Tangkapan layar itu bukan data — ia wadah untuk data. Satu kebiasaan ini — tempel bila teks, lampirkan bila piksel — adalah penghematan terbesar dalam prompting visual.

Kesalahan Umum

  1. Mengharapkan AI "merasakan" gambar alih-alih membacanya. Model vision tidak mengalami foto senja Anda; ia mengatalog bukti dari grid. Tanya "emosi apa yang dipancarkan ini?" dan Anda dapat deskripsi konvensi yang percaya diri — nada hangat, wajah tersenyum — bukan reaksi yang dirasakan. Tanya apa yang ada di gambar, bukan seperti apa melihatnya.
  2. Melampirkan hiasan. Tangkapan layar teks, logo "untuk konteks", foto yang mengulang apa yang sudah Anda ketik. Setiap lampiran adalah komputasi premium yang dibayar dua kali jika informasinya sudah berupa kata. Lampirkan hanya yang hanya bisa dibawa gambar.
  3. Deixis kabur — "ini", "itu", "bagian itu". Di chat teks, "itu" menunjuk pesan terakhir. Di gambar, "itu" menunjuk segalanya. Pakai kata benda dan posisi: dial di kiri, baris kedua struk, kabel merah di bawah.
  4. Melewatkan pagar anti-menebak pada pembacaan kritis. Nomor seri, tanggal, dosis, harga: model vision di bawah ketidakpastian mengisi celah selancar model lain. Tambahkan "transkripsikan persis; jika tak jelas, katakan 'tak terbaca'" — trik menyewa kejujuran dari pelajaran halusinasi, kini bermata.
  5. Satu gambar, lima pertanyaan, satu pesan. Membundel "apa ini, berapa harganya, dari mana, asli tidak, buatkan listing" mengencerkan perhatian ke seluruh grid lima kali lipat. Satu lampiran, satu pertanyaan tajam — lalu tindak lanjut; gambar tetap di meja, dan tindak lanjut menumpang pada token yang sudah Anda bayar.

FAQ

Bagaimana memberi prompt AI dengan gambar?

Sebutkan subjek, aksi, dan teks yang terlihat, lalu batasi outputnya: "Identifikasi [hal spesifik] di [lokasi dalam gambar], [lakukan ini], jawab dalam [format]." Arahkan perhatian model seperti Anda mengarahkan mata kolega — ke stikernya, bukan ke seluruh dapur.

Kenapa mengirim gambar ke AI lebih mahal?

Karena model harus mengonversi gambar menjadi ratusan token bukti visual sebelum bisa memproses pertanyaan Anda — komputasi jauh lebih besar daripada kalimat setara. Di Uzu, premi itu flat 10 G-Credits per file: harga jujur untuk waktu GPU yang dihabiskan untuk menatap. Teks murah; piksel diproses.

Bisakah AI membaca teks di dalam gambar?

Bisa — dan itu salah satu keterampilan terkuat model vision, dari tulisan tangan hingga rambu jalan hingga tangkapan layar formulir. Catatannya: akurasi di bawah ketidakpastian. Untuk hal kritis (tanggal, nomor seri, dosis), tuntut transkripsi persis dan "katakan tak terbaca jika tak jelas" secara eksplisit alih-alih membiarkan model mengisi celah.

Pelajaran Berikutnya

Perhatikan apa yang mengalir sepanjang pelajaran ini: Anda yang menunjuk. Anda memilih subjek, mengarahkan perhatian, memberi batasan. Tapi ada langkah yang membalik seluruh percakapan — bagaimana jika, alih-alih menjawab pertanyaan, AI yang bertanya pada Anda lebih dulu? Satu putaran murah mesin mewawancarai Anda bisa menggantikan tiga putaran mahal Anda menjelaskan ulang.

Lanjut ke pelajaran berikutnya: Teknik "Ask Me First"

Latihan sebelum pergi: cari foto terakhir yang Anda kirim ke AI dan tanyakan ulang dengan tiga cara — kabur, sedang, dan bedah (subjek + aksi + teks + format). Saksikan jawaban makin tajam di setiap versinya, lalu cek berapa biaya nyata versi kabur itu.