TL;DR
ビジョンモデルは人間のように写真を「理解」しません —— 視覚的証拠のグリッドとして読みます。だからプロンプトは注意を照準するため主題、動作、可視テキストを名指す必要があります。そして画像のデコードは単語のデコードより桁違いに計算を燃やすため、すべての添付には実際のコストが伴い、画像そのものがデータであるときだけ支払うべきです。
例え話
一生を盲目で過ごした聡明な学者を想像してください。
彼は書かれたすべての本を読んでいます —— 医学、法律、美術史、化学 —— 完全に触覚とテキストを通じて。そしてある日、目隠しが外れます。目は機能します。しかし起きなかったことが一つ:誰も彼に一生分の視覚経験を渡していない。シーンで何が重要かの直感も、「誰もがまず顔を見る」という反射もない。開眼した彼は、どこを見ればいいか分からない天才です。
だからキッチンの写真を見せて*「感想は?」と言えば —— 彼はパニック的にすべて*を研究します。蛇口。窓。3枚目のタイルの染み。学者にはどれも解釈する知識がありますが、人間の顕著性の感覚がないため、天才をシーン全体に均等に配ります。返ってくる答えは、網羅的に観察的で、完全に焦点が定まっていません。
あなたの言葉は、重要なものを指す指です。「フライパンの底のステッカー —— コーティングについて何と書いてある?」—— すると突然、世界で最も教育を受けた目が、必要だったものそのものに固定されます。
もう一つの詳細が、値札を説明します:**その目隠しを外し続けるのは高くつく。**画像を読むのは、一文を読む百倍の努力を学者に要求します。だから開眼して見つめる1分ごとにプレミアムが請求され —— 写真が証拠だろうが単なる飾りだろうが、あなたは支払います。
仕組みとコスト(Uzu)
画像を添付すると、モデルはそれをパッチのグリッドにスライスし、各パッチを単語と同じ通貨に変換します:トークンです。写真1枚は、質問が読まれる前に軽く数百トークンかかります —— そして会話の他のすべてと同様、コンテキストウィンドウ —— モデルが毎回の返信前に読み返す机 —— に留まります。画像は千の言葉に値するだけではありません。あの机の上では、千の言葉を占有するのです。
だからビジュアルプロンプトには独自の解剖学があります —— モデルの注意を照準する3つのスロット:
| スロット | 回答する問い | 例 |
|---|---|---|
| 主題 | 画像の中のどのものについてか? | 「充電器の警告ラベル」 |
| 動作 | 何が起きているか、何をすべきか? | 「翻訳して」/「破損してる?」 |
| テキスト | どの可視文字が重要か? | 「SNで始まる型番を読んで」 |
主題を名指しすれば、モデルがグリッド全体に注意を平均化するのを止められます。動作を与えれば —— 翻訳、識別、比較、推定 —— 目のついたワンショットプロンプトになります。可視テキストを指せば、ビジョンモデルの最も鋭いスキルを活用します:現代のモデルは、画像の中のテキストを、他のほぼすべてのことより上手に読みます。
そして請求書。数百の画像トークンを読むには実際のGPU時間がかかる。だからUzuは添付ファイル1つにつき10 G-Creditsの定額を、送信ボタンを押した瞬間に課金します。保存料ではなく —— モデルが見つめることに費やす電力と計算のコストです。この価格に焼き込まれた設計レッスン:**画像がデータであるときだけ画像を添付する。**エラーダイアログの写真はデータです。テキストとして貼れた段落のスクリーンショットは、税金付きの飾りです —— 同じ答えが、普通の単語の価格で届きます。そしてスコープ制限どおり、添付1つにつき鋭い視覚質問1つが5つの曖昧な質問に勝ちます:送信前に主題、動作、出力形式を制約してください。
作業ルール:
**画像は千トークンの価値。**自分の注意を払う場所にモデルがトークンを費やすように —— 情報を運ぶピクセルにだけお金を払いなさい。
変更前後(プロンプト)
例1 —— 正体不明の物体
[散らかった引き出しの写真] これ何?
モデルは忠実に引き出しの目録を作ります:ケーブル、硬貨、電池、「小さなリモコンらしきもの」。そのリストのどこかに、あなたが意味したものがあります。たぶん。
[同じ写真] 左上、電池の横にある小さな黒いデバイスを識別して。有力なブランドと用途を2文で。
主題(黒いデバイス、左上)、動作(ブランドと用途の識別)、形式(2文)。同じ写真、外科的な答え。
例2 —— 文書
[書類の写真] これ見てくれる?
「見る」はタスクではありません。モデルは書類を一般的に要約します —— すべてを決めるその1つのフィールドが必要だったのでなければ、それで構わないのですが。
[同じ写真] この契約書ページの右上のボックス内の「発効日」フィールドだけを読み、正確に書き写して。判読不能なら「判読不能」と言って —— 日付を推測しないで。
最鋭のテキストスロットプロンプト:1つのフィールド、正確な転写、そして明示的な推測禁止ガード —— 隙間をシームレスに埋めるモデルは、推測されてはならない法的日付にはまさに間違った道具だからです。
例3 —— 飾りの罠
[記事のスクリーンショット、添付] これを要約して。
あなたはテキストに画像の価格を支払ったばかりです。モデルは単語を綴るピクセルを読みます —— 単語そのものを貼った場合より、遅く、高く、エラーが起きやすいです。
[画像なし] この記事を3つの箇条書きで要約して:[貼り付けたテキスト]
同一の答え、計算量は数分の一、添付料金ゼロ。スクリーンショットは決してデータではなく —— データの容器でした。この一つの習慣 —— テキストなら貼る、ピクセルなら添付 —— がビジュアルプロンプト最大の節約です。
よくある落とし穴
- **AIが画像を「読む」のではなく「感じる」ことを期待する。**ビジョンモデルはあなたの夕日の写真を体験しません —— グリッドから証拠をカタログ化します。「どんな感情を呼び起こしますか?」と尋ねれば、確信に満ちた慣習の説明が返ります —— 暖色、笑顔 —— 感じた反応ではありません。見る感覚ではなく、画像の中に何があるかを尋ねましょう。
- **飾りを添付する。**テキストのスクリーンショット、「文脈のための」ロゴ、すでにタイプした内容を繰り返す写真。情報がすでに単語になっていたなら、すべての添付は二重に支払われるプレミアム計算です。画像だけが運べるものだけを添付しましょう。
- **曖昧な指示 —— 「これ」「それ」「その部分」。**テキストチャットでは「それ」は最後のメッセージを指します。画像では「それ」はすべてを指します。名詞と位置を使いましょう:左のダイヤル、レシートの2行目、下の赤いケーブル。
- **重要な読み取りで推測禁止ガードを省く。**型番、日付、用量、価格:不確実性下のビジョンモデルは、他のどのモデルとも同じくらい滑らかに隙間を埋めます。*「正確に書き写して;不明なら『判読不能』と言って」*を追加しましょう —— ハルシネーションのレッスンの正直さレンタルの同じトリック、今回は目付きです。
- 1枚の画像、5つの質問、1通のメッセージ。「これは何、いくら、どこ産、本物か、出品文を書いて」を束ねれば、注意がグリッド全体で5倍に薄まります。添付1つ、鋭い質問1つ —— その後フォローアップを。画像は机に留まり、フォローアップはすでに支払ったトークンに乗ります。
FAQ
画像付きでAIにプロンプトする方法は?
主題、動作、可視テキストを名指しし、出力を制約します:「[画像内の場所]の[具体的なもの]を識別し、[これをし]、[形式]で答えて」。同僚の目を導くようにモデルの注意を導く —— キッチンではなく、ステッカーへ。
AIに画像を送るほうが高くつくのはなぜ?
モデルは質問を処理する前に、画像を数百トークンの視覚証拠に変換しなければならないからです —— 同等の文より桁違いの計算。Uzuでは、このプレミアムはファイル1つにつき10 G-Creditsの定額:見つめることに費やされたGPU時間の正直な価格。テキストは安く、ピクセルは処理されるのです。
AIは画像内のテキストを読めますか?
はい —— そしてそれはビジョンモデルの最強スキルの一つです。手書きから道路標識、書類のスクリーンショットまで。ただし不確実性下の精度が問題です:重要なもの(日付、型番、用量)については、モデルに隙間を埋めさせるのではなく、正確な転写と明示的な「不明なら判読不能と言って」を要求しましょう。
次のレッスン
このレッスン全体を貫いていたものに注目:あなたが指差しをしていました。主題を選び、注意を向け、制約を供給したのはあなたです。しかし会話全体をひっくり返す一手があります —— AIが質問に答える代わりに、まずあなたに質問したら?マシンがあなたにインタビューする安い1ラウンドが、あなたが再説明する高価な3ラウンドに取って代われます。
次のレッスンへ:「まず聞いて」テクニック
帰る前の練習:AIに送った最後の写真を見つけ、質問を3通りで再び尋ねてください —— 曖昧に、中程度に、外科的に(主題+動作+テキスト+形式)。答えが鋭くなるのを見て、それから曖昧版が実際にいくらかかったか確認してください。