太长不看

视觉模型并不像人一样"理解"照片 —— 它读取的是视觉证据的网格。所以提示词必须点名主体、动作、可见文本来引导注意力。而解码图片比解码文字燃烧的算力多得多,因此每个附件都真实计费,只在图片本身是数据时才值得支付。

类比

想象一位终生蒙眼的杰出学者。

他读过的书几乎涵盖一切 —— 医学、法律、艺术史、化学 —— 全部通过触觉与文本。某天,眼罩摘除。眼睛能用了。但有一件事没有发生:没人给过他一辈子的视觉经验。他对场景中什么重要没有直觉,也没有"所有人先看脸"的反射。睁眼的他,是一位不知道该往哪看的天才。

所以你递给他一张厨房照片并问*"感觉怎么样?"* —— 他会勤奋地研究一切。水龙头。窗户。第三块瓷砖上的污渍。他有解读任何事物的知识,却没有人类的显著性感知,于是把天才平均分配到整个场景。返回的答案包罗万象、观察入微,而且焦点全无。

你的话就是指向重要之物的手指。"平底锅底部的贴纸 —— 关于涂层写了什么?"—— 顷刻间,世上受教育程度最高的一双眼睛锁定了唯一需要的那个点。

价格表上还有一个细节:**持续抬起眼罩很昂贵。**读图对学者而言,是读句子的百倍劳动。所以凝视的每一分钟都收溢价 —— 无论照片是证据还是装饰,都由你买单。

工作原理与成本(Uzu)

附加图片时,模型把它切成网格小块,每块转换为与词相同的货币:token。一张照片在问题被读之前就轻松达到数百token —— 而且像对话中的一切一样,驻留在上下文窗口,即模型每条回复前重读的书桌上。图片不仅值千言 —— 它在书桌上占据千言。

所以视觉提示词有自己的解剖结构 —— 引导模型注意力的三个槽位:

槽位它回答的问题示例
主体图片中的哪个东西是关于什么的?"充电器上的警告标签"
动作正在发生或需要发生什么?"翻译" / "有损伤吗?"
文本哪些可见文字是关键?"读取以SN开头的序列号"

点名主体,模型就停止把注意力平均分配到整张网格。给动作 —— 翻译、识别、比较、估算 —— 你就得到了带眼睛的单发提示词。指向可见文本,你就启用了视觉模型最锐利的技能:现代模型读图片中的文字比读其他任何东西都好。

然后是账单。读取数百个图像token需要真实的GPU时间。所以Uzu在按下发送键的瞬间收取每附件10 G-Credits的固定费用。这不是存储费 —— 是模型凝视所耗电力与算力的成本。烙进这个价格的设计教训是:**只有当图片是数据时才附加图片。**报错窗口的照片是数据。本可粘贴成文字的段落截图则是带税的装饰 —— 同样的答案会以普通文字的价格到达。而如同范围限制,每个附件配一个锋利的视觉问题胜过五个模糊的问题:发送前约束主体、动作、输出格式。

工作规则:

**图片价值千token。**让模型把token花在你注意力的去向 —— 只为承载信息的像素付费。

改写前后(提示词)

示例1 —— 神秘物体

[杂乱抽屉的照片] 这是什么?

模型尽职地列清单:线缆、硬币、电池、"像小遥控器的东西"。你想要的东西在清单某处。大概吧。

[同一张照片] 识别左上角电池旁的黑色小设备。用2句话给出最可能的品牌与用途。

主体(黑色设备、左上角),动作(识别品牌与用途),格式(2句话)。同一张照片,外科手术式的答案。

示例2 —— 文档

[文件照片] 看看这个?

"看看"不是任务。除非你需要的是决定一切的那个字段,模型会泛泛总结文件。

[同一张照片] 只读取并逐字誊写本合同页面右上角框中的"生效日期"字段。无法辨认时写"无法辨认" —— 不要编造日期。

文本槽位的极致:一个字段、精确誊写、以及明确的反编造护栏 —— 因为无缝填补空隙的模型,恰好是绝不该用于法律日期的错误工具。

示例3 —— 装饰陷阱

[文章截图,已附加] 总结一下。

你刚刚为文字付了图片价。模型读的是画成像素的词 —— 比直接粘贴更慢、更贵、更易出错。

[无图] 把这篇文章总结成3个要点:[粘贴的文本]

同样的答案,一小部分算力,零附件费。截图从来不是数据 —— 它是数据的容器。这一个习惯 —— 文字则粘贴,像素则附加 —— 是视觉提示最大的节约。

常见陷阱

  1. **期待AI"感受"图片而非读取。视觉模型并不体验你的日落照片 —— 它在网格中罗列证据。问"这唤起了什么情绪?"会得到自信的惯用描述 —— 暖色调、微笑的脸 —— 而非感受。要问图片里有什么,而非看它的感觉
  2. **附加装饰。**文字截图、"提供背景"的logo、重复已输入内容的照片。如果信息已经是文字,每个附件都是双重付费的高价算力。只附加只有图片能承载的东西。
  3. **模糊指示 —— "这个""那个""那部分"。*文字聊天中"那个"指向上一条消息。图片中"那个"指向一切。用名词与位置:左侧旋钮收据第二行、*下方红色线缆
  4. **在关键读取中省略反编造护栏。序列号、日期、容量、价格:不确定性下的视觉模型和其他模型一样平滑填隙。加上"逐字誊写;不清楚就说'无法辨认'" —— 幻觉课的租借诚实技巧,这次带上了眼睛。
  5. 一张图、五个问题、一条消息。"这是什么、值多少钱、哪国的、正品吗、再写个卖场文案"会把注意力稀释到整个网格的五倍。一附件一锋利问题 —— 然后追问。图片留在书桌上,追问搭上已付费的token。

常见问题

如何用图片向AI提示?

点名主体、动作、可见文本并约束输出:"识别[图片中位置]的[具体事物],[做这件事],以[格式]回答"。像引导同事的目光一样引导模型的注意力 —— 对准贴纸,而不是厨房。

向AI发送图片为什么更贵?

因为模型必须先把图片转换为数百token的视觉证据才能处理问题 —— 算力是等价句子的许多倍。在Uzu中,这份溢价是每文件10 G-Credits的固定费用:GPU凝视时间的诚实价格。文字廉价,像素需处理。

AI能读取图片中的文字吗?

能 —— 而且是视觉模型最强的技能之一。从手写体到路牌、从表单到截图。问题是不确定性下的准确性:对关键内容(日期、序列号、容量),不要让模型填隙 —— 要求逐字誊写,并明确"不清楚就说不清楚"。

下一课

注意贯穿本课的主线:由你来指点。你选主体、对准注意力、提供约束。但有一招能翻转整个对话 —— 如果让AI反过来先向你提问呢?机器面试你的一轮便宜对话,可以替代你解释三轮的昂贵往返。

继续下一课:"先问我"技巧

离开前的练习:找出你发送给AI的最后一张照片,把问题重问三遍 —— 模糊版、中等版、外科版(主体+动作+文本+格式)。观察答案如何变得锋利,并注意模糊版实际花费了多少。