TL;DR

Ein Vision-Modell „versteht“ dein Foto nicht wie ein Mensch — es liest es als Raster visueller Belege. Dein Prompt muss daher Subjekt, Aktion und sichtbaren Text benennen, um die Aufmerksamkeit zu zielen. Und weil das Dekodieren eines Bildes weit mehr Rechenleistung verschlingt als das Dekodieren von Wörtern, hat jeder Anhang einen realen Preis, den du nur ausgeben solltest, wenn das Bild selbst die Information ist.

Die Analogie

Stell dir einen brillanten Akademiker vor, der sein ganzes Leben lang verbundenen Augen verbracht hat.

Er hat jedes je geschriebene Buch gelesen — Medizin, Jura, Kunstgeschichte, Chemie — vollständig über Tastsinn und Text. Dann, eines Tages, fällt die Binde. Die Augen funktionieren. Aber eines ist nicht geschehen: Niemand hat ihm ein Leben visueller Erfahrung überreicht. Er hat kein Gespür dafür, was in einer Szene zählt, keinen Reflex, der sagt „alle schauen zuerst in Gesichter“. Mit offenen Augen ist er ein Genie ohne Ahnung, wohin es schauen soll.

Wenn du ihm also ein Foto deiner Küche zeigst und sagst „Eindruck?“ — gerät er in Panik und studiert alles. Den Wasserhahn. Das Fenster. Einen Fleck auf der dritten Fliese. Der Akademiker besitzt das Wissen, um jedes dieser Dinge zu deuten — aber ohne das menschliche Gespür für Auffälligkeit verteilt er sein Genie gleichmäßig über die Szene. Die Antwort, die du bekommst, ist erschöpfend beobachtend und komplett unscharf.

Deine Worte sind der Finger, der auf das Wesentliche zeigt. „Das Etikett am Boden der Pfanne — was steht da über die Beschichtung?“ — und plötzlich richten sich die bestausgebildeten Augen der Welt exakt dorthin, wo du sie brauchst.

Noch ein Detail, das das Preisschild erklärt: die Binde offen zu halten ist teuer. Ein Bild zu lesen kostet den Akademiker hundertmal die Anstrengung einer Satzlektüre. Jede Minute des Sehens mit offenen Augen wird zum Premium-Tarif abgerechnet — und du zahlst sie, ob das Foto nun Beweis war oder Deko.

Wie es funktioniert und die Kosten (Uzu)

Wenn du ein Bild anhängst, zerschneidet das Modell es in ein Raster aus Patches und konvertiert jeden Patch in dieselbe Währung, die es für Wörter nutzt: Tokens. Ein Foto kann leicht hunderte Tokens kosten, bevor deine Frage überhaupt gelesen wird — und wie alles andere in der Konversation bleibt es im Kontextfenster, dem Schreibtisch, den das Modell vor jeder Antwort neu liest. Ein Bild sagt nicht mehr als tausend Worte; auf diesem Schreibtisch belegt es tausend Worte.

Deshalb hat visuelles Prompting eine eigene Anatomie — drei Plätze, die die Aufmerksamkeit des Modells lenken:

PlatzDie Frage, die er beantwortetBeispiel
SubjektUm welches Ding auf dem Bild geht es?„das Warnetikett des Ladegeräts“
AktionWas geschieht, oder was soll damit geschehen?„übersetze es“ / „ist es beschädigt?“
TextWelche sichtbaren Wörter zählen?„lies die Seriennummer, die mit SN beginnt“

Nenne das Subjekt, und du hältst das Modell davon ab, seine Aufmerksamkeit über das ganze Raster zu mitteln. Gib die Aktion — übersetzen, identifizieren, vergleichen, schätzen — und es wird ein One-Shot-Prompt mit Augen. Zeige auf sichtbaren Text, und du nutzt die schärfste Fähigkeit eines Vision-Modells: Moderne Modelle lesen Text in Bildern besser als fast alles andere, was sie tun.

Dann kommt die Rechnung. Diese hunderte Bild-Tokens zu lesen kostet echte GPU-Zeit — deshalb berechnet Uzu eine Pauschale von 10 G-Credits pro Anhang, fällig in dem Moment, in dem du auf Senden drückst. Das ist keine Speichergebühr — es ist der Preis für den Strom und die Rechenleistung, die das Modell beim Ansehen verbraucht. Die in diesen Preis eingebaute Design-Lektion: Hänge das Bild nur an, wenn das Bild die Information ist. Ein Foto des Fehlerdialogs ist eine Information. Ein Screenshot eines Absatzes, den du als Text hättest einfügen können, ist besteuerte Deko — dieselbe Antwort zum Preis einfacher Wörter. Und wie beim Rahmen begrenzen gilt: Eine gezielte visuelle Frage pro Anhang schlägt fünf vage — schränke Subjekt, Aktion und Ausgabeformat ein, bevor du sendest.

Die Arbeitsregel:

Ein Bild ist tausend Tokens wert. Sorge dafür, dass das Modell sie dort ausgibt, wo du deine eigene Aufmerksamkeit ausgeben würdest — und zahle nur für Pixel, die Information tragen.

Vorher/Nachher (Die Prompts)

Beispiel 1 — das mysteriöse Objekt

[Foto einer unaufgeräumten Schublade] Was ist das?

Das Modell inventarisiert die Schublade gewissenhaft: Kabel, Münzen, eine Batterie, „möglicherweise eine kleine Fernbedienung“. Irgendwo in dieser Liste steht, was du meintest. Wahrscheinlich.

[dasselbe Foto] Identifiziere das kleine schwarze Gerät oben links, neben den Batterien. Nenne mir die wahrscheinliche Marke und wozu es dient, in 2 Sätzen.

Subjekt (das schwarze Gerät, obere linke Ecke), Aktion (Marke und Funktion identifizieren), Format (2 Sätze). Gleiches Foto, chirurgische Antwort.

Beispiel 2 — das Dokument

[Foto eines Formulars] Kannst du das sehen?

„Sehen“ ist keine Aufgabe. Das Modell fasst das Blatt generisch zusammen — was in Ordnung wäre, wäre da nicht das eine Feld, das alles entscheidet.

[dasselbe Foto] Lies ausschließlich das Feld „Gültig ab“ im Kasten oben rechts auf dieser Vertragsseite und transkribiere es exakt. Wenn es unleserlich ist, sag „unleserlich“ — erfinde kein Datum.

Textplatz-Prompting in voller Schärfe: ein Feld, exakte Transkription und eine explizite Absicherung gegen Mutungen — denn ein Modell, das Lücken nahtlos füllt, ist genau das falsche Werkzeug für ungeprüfte Rechtsdaten.

Beispiel 3 — die Deko-Falle

[Screenshot eines Artikels, angehängt] Fasse das zusammen.

Du hast soeben Bildpreise für Text bezahlt. Das Modell liest Pixel, die Wörter buchstabieren — langsamer, teurer und fehleranfälliger, als wenn du die Wörter selbst eingefügt hättest.

[ohne Bild] Fasse diesen Artikel in 3 Bulletpoints zusammen: [eingefügter Text]

Identische Antwort, ein Bruchteil der Rechenleistung, null Anhangsgebühr. Der Screenshot war nie eine Information — er war ein Informationsbehälter. Allein diese Gewohnheit — Text einfügen, Pixel anhängen — ist die größte Ersparnis des visuellen Promptings.

Häufige Fehler

  1. Erwarten, dass die KI das Bild „fühlt“, statt es zu lesen. Ein Vision-Modell erlebt dein Sonnenuntergangsfoto nicht; es katalogisiert Belege aus einem Raster. Frag „welche Emotionen ruft das hervor?“ und du bekommst eine selbstbewusste Beschreibung von Konventionen — warme Töne, lächelnde Gesichter — keine gefühlte Reaktion. Frag, was auf dem Bild ist, nicht wie es ist, es zu sehen.
  2. Deko anhängen. Text-Screenshots, Logos „zum Kontext“, Fotos, die wiederholen, was du schon geschrieben hast. Jeder Anhang ist Premium-Rechenleistung, doppelt ausgegeben, wenn die Information schon in Wörtern vorlag. Hänge nur an, was nur ein Bild tragen kann.
  3. Vage Verweise — „das“, „hier“, „dieser Teil“. Im Text-Chat zeigt „das“ auf die letzte Nachricht. Auf einem Bild zeigt „das“ auf alles. Nutze Substantive und Positionen: das Zifferblatt links, die zweite Zeile des Kassenbons, das rote Kabel unten.
  4. Die Absicherung bei kritischen Lesungen weglassen. Seriennummern, Daten, Dosierungen, Preise: Ein Vision-Modell unter Unsicherheit füllt Lücken genauso flüssig wie jedes andere. Füge hinzu: „transkribiere exakt; wenn unklar, sag ‚unleserlich‘“ — derselbe gemietete Ehrlichkeits-Trick aus der Halluzinations-Lektion, jetzt mit Augen.
  5. Ein Bild, fünf Fragen, eine Nachricht. „Was ist das, was ist es wert, woher kommt es, ist es echt, schreib eine Anzeige“ in einem Paket verdünnt die Aufmerksamkeit fünfmal über das Raster. Ein Anhang, eine scharfe Frage — dann weiter; das Bild bleibt auf dem Schreibtisch, und Folgefragen reisen auf bereits bezahlten Tokens.

Häufige Fragen

Wie schreibe ich einen KI-Prompt mit Bild?

Benenne Subjekt, Aktion und sichtbaren Text, schränke dann die Ausgabe ein: „Identifiziere [das konkrete Ding] an [der Position im Bild], [mach dies damit], antworte in [Format].“ Lenke die Aufmerksamkeit des Modells wie die Augen eines Kollegen — aufs Etikett, nicht auf die Küche.

Warum kostet das Senden eines Bildes an die KI mehr?

Weil das Modell das Bild erst in hunderte Tokens visueller Belege umwandeln muss, bevor es deine Frage verarbeiten kann — dramatisch mehr Rechenleistung als der äquivalente Satz. In Uzu ist diese Prämie eine Pauschale von 10 G-Credits pro Datei: der ehrliche Preis der GPU-Zeit fürs Ansehen. Text ist billig; Pixel sind Verarbeitung.

Kann die KI Text in Bildern lesen?

Ja — und es ist eine der stärksten Fähigkeiten von Vision-Modellen, von Handschrift über Straßenschilder bis zu Formular-Screenshots. Der Vorbehalt ist die Genauigkeit unter Unsicherheit: Bei allem Kritischen (Daten, Nummern, Dosierungen) fordere exakte Transkription und ein ausdrückliches „sag unleserlich, wenn unklar“, statt das Modell die Lücke füllen zu lassen.

Nächste Lektion

Beachte, was diese ganze Lektion durchzog: Du hast gezeigt. Du hast das Subjekt gewählt, die Aufmerksamkeit gerichtet, die Einschränkungen geliefert. Aber es gibt einen Zug, der die ganze Konversation umdreht — was, wenn die KI, statt Fragen zu beantworten, zuerst dir die Fragen stellte? Eine billige Runde, in der die Maschine dich interviewt, kann drei teure Runden deiner Wiedererklärungen ersetzen.

Weiter zur nächsten Lektion: Die „Frag-mich-zuerst“-Technik

Praktische Übung vor dem Weiterklicken: Nimm das letzte Foto, das du einer KI geschickt hast, und stelle die Frage dreimal — vage, mittel und chirurgisch (Subjekt + Aktion + Text + Format). Beobachte, wie die Antwort mit jeder schärfer wird — und prüfe dann, was dich die vage Version wirklich gekostet hat.