Skip to main content
Vision-Modelle können Bilder zusammen mit Textprompts analysieren. Verwende sie für Bildverständnis, Extraktion, Klassifikation, visuelle Fragebeantwortung und multimodales Reasoning. Venice unterstützt OpenAI-kompatible multimodale Chat-Nachrichten. Füge Text- und Bildblöcke in dieselbe Benutzernachricht ein und sende die Anfrage anschließend an ein vision-fähiges Modell.

Grundlegende Nutzung

Base64-Bilder verwenden

Du kannst auch eine Base64-Data-URL übergeben, wenn das Bild lokal oder privat ist:

Mehrere Bilder senden

content ist ein Array von Blöcken, daher kann eine einzelne Benutzernachricht mehrere image_url-Blöcke zusammen mit Text enthalten. Nutze das, um Bilder zu vergleichen oder Fragen zu stellen, die mehr als ein Bild umfassen:
Jedes Bild verbraucht Kontext-Tokens. Wenn eine Anfrage mit mehreren Bildern TOO_MANY_TOKENS (HTTP 400) zurückgibt, reduziere die Anzahl der Bilder, kürze deine Anweisungen oder wechsle zu einem Modell mit größerem Kontextfenster.

Ein Vision-Modell auswählen

Nutze die Seite Textmodelle oder die Models-API, um Modelle zu finden, die Vision unterstützen. Die Vision-Unterstützung ist in den Modellfähigkeiten aufgeführt.
Verwende bei dokumentähnlichen Eingaben Datei-Eingaben, wenn Venice Text aus einer Datei extrahieren soll. Verwende Vision, wenn das visuelle Layout oder der Bildinhalt selbst wichtig ist.

Prompt-Tipps

  • Sag dem Modell, worauf es sich konzentrieren soll: Objekte, Text, Layout, Sicherheit, Defekte oder Unterschiede.
  • Verlange strukturierte Ausgaben, wenn deine Anwendung Felder benötigt, die du parsen kannst.
  • Achte darauf, dass Bild-URLs für die API zugänglich sind, oder verwende Base64-Data-URLs für private Bilder.
  • Verwende ein Modell mit ausreichend Kontext, wenn du Bilder mit langen Anweisungen kombinierst.

Verwandte Ressourcen