Skip to main content
I modelli di visione possono analizzare immagini insieme a prompt testuali. Usali per la comprensione delle immagini, l’estrazione, la classificazione, il visual question answering e il ragionamento multimodale. Venice supporta messaggi di chat multimodali compatibili con OpenAI. Inserisci blocchi di testo e immagini nello stesso messaggio utente, quindi invia la richiesta a un modello abilitato alla visione.

Utilizzo di Base

Uso di Immagini Base64

Puoi anche passare una data URL in base64 quando l’immagine è locale o privata:

Invio di Più Immagini

content è un array di blocchi, quindi un singolo messaggio utente può includere più blocchi image_url insieme al testo. Usalo per confrontare immagini o porre domande che riguardano più di un’immagine:
Ogni immagine consuma token di contesto. Se una richiesta con più immagini restituisce TOO_MANY_TOKENS (HTTP 400), riduci il numero di immagini, accorcia le istruzioni o passa a un modello con una finestra di contesto più ampia.

Scelta di un Modello di Visione

Usa la pagina Modelli di Testo o l’API Modelli per trovare modelli che supportano la visione. Il supporto alla visione è indicato tra le capacità del modello.
Per input di tipo documento, usa gli Input da File quando desideri che Venice estragga il testo da un file. Usa la visione quando conta il layout visivo o il contenuto stesso dell’immagine.

Consigli sul Prompting

  • Indica al modello su cosa concentrarsi: oggetti, testo, layout, sicurezza, difetti o differenze.
  • Richiedi output strutturato quando la tua applicazione ha bisogno di campi che puoi analizzare.
  • Assicurati che gli URL delle immagini siano accessibili all’API, oppure usa data URL in base64 per immagini private.
  • Usa un modello con contesto sufficiente se combini immagini con istruzioni lunghe.

Risorse Correlate