Capire cosa c’è dentro un’immagine è il rovescio della generazione, ed è il punto in cui si sbaglia più spesso il servizio da usare. La domanda decisiva non è “come descrivo un’immagine”, ma “chi guarda quell’immagine, e quando”: un modello multimodale al momento della richiesta, oppure una pipeline che ha precalcolato dei metadati molto prima.
Modello multimodale o feature preconfezionata
La strada storica sono le visual feature di Image Analysis 4.0 in Azure Vision: caption, dense captions, tag, object detection, people detection, OCR sincrono, smart crop. Operazioni fisse, veloci, a schema noto. Il punto da sapere all’esame è che Image Analysis è deprecato e sarà ritirato il 25 settembre 2028, e che la guida di migrazione indirizza altrove per scenario: Document Intelligence per OCR e lettura del testo, la Face API per i volti, modelli di embedding multimodale come Cohere Embed o SigLIP per la ricerca per similarità, e per il resto i modelli generativi di Foundry oppure Azure Content Understanding in Foundry Tools.
La strada attuale è il modello multimodale vision-enabled: si passa l’immagine insieme al testo nello stesso messaggio e si chiede quello che serve, in linguaggio naturale, con l’output nel formato che si preferisce. Il criterio è semplice: se la risposta serve a schema fisso e in volumi alti, la feature preconfezionata o l’analyzer restano competitivi; se la domanda cambia da un utente all’altro, serve il modello.
Didascalie e testo alternativo
Caption e Dense Captions non sono la stessa feature. Caption genera una singola frase che descrive tutta l’immagine, con un punteggio di confidenza. Dense Captions genera una frase per un massimo di dieci regioni distinte, ciascuna con le proprie coordinate di bounding box, e la prima descrive comunque l’immagine intera. È la mappa dei due termini della study guide: “concise” è Caption, “detailed” è Dense Captions. Su un lotto di immagini si itera la chiamata, oppure si passano più immagini nello stesso messaggio a un modello multimodale chiedendo una didascalia per ciascuna. Le caption in Image Analysis 4.0 sono disponibili solo in inglese, e il parametro gender-neutral-caption sostituisce i termini di genere con “person”.
Il testo alternativo è l’attributo alt di un tag <img> e serve agli screen reader come Narrator, JAWS e NVDA, oltre che ai motori di ricerca. Una caption generata è un buon punto di partenza, non il prodotto finito: la documentazione raccomanda una soglia di confidenza sotto la quale la caption non si accetta, e avverte che le didascalie possono contenere errori imbarazzanti, per esempio sul genere delle persone. Ne discendono due cose pratiche: revisione umana sui contenuti pubblici, e distinzione fra alt text breve (una frase, quella che finisce nell’attributo) e descrizione estesa, che per un grafico complesso va prodotta a parte con un modello multimodale.
Rispondere a domande ancorate all’evidenza visiva
Qui sta l’errore architetturale più comune. Se l’applicazione precalcola una didascalia in fase di ingestione e poi risponde alle domande degli utenti leggendo solo quella, la maggior parte delle domande resterà senza risposta: la didascalia è una compressione con perdita, prodotta senza sapere quale domanda sarebbe arrivata. Per un question answering davvero ancorato all’evidenza visiva l’immagine deve entrare nel contesto insieme alla domanda.
response = client.chat.completions.create(
model="gpt-5", # deployment vision-enabled
messages=[
{"role": "system", "content": "Rispondi solo con quanto è visibile."},
{"role": "user", "content": [
{"type": "text", "text": "Il quadro ha il coperchio chiuso?"},
{"type": "image_url", "image_url": {"url": data_url, "detail": "high"}},
]},
],
)
Il parametro detail merita attenzione: con low il modello lavora su una versione a 512x512, più veloce e più economica; con high parte dalla versione a bassa risoluzione e poi genera segmenti dettagliati da 512x512, raddoppiando il budget di token per segmento; auto decide in base alla dimensione dell’immagine. È la leva che fa la differenza fra leggere un’etichetta piccola e non vederla.
Le tecniche di prompt raccomandate per i modelli vision-enabled sono poche e ricorrenti: dare contesto specifico allo scenario invece di chiedere “cosa c’è in questa immagine”; orientare il prompt al compito; mettere l’immagine prima del testo quando l’immagine è una sola; chiedere al modello di descrivere prima l’immagine e poi eseguire il compito, soprattutto se rifiuta; aggiungere esempi; spezzare le richieste complesse; dichiarare il formato d’uscita, per esempio JSON.
Oggetti, componenti e regioni
Il rilevamento oggetti restituisce, per ciascun oggetto trovato, un nome, un punteggio di confidenza e un bounding box in pixel. È simile al tagging, ma il tagging può includere termini contestuali come “indoor” che non sono localizzabili, e fra le due tassonomie non c’è una relazione formale. Serve quando conta sapere dove si trova una cosa, o quante istanze ce ne sono.
I limiti dichiarati sono altrettanto importanti dei risultati, e sono materiale da domanda d’esame: gli oggetti piccoli, sotto il 5% dell’immagine, in genere non vengono rilevati; gli oggetti ammassati fra loro, come una pila di piatti, nemmeno; e gli oggetti non sono distinti per marca o nome commerciale. Per i volti c’è la Face API, non l’object detection. Sul video il ragionamento cambia ancora: Content Understanding campiona circa un fotogramma al secondo e ridimensiona i fotogrammi campionati a 512 pixel per lato, quindi un evento di durata inferiore al secondo o un dettaglio minuto possono semplicemente non comparire nell’analisi.
Da ricordare per l’esame
- Caption produce una frase per tutta l’immagine; Dense Captions fino a dieci descrizioni di regioni con bounding box. Le caption di Image Analysis 4.0 sono solo in inglese.
- Image Analysis è deprecato con ritiro il 25 settembre 2028: la migrazione porta a Document Intelligence per l’OCR, Face per i volti, embedding multimodali per la ricerca, modelli generativi o Content Understanding per il resto.
- Il question answering visivo richiede l’immagine nel contesto della domanda: una didascalia precalcolata non basta.
- L’alt text va trattato con soglia di confidenza e revisione umana; alt breve nell’attributo, descrizione estesa a parte.
- L’object detection restituisce label, confidenza e bounding box, ma non vede oggetti sotto il 5% dell’immagine, non separa oggetti ammassati e non distingue i brand.