Azure AI Vision è il servizio di Azure AI Services dedicato all’analisi delle immagini. Il suo punto di forza per un candidato AI-900 è che offre modelli prebuilt (pre-addestrati) pronti all’uso: bastano una chiamata API o l’SDK e non serve raccogliere dataset, etichettare immagini né avviare alcun training. Si passa un’immagine (o un URL) e si ricevono in risposta risultati strutturati in JSON. Questo lo rende ideale quando servono capacità di computer vision “standard” senza competenze di data science.

Image Analysis

La capacità di image analysis estrae informazioni descrittive dal contenuto visivo di una foto. Le funzioni principali che devi conoscere sono:

  • Caption / dense captions: genera una frase in linguaggio naturale che descrive l’immagine (“una persona in bicicletta su una strada di montagna”). Le dense captions producono più didascalie riferite a singole regioni.
  • Tag: assegna parole chiave che identificano oggetti, ambienti e azioni presenti (“outdoor”, “bicycle”, “sky”), utili per catalogare e cercare immagini.
  • Object detection: rileva i singoli oggetti e restituisce le bounding box, cioè le coordinate del rettangolo che circonda ogni oggetto. Da ricordare la differenza: i tag dicono cosa c’è, l’object detection dice anche dove si trova.
  • Funzioni aggiuntive: rilevamento del brand e di loghi, categorizzazione, generazione di smart crop (ritaglio intelligente attorno al soggetto) e moderazione dei contenuti (adult/racy/gory).

OCR con l’API Read

L’Optical Character Recognition (OCR) estrae testo stampato e scritto a mano dalle immagini e lo converte in un flusso di caratteri leggibile dalla macchina. In Azure AI Vision questa capacità è offerta dall’API Read, ottimizzata per documenti densi di testo, foto, insegne e scenari multilingua.

L’output è organizzato gerarchicamente in pages → lines → words, con le coordinate (bounding box) di ogni elemento. Casi d’uso tipici:

  • estrarre testo da foto di cartelli, targhe o etichette;
  • digitalizzare documenti cartacei scansionati;
  • rendere ricercabile il testo contenuto nelle immagini.

Attenzione a non confondere Azure AI Vision Read (OCR generico) con Azure AI Document Intelligence, che è invece specializzato nell’estrazione di campi strutturati da moduli, fatture e ricevute.

Face detection

Azure AI Vision include capacità di base di face detection: individua i volti presenti in un’immagine e ne restituisce la posizione (bounding box) insieme ad attributi come la posa. Per scenari più avanzati di riconoscimento e verifica dell’identità (confrontare due volti, identificare una persona) esiste il servizio dedicato Azure AI Face. Alcune funzionalità sensibili di riconoscimento facciale sono soggette a Limited Access e richiedono approvazione, in linea con i principi di Responsible AI di Microsoft.

Perché scegliere un modello prebuilt

Il vantaggio chiave da interiorizzare per l’esame è il time-to-value: un modello prebuilt elimina la fase di raccolta dati, etichettatura, training e valutazione. Si ottengono risultati immediati, con costi e competenze ridotti. Quando invece servono categorie specifiche del proprio dominio (es. riconoscere componenti industriali particolari), si usa Azure AI Custom Vision, che consente di addestrare un modello personalizzato con le proprie immagini.

Casi d’uso tipici

  • Estrazione di testo da foto (scontrini, biglietti da visita, insegne) con l’API Read.
  • Moderazione visiva di contenuti caricati dagli utenti per bloccare immagini inappropriate.
  • Cataloghi e accessibilità: generare caption e tag automatici per organizzare gallerie o descrivere immagini a utenti ipovedenti.

Trappole tipiche d’esame

  • Scenario: devi estrarre il testo stampato e scritto a mano da foto di documenti → risposta giusta: Azure AI Vision, API Read (OCR). Non Document Intelligence, che serve per campi strutturati di moduli e fatture.
  • Scenario: serve identificare dove si trova ogni oggetto nell’immagine, con un riquadro → risposta giusta: object detection (bounding box), non semplice tagging.
  • Scenario: vuoi riconoscere prodotti specifici della tua azienda non coperti dai modelli standard → risposta giusta: Azure AI Custom Vision (addestramento personalizzato), non i modelli prebuilt.
  • Scenario: descrizione in linguaggio naturale di una foto per l’accessibilità → risposta giusta: funzione caption di Azure AI Vision (image analysis).
  • Scenario: confrontare due volti per verificare che siano la stessa persona → risposta giusta: Azure AI Face, non la sola face detection di Azure AI Vision.