La computer vision è l’area dell’intelligenza artificiale che permette ai sistemi di “vedere” e interpretare il contenuto di immagini e video. In Azure queste capacità sono offerte principalmente da Azure AI Vision, dal servizio Azure AI Face e da Custom Vision, tutti accessibili tramite Azure AI Foundry. Per l’esame AI-900 è fondamentale saper distinguere i diversi task di computer vision e capire quando usarne uno piuttosto che un altro.
Image classification
L’image classification assegna una o più etichette all’intera immagine, senza indicare dove si trovi l’oggetto. Il modello risponde alla domanda “che cosa rappresenta questa foto?”.
- Esempio: una foto di un cane in un parco viene etichettata semplicemente come
cane. - Uso tipico: catalogare immagini, filtrare contenuti, riconoscere una categoria di prodotto.
Con Custom Vision puoi addestrare un classificatore su categorie tue (es. distinguere mela da pera) fornendo immagini di esempio etichettate.
Object detection
L’object detection va oltre la classificazione: localizza uno o più oggetti all’interno dell’immagine restituendo per ciascuno un’etichetta e un bounding box (le coordinate del rettangolo che lo racchiude).
- Esempio: nella stessa foto identifica
canea sinistra epallaa destra, ciascuno con la sua cornice. - Uso tipico: contare oggetti, verificare la presenza di DPI in un cantiere, guidare un robot.
Regola chiave: se ti serve sapere quanti oggetti ci sono o dove si trovano, è object detection; se basta una singola etichetta complessiva, è image classification.
Image analysis
L’image analysis di Azure AI Vision è un servizio “pronto all’uso” (prebuilt, senza training) che estrae automaticamente più informazioni da un’immagine:
- tag descrittivi del contenuto,
- una caption (descrizione in linguaggio naturale, es. “una persona su una bicicletta”),
- rilevamento di oggetti comuni e di brand/loghi,
- categorie e colori dominanti.
È la scelta ideale quando vuoi risultati immediati su contenuti generici senza addestrare un modello.
OCR (Optical Character Recognition)
L’OCR estrae testo stampato o scritto a mano dalle immagini, restituendone il contenuto e la posizione. In Azure è fornito dall’API Read di Azure AI Vision.
- Esempio: digitalizzare cartelli, targhe, ricevute, note manoscritte.
- Distinzione importante: per documenti strutturati (fatture, moduli, contratti) con estrazione di campi chiave-valore si usa invece Azure AI Document Intelligence, non il semplice OCR.
Facial detection e facial analysis
Il servizio Azure AI Face riguarda specificamente i volti e va distinto in due livelli:
- Facial detection: rileva la presenza e posizione dei volti in un’immagine (bounding box), restituendo attributi come la posa. Risponde a “c’è un volto e dov’è?”.
- Facial analysis / recognition: confronta o identifica un volto per stabilire l’identità (verifica 1:1 o riconoscimento 1:N).
Considerazioni di privacy e AI responsabile: le funzionalità di riconoscimento facciale sono ad accesso limitato (Limited Access). Alcune capacità sensibili (come la stima di emozioni, genere o età) sono state ritirate in linea con i principi Microsoft di AI responsabile, in particolare privacy and security, fairness e inclusiveness. All’esame ricorda che il riconoscimento facciale richiede approvazione e uso etico.
Trappole tipiche d’esame
- Scenario: devi sapere quante auto ci sono in una foto e dove si trovano → risposta giusta: object detection (non image classification, che darebbe solo un’etichetta unica).
- Scenario: vuoi solo assegnare una categoria all’intera immagine (es. “spiaggia” vs “montagna”) → image classification.
- Scenario: devi estrarre il testo scritto a mano da foto di note → OCR (API Read di Azure AI Vision); se invece devi estrarre campi da fatture strutturate → Azure AI Document Intelligence.
- Scenario: devi rilevare la presenza di volti in una foto senza identificare le persone → facial detection (Azure AI Face); il riconoscimento dell’identità è Limited Access per motivi di privacy.
- Scenario: ti serve una descrizione automatica in linguaggio naturale e tag di un’immagine generica, senza addestrare nulla → image analysis (Azure AI Vision), mentre categorie personalizzate richiedono Custom Vision.