Azure Synapse Analytics è il servizio di analisi integrata di Azure pensato per unire in un unico ambiente il data warehousing relazionale e la big data analytics. Storicamente le aziende dovevano usare strumenti separati: un data warehouse per le query strutturate e report aziendali, e un motore big data (tipo Hadoop/Spark) per elaborare grandi volumi di dati grezzi. Synapse elimina questa frammentazione offrendo più motori di calcolo che condividono metadati, sicurezza e un’unica interfaccia di lavoro, il Synapse Studio.
I motori di Synapse
Il cuore di Synapse è la possibilità di scegliere il motore di calcolo più adatto al carico di lavoro, pagando solo per ciò che serve.
SQL pool dedicati
I dedicated SQL pool (ex SQL Data Warehouse) forniscono un data warehouse relazionale con risorse provisionate: si riserva una quantità fissa di potenza di calcolo, misurata in DWU (Data Warehouse Units), che si può scalare o mettere in pausa. Usano un’architettura MPP (Massively Parallel Processing) che distribuisce i dati e le query su più nodi, ideale per workload OLAP su tabelle di grandi dimensioni (fatti e dimensioni di un data warehouse). Si paga per la capacità riservata, indipendentemente dall’utilizzo, quindi conviene per carichi prevedibili e continui.
SQL pool serverless
Il serverless SQL pool è sempre disponibile e non richiede alcun provisioning: si pagano solo i dati elaborati da ogni query (pay-per-query). È perfetto per esplorare e interrogare con sintassi T-SQL dati che risiedono direttamente nel data lake (file Parquet, CSV, JSON) senza doverli prima caricare in tabelle. Abilita scenari di data exploration e logical data warehouse su Azure Data Lake Storage.
Apache Spark pool
Gli Apache Spark pool portano il motore open source Apache Spark dentro Synapse per la big data analytics e la data engineering. Consentono di scrivere codice in PySpark, Scala, Spark SQL o .NET per trasformare grandi volumi di dati, addestrare modelli di machine learning e lavorare in notebook interattivi. È la scelta per elaborazioni non relazionali su dati semi-strutturati o non strutturati.
Pipeline integrate
Synapse include Synapse Pipelines, basate sulla stessa tecnologia di Azure Data Factory, per orchestrare i processi di integrazione dati (ETL/ELT). Con oltre 90 connettori si ingeriscono dati da fonti eterogenee, si trasformano tramite data flow visuali e si automatizzano i flussi, il tutto senza uscire dallo Studio.
Un unico ambiente
Il valore chiave di Synapse è l’unificazione: analisti che scrivono T-SQL, data engineer che usano Spark e data scientist che costruiscono modelli lavorano sugli stessi dati con controlli di sicurezza e monitoraggio comuni. Questo realizza il pattern del modern data warehouse: dati grezzi ingeriti nel data lake, raffinati con Spark, serviti tramite SQL pool per BI e report (tipicamente con Power BI, anch’esso integrabile).
Rapporto con Microsoft Fabric
È fondamentale capire il posizionamento attuale: Microsoft Fabric rappresenta l’evoluzione SaaS della piattaforma di analisi. Fabric riunisce data engineering, data warehouse, data science, real-time analytics e Power BI in un’unica esperienza governata da Microsoft Purview, con lo storage unificato OneLake al centro. Synapse resta un servizio Azure PaaS pienamente supportato, ma per i nuovi progetti Microsoft indirizza verso Fabric come piattaforma di riferimento. Per l’esame DP-900, Synapse è il servizio “classico” di analytics unificata su Azure, mentre Fabric è la piattaforma di nuova generazione che ne eredita e amplia le capacità.
Trappole tipiche d’esame
- Scenario: vuoi interrogare file Parquet nel data lake con T-SQL pagando solo per i dati letti, senza caricare nulla → usa il serverless SQL pool di Synapse (non il dedicated).
- Scenario: hai un data warehouse aziendale con carichi OLAP costanti e prevedibili su tabelle enormi → usa un dedicated SQL pool con architettura MPP e capacità in DWU.
- Scenario: devi trasformare grandi volumi di dati non strutturati con notebook PySpark → usa un Apache Spark pool, non un SQL pool.
- Scenario: ti serve orchestrare l’ingestione e la trasformazione dei dati da più fonti dentro Synapse → usa le Synapse Pipelines (stessa tecnologia di Azure Data Factory).
- Scenario: una domanda cita la piattaforma di analisi unificata SaaS con OneLake e Power BI integrati → la risposta è Microsoft Fabric, l’evoluzione della piattaforma, non Synapse.