Che cosa sono Amazon Bedrock Guardrails
Amazon Bedrock Guardrails è un layer di sicurezza configurabile che si interpone tra l’utente e un foundation model, applicando policy sia sull’input (il prompt) sia sull’output (la risposta generata). Non è un modello: è un insieme di safeguard che puoi definire una volta e riutilizzare su modelli diversi. L’obiettivo è filtrare contenuti dannosi o indesiderati, bloccare argomenti fuori scope e proteggere dati sensibili, in modo coerente e indipendente dal modello sottostante. Per l’esame AIF-C01 il concetto chiave è che i Guardrails rendono operativa la responsible AI: traducono principi astratti (safety, privacy, controllability) in regole applicate a runtime, senza dover riaddestrare il modello.
Le policy che puoi configurare
Un singolo guardrail combina più tipi di policy, che agiscono insieme su prompt e risposta:
- Content filters: filtrano categorie predefinite di contenuti dannosi — hate, insults, sexual, violence, misconduct e prompt attacks (jailbreak / prompt injection). Ogni categoria ha una soglia di intensità (None/Low/Medium/High) regolabile separatamente per l’input e per l’output.
- Denied topics: argomenti vietati definiti in linguaggio naturale (es. “consulenza finanziaria personalizzata”). Sono semantici: il guardrail riconosce il tema anche se espresso con parole diverse da quelle usate nella definizione.
- Word filters: blocco di parole o frasi esatte, più un filtro profanity gestito. Utile per termini proibiti, nomi di concorrenti o linguaggio volgare specifico.
- Sensitive information filters (PII): rilevano dati personali (email, numeri di carta, ecc.) e li possono bloccare oppure mascherare/anonimizzare. Supportano tipi predefiniti e pattern regex custom.
- Contextual grounding checks: misurano quanto la risposta è ancorata alla fonte (grounding) e pertinente alla domanda (relevance), per ridurre le hallucination, in particolare negli scenari RAG.
Quando un contenuto viene bloccato, il guardrail restituisce un messaggio personalizzabile al posto della risposta del modello.
Il ruolo nella responsible AI
I Guardrails coprono più dimensioni della responsible AI di AWS: safety (contenuti dannosi filtrati), privacy e sicurezza (PII mascherati o bloccati), controllability (argomenti fuori scope respinti) e veracity (contextual grounding contro le hallucination). Il valore aggiunto è la coerenza: la stessa policy si applica in modo uniforme a tutte le applicazioni e a tutti gli utenti, senza dipendere dal prompt engineering del singolo sviluppatore. Per questo i Guardrails vanno letti come un controllo di governance, non solo come una funzione tecnica isolata.
Dove si applicano
Un guardrail può essere associato alle invocazioni dirette di un foundation model, agli Agents for Amazon Bedrock e alle Knowledge Bases usate per il RAG. Con l’ApplyGuardrail API la stessa policy può valutare anche testo prodotto da modelli non ospitati su Bedrock — inclusi modelli self-managed o di terze parti — disaccoppiando il controllo dal modello. I guardrail possono inoltre essere versionati e aggiornati senza modificare il codice dell’applicazione.
Trappole tipiche d’esame
- Filtrare categorie generiche di contenuti dannosi (hate, violence, ecc.) → content filters: sono le categorie predefinite con soglia regolabile, non i denied topics.
- Impedire che il modello tratti un tema di business specifico (es. consigli d’investimento) → denied topics: descritti in linguaggio naturale e riconosciuti semanticamente; un word filter bloccherebbe solo le parole esatte, non il concetto.
- Nascondere email o numeri di carta nell’output senza rifiutare la risposta → sensitive information filters in modalità mask/anonimizzazione: il blocco totale rifiuterebbe la risposta, la maschera la mantiene utilizzabile.
- Ridurre le hallucination in una soluzione RAG → contextual grounding checks: non è compito dei content filters, che gestiscono la tossicità, non la veridicità.
- Applicare la stessa policy a un modello non ospitato su Bedrock → ApplyGuardrail API: i guardrail sono indipendenti dal modello; non serve migrare il modello su Bedrock.
- “Serve un modello più sicuro” o “fai fine-tuning” quando il requisito è filtrare l’output → Guardrails, non un nuovo modello: aggiungono controlli senza cambiare né riaddestrare il foundation model.