Lo stereotipo degli “stereotipi tutti sbagliati”
Nel dibattito pubblico lo stereotipo viene quasi sempre presentato come un errore morale prima ancora che come un fenomeno cognitivo. Questa impostazione, tuttavia, è essa stessa stereotipata: assume che ogni forma di generalizzazione sia di per sé distorsiva, ignorando il fatto che qualunque sistema cognitivo, umano o artificiale, non può funzionare senza comprimere l’informazione. Comprendere cosa sia davvero uno stereotipo richiede quindi di sospendere il giudizio morale iniziale e di analizzarlo come un oggetto cognitivo, culturale e tecnico, prima ancora che etico.
In senso rigoroso, uno stereotipo può essere definito come una generalizzazione probabilistica che associa una categoria a una proprietà. Dato un insieme di individui X una categoria C ⊂ X e una proprietà A, lo stereotipo emerge quando si assume che la probabilità condizionata P(A∣C) sia significativamente diversa dalla probabilità marginale P(A). In altri termini, sapere che un individuo appartiene a una categoria modifica le aspettative su una sua caratteristica. Questa formulazione è minimale ma cruciale, perché mostra immediatamente che lo stereotipo non è, in sé, né vero né falso in senso assoluto. È una stima probabilistica compressa, che può essere più o meno accurata, più o meno giustificata, ma che nasce da una regolarità osservata o presunta.
Dal punto di vista cognitivo, lo stereotipo è una euristica. Il cervello umano, come qualunque sistema limitato, non può trattare ogni individuo come un caso completamente nuovo. Deve ridurre la complessità del mondo usando categorie e aspettative. Senza questa compressione, l’azione sarebbe paralizzata. Da questo punto di vista, gli stereotipi non sono anomalie del pensiero, ma sue condizioni di possibilità. Diventano problematici quando vengono reificati, cioè trasformati da stime probabilistiche in essenze immutabili, oppure quando vengono applicati rigidamente a individui concreti ignorando l’elevata varianza interna alle categorie. Il problema non è quindi la generalizzazione in sé, ma l’uso normativo e assoluto della generalizzazione.
Sul piano culturale e sociale, gli stereotipi non sono eccezioni patologiche, ma strutture ricorrenti. Ogni cultura trasmette, attraverso il linguaggio, i media e le istituzioni, associazioni implicite tra ruoli, caratteristiche e gruppi. Queste associazioni tendono a stabilizzarsi quando sono funzionali al coordinamento sociale o quando giustificano assetti di potere preesistenti. Ciò spiega perché alcuni stereotipi persistano anche quando sono empiricamente fragili: non sopravvivono perché veri, ma perché utili a mantenere una certa leggibilità del mondo sociale. Pensare di poterli eliminare completamente equivale a immaginare una cultura priva di categorie, il che è concettualmente incoerente.
Gli stereotipi nei modelli di AI
Questo quadro diventa particolarmente chiaro quando si passa ai modelli di intelligenza artificiale. Un modello di apprendimento statistico non fa altro che formalizzare ciò che la cognizione umana fa in modo informale: apprendere regolarità dai dati per minimizzare un errore predittivo. In questo contesto, gli stereotipi emergono come scorciatoie predittive. Se una categoria è fortemente correlata a una proprietà nel dataset, il modello apprenderà quella correlazione perché riduce la funzione di perdita. Non c’è nulla di misterioso in questo: è il comportamento corretto di un sistema che ottimizza una funzione obiettivo.

Vedi oltre per una dimostrazione matematica rigorosa della formula che mette in luce la decomposizione dell’errore: bias – variaza – rumore. Si spiegherà inoltre perché questa formula di per sé NON dimostra il trade-off bias-varianza che ha origine invece nella struttura dei modelli.
Un modello con alto bias, cioè troppo rigido, tende a catturare solo le regolarità più grossolane. In questo caso, le categorie diventano segnali predittivi privilegiati perché sono semplici e globali. Lo stereotipo qui emerge come conseguenza dell’underfitting: il modello non riesce a rappresentare la complessità individuale e si rifugia nelle medie di gruppo.
Al contrario, un modello con alta varianza, cioè troppo flessibile, può memorizzare o amplificare correlazioni spurie presenti nel dataset. In questo caso, lo stereotipo non è una semplificazione rozza, ma una riproduzione iperfedele delle distorsioni del campione. In entrambi i casi, lo stereotipo non è un incidente, ma l’effetto naturale di come il modello si colloca nel trade-off tra generalizzazione e adattamento.
Da qui segue una conseguenza spesso sottovalutata: ogni dataset contiene stereotipi. Non perché qualcuno li abbia necessariamente inseriti in malafede, ma perché un dataset è sempre una selezione storicamente situata del mondo. È una fotografia parziale, scattata da un certo punto di vista, con certe categorie e non altre. L’idea di costruire dataset “anti-stereotipo” completamente bilanciati, in cui ogni associazione venga compensata da tutte le sue varianti possibili, si scontra con limiti strutturali. Un bilanciamento meccanico tende ad appiattire i significati, rendendo equiprobabili associazioni che nel mondo non lo sono, e introduce nuovi bias nel momento stesso in cui decide cosa bilanciare e cosa no. Inoltre, lo spazio combinatorio delle possibili categorie è virtualmente infinito: eliminare uno stereotipo significa spesso crearne altri.
La questione commerciale legata ai modelli di AI
Questa impossibilità tecnica si intreccia con una questione commerciale tutt’altro che secondaria. I modelli di AI sono prodotti. Devono soddisfare l’intento dell’utente. Se un generatore di immagini producesse sistematicamente rappresentazioni “corrette” dal punto di vista normativo ma lontane da ciò che l’utente intendeva, verrebbe percepito come inaffidabile. L’inclusività forzata può entrare in conflitto con l’aderenza semantica. Le aziende di AI operano quindi su un compromesso: mitigare gli stereotipi più dannosi o socialmente inaccettabili senza distruggere l’utilità del modello. Questo non è cinismo, ma una tensione strutturale tra valore economico e responsabilità sociale.
La questione etica
Resta infine la questione etica, forse la più delicata. Addestrare un’AI “contro” certi stereotipi significa scegliere quali stereotipi siano inaccettabili e quali tollerabili. Questa scelta non è mai puramente tecnica. È normativa, culturale e politica. In ambiti ad alto impatto, come l’accesso al lavoro, al credito o alla giustizia, la prescrittività è difficilmente evitabile: qui la riduzione del danno giustifica vincoli forti. In ambiti espressivi o creativi, una normatività rigida rischia invece di trasformare l’AI in uno strumento pedagogico imposto, più che in un mezzo espressivo.
La questione degli stereotipi non è risolvibile nel senso forte del termine. Non esiste un mondo, né umano né artificiale, privo di generalizzazioni. La vera posta in gioco non è l’eliminazione degli stereotipi, ma la loro gestione: capire quali scorciatoie cognitive sono accettabili in quali contesti, quali producono danni sproporzionati, e chi ha il potere di decidere. L’AI non fa che rendere esplicito un problema che era già sempre stato lì, nascosto nel funzionamento ordinario della cognizione e della cultura. Ed è proprio per questo che non possiamo delegarne la soluzione a una formula, a un dataset o a un algoritmo, senza prima assumerci la responsabilità delle scelte che quei sistemi inevitabilmente incorporano.
Approfondimento matematico
Dimostrazione della formula dell’errore atteso di un modello





Analisi della formula

La formula ci dice che l’errore che commettiamo non è un blocco unico, ma la somma di tre effetti qualitativamente diversi. Uno di questi, il rumore , non dipende da noi: è l’imprevedibilità intrinseca del mondo o della misurazione. Gli altri due, bias e varianza, dipendono invece da come scegliamo il modello.
Il bias
Il bias misura quanto il modello è “lontano in media” dalla verità.
Immagina di tirare freccette sempre nello stesso punto, ma quel punto è spostato rispetto al centro del bersaglio. Le freccette sono coerenti, ordinate, ma sbagliano sistematicamente. Questo è il bias.
In termini di modelli, il bias cresce quando:
- il modello è troppo semplice,
- usa poche regole grossolane,
- non riesce a rappresentare la complessità reale del fenomeno.
Un modello con alto bias “pensa” qualcosa come:
non riesco a distinguere bene i casi, quindi userò una media generale o una regola semplice.
Ed è proprio qui che entrano in gioco le generalizzazioni rigide e gli stereotipi: quando non hai strumenti per cogliere le differenze individuali, ti appoggi su categorie larghe.
La varianza
La varianza misura quanto il modello cambia se cambiano leggermente i dati di addestramento.
Ora immagina di tirare freccette che a volte colpiscono il centro, a volte molto lontano, in direzioni imprevedibili. In media potresti anche essere vicino al bersaglio, ma ogni tiro è instabile. Questo è l’errore di varianza.
La varianza cresce quando:
- il modello è molto complesso,
- ha tantissimi parametri,
- cerca di “spiegare tutto” quello che vede nei dati.
Un modello con alta varianza “pensa” qualcosa come:
ogni dettaglio che vedo è importante, anche se potrebbe essere solo rumore.
Qui il rischio non è la semplificazione, ma l’ipersensibilità: il modello impara correlazioni accidentali, locali, talvolta culturalmente distorte.

La formula mostra una cosa fondamentale: bias e varianza entrano come termini separati ma sommati. Non c’è un pulsante che abbassa entrambi insieme.
Se rendi il modello:
- più semplice → diminuisce la varianza, ma aumenta il bias.
- più complesso → diminuisce il bias, ma aumenta la varianza.
Matematicamente, stai scegliendo una funzione in uno spazio più o meno grande:
- spazio piccolo → poche funzioni possibili → comportamento stabile → alto bias;
- spazio grande → molte funzioni possibili → comportamento instabile → alta varianza.
La formula mostra che ogni scelta strutturale sposta il peso tra i due termini.
bias e varianza non sono difetti accidentali, ma conseguenze opposte della stessa esigenza fondamentale: generalizzare da dati finiti.
- Se generalizzi troppo poco (overfitting), memorizzi il passato e fallisci sul futuro → varianza.
- Se generalizzi troppo (underfitting), perdi informazione reale → bias.
Non è che “non abbiamo ancora trovato il modello giusto”: è che non può esistere un modello che annulli simultaneamente entrambi, salvo casi ideali irrealistici (dati infiniti, rumore nullo, modello perfettamente specificato).
Gli stereotipi emergono quando, per ridurre varianza o complessità, un modello accetta più bias usando categorie come scorciatoie predittive; cercare di eliminarli completamente significa spesso aumentare la varianza o distruggere la capacità di generalizzazione.
Attenzione! La formula non spiega il trade-off, rende solo visibile i due contributi dell’errore.
non dice nulla su:
- come cambia il bias al variare del modello,
- come cambia la varianza al variare del modello,
- perché aumentando la complessità uno tende a salire e l’altro a scendere.
Tutto questo è esterno alla formula.
Consideriamo algoritmi diversi
Ogni algoritmo sceglie una funzione da uno spazio di funzioni .
- Se è piccolo (modello semplice):
- poche funzioni possibili
- comportamento stabile
- bassa varianza
- ma la funzione vera potrebbe non stare in
- quindi alto bias
- Se è grande (modello complesso):
- moltissime funzioni possibili
- il modello si adatta molto ai dati
- basso bias
- ma piccole variazioni nei dati cambiano molto la funzione scelta
- quindi alta varianza
Bias e varianza reagiscono in modo opposto alla stessa manopola: la capacità del modello.
Il trade-off nasce da tre fatti strutturali, non dalla scomposizione:
- Dati finiti
Con dati infiniti, il trade-off in gran parte scompare. - Scelta di uno spazio di ipotesi H
Ogni modello restringe o allarga lo spazio delle funzioni possibili. - Generalizzazione da campioni
Più è grande:- più puoi approssimare la funzione vera (↓ bias),
- ma più sei sensibile al campione specifico (↑ varianza).
Il bias–variance trade-off è una proprietà delle procedure di apprendimento sotto dati finiti.
La formula di bias–variance decomposition non lo dimostra, ma lo rende osservabile e quantificabile.
Formulazione matematica che mostra il trade-off bias-varianza
Un modello di AI che fa previsioni può essere inquadrato all’interno della teoria della stima molto classica: vuole prevedere come funziona il mondo, ma il mondo non è accessibile direttamente. È accessibile solo attraverso un campione casuale finito, il dataset. In altre parole, l’obiettivo non è “indovinare bene i dati che ho visto”, ma stimare una regola generale che funzioni bene su dati futuri estratti dallo stesso meccanismo reale.





