Entropia, struttura della popolazione e mutua informazione
Supponiamo di avere una popolazione e di osservare su ciascun individuo una variabile aleatoria \(X\). Per rendere l’esempio concreto, immaginiamo che \(X\) rappresenti l’età, oppure una versione discretizzata dell’età: giovane, adulto, anziano; oppure fasce come 0-20, 21-40, 41-60, oltre 60. Alla variabile \(X\) associamo una distribuzione di probabilità \(p(x)\), che descrive quanto è probabile osservare ciascun valore \(x\) nella popolazione complessiva.
Se non sappiamo nulla di un individuo estratto a caso dalla popolazione, la nostra incertezza sull’età è descritta dall’entropia di Shannon:
L’entropia \(H(X)\) misura il grado medio di incertezza associato alla variabile \(X\). Se tutti gli individui hanno la stessa età, l’incertezza è nulla. Se invece le età sono distribuite in modo molto vario e bilanciato tra molte possibilità, l’incertezza è maggiore.
Ora introduciamo una struttura nella popolazione. Supponiamo cioè che la popolazione sia divisa in gruppi:
Per esempio, i gruppi potrebbero essere scuole, quartieri, professioni, reparti aziendali, classi sociali, comunità, fasce di reddito, regioni geografiche o qualunque altra partizione della popolazione. Una volta introdotto il gruppo \(G\), possiamo studiare non solo la distribuzione generale \(p(x)\), ma anche la distribuzione condizionata:
Questa è la distribuzione della variabile \(X\) all’interno del gruppo \(g\). Nel caso dell’età, \(p(x\mid g)\) dice qual è la distribuzione delle età tra gli individui appartenenti a quel gruppo.
L’incertezza prima e dopo aver conosciuto il gruppo
Prima di sapere a quale gruppo appartiene un individuo, la nostra incertezza sull’età è \(H(X)\). Dopo aver saputo che l’individuo appartiene al gruppo \(g\), la nostra incertezza non è più calcolata usando la distribuzione generale \(p(x)\), ma usando la distribuzione specifica del gruppo:
Poiché l’individuo può appartenere a gruppi diversi, l’incertezza media residua dopo aver conosciuto il gruppo è l’entropia condizionata:
Sviluppando la formula:
Questa quantità misura quanta incertezza resta su \(X\), in media, una volta noto il gruppo di appartenenza.
L’idea fondamentale è questa: se i gruppi sono davvero informativi rispetto all’età, allora conoscere il gruppo riduce l’incertezza sull’età. Se invece i gruppi non hanno alcuna relazione con l’età, conoscere il gruppo non cambia nulla.
Definizione di mutua informazione
La mutua informazione tra \(X\) e \(G\) è definita come:
Essa misura quanta incertezza su \(X\) viene eliminata, in media, quando conosciamo il valore di \(G\). Nel nostro esempio:
\(I(X;G)\) misura quanto sapere il gruppo di appartenenza di una persona ci aiuta a prevedere la sua età.
Se conoscere il gruppo non riduce affatto l’incertezza, allora:
e dunque:
In questo caso la struttura dei gruppi non contiene informazione sulla variabile \(X\).
Se invece conoscere il gruppo elimina completamente l’incertezza su \(X\), allora:
e quindi:
In questo caso la struttura dei gruppi spiega completamente la variabilità di \(X\).
Un primo esempio: nessuna struttura informativa
Consideriamo una popolazione in cui l’età sia semplificata in due sole categorie: giovane e anziano. Supponiamo che nella popolazione totale le due categorie siano ugualmente probabili:
| Valore di \(X\) | \(p(x)\) |
|---|---|
| Giovane | 0.5 |
| Anziano | 0.5 |
L’entropia è:
Ora dividiamo la popolazione in due gruppi \(g_1\) e \(g_2\), ma immaginiamo che in entrambi i gruppi la distribuzione dell’età sia la stessa della popolazione totale:
| Gruppo | Giovani | Anziani |
|---|---|---|
| \(g_1\) | 0.5 | 0.5 |
| \(g_2\) | 0.5 | 0.5 |
Sapere che una persona appartiene a \(g_1\) non cambia le probabilità: resta 50% giovane e 50% anziana. Lo stesso vale per \(g_2\). Dunque:
Se i due gruppi hanno uguale peso, \(p(g_1)=p(g_2)=0.5\), allora:
Quindi:
La divisione in gruppi esiste, ma non è una struttura informativa rispetto all’età. È una partizione formale, non una struttura che riduce l’incertezza.
Secondo esempio: struttura perfettamente informativa
Consideriamo ancora la stessa popolazione totale:
| Valore di \(X\) | \(p(x)\) |
|---|---|
| Giovane | 0.5 |
| Anziano | 0.5 |
Perciò:
Ora però supponiamo che i gruppi siano così composti:
| Gruppo | Giovani | Anziani |
|---|---|---|
| \(g_1\) | 1 | 0 |
| \(g_2\) | 0 | 1 |
Se so che una persona appartiene a \(g_1\), so con certezza che è giovane. Se so che appartiene a \(g_2\), so con certezza che è anziana. Quindi:
Di conseguenza:
e:
In questo caso la struttura della popolazione riduce completamente l’incertezza. L’età non è più incerta dopo aver conosciuto il gruppo. La struttura è massimamente informativa rispetto a \(X\).
Terzo esempio: struttura parzialmente informativa
Consideriamo ancora una popolazione complessivamente bilanciata:
dunque:
Ora immaginiamo due gruppi ugualmente numerosi, ma con composizioni differenti:
| Gruppo | Giovani | Anziani |
|---|---|---|
| \(g_1\) | 0.8 | 0.2 |
| \(g_2\) | 0.2 | 0.8 |
Dentro ciascun gruppo c’è ancora incertezza, perché nessun gruppo è composto da una sola categoria. Però l’incertezza è minore rispetto a quella della popolazione generale.
L’entropia di una distribuzione \(0.8,0.2\) è:
Anche il gruppo \(g_2\), avendo distribuzione \(0.2,0.8\), ha la stessa entropia:
Se i due gruppi hanno peso uguale:
La mutua informazione è quindi:
Il gruppo riduce l’incertezza, ma non la elimina. Sapere che una persona è in \(g_1\) rende più probabile che sia giovane; sapere che è in \(g_2\) rende più probabile che sia anziana. Tuttavia resta una quota di incertezza, perché in entrambi i gruppi sono presenti entrambe le categorie.
Più struttura significa più mutua informazione?
Bisogna essere precisi. Avere più gruppi, o avere una partizione più fine della popolazione, non significa automaticamente avere più informazione su \(X\). La mutua informazione aumenta solo se la struttura dei gruppi è associata a differenze reali nella distribuzione di \(X\).
Se ogni gruppo ha la stessa distribuzione della popolazione totale, allora per ogni \(g\):
In questo caso conoscere il gruppo non modifica le probabilità di \(X\), e dunque:
Invece, se i gruppi hanno distribuzioni molto diverse dalla distribuzione generale, allora conoscere \(G\) cambia in modo significativo le probabilità assegnate ai diversi valori di \(X\). In tal caso \(H(X\mid G)\) diminuisce e \(I(X;G)\) aumenta.
La popolazione è strutturata rispetto a \(X\) quando i gruppi non sono semplici etichette, ma corrispondono a profili diversi della variabile \(X\).
Per esempio, se i gruppi sono “scuola elementare”, “università” e “casa di riposo”, allora il gruppo contiene molta informazione sull’età. Se invece i gruppi sono “maglia rossa”, “maglia blu” e “maglia verde”, e il colore della maglia è indipendente dall’età, allora la struttura non aiuta a prevedere l’età.
La relazione con la divergenza di Kullback-Leibler
La mutua informazione può essere interpretata in modo ancora più profondo attraverso la divergenza di Kullback-Leibler, o divergenza KL. La KL confronta due distribuzioni di probabilità. Date due distribuzioni \(p(x)\) e \(q(x)\), la divergenza di KL è:
Essa misura quanto la distribuzione \(q\) sia inadeguata come modello quando la distribuzione vera è \(p\). Non è una distanza ordinaria, perché in generale:
Tuttavia ha un significato informativo molto chiaro: misura il costo medio, in bit se usiamo il logaritmo in base 2, di descrivere dati generati da \(p\) usando un modello \(q\).
Nel nostro caso, per ogni gruppo \(g\), possiamo confrontare la distribuzione interna al gruppo:
con la distribuzione generale della popolazione:
La divergenza KL del gruppo \(g\) rispetto alla popolazione totale è:
Questa quantità misura quanto il gruppo \(g\) è statisticamente specifico rispetto alla variabile \(X\). Se la distribuzione dell’età dentro il gruppo è uguale alla distribuzione dell’età nella popolazione totale, allora la KL è zero. Se invece il gruppo ha un profilo di età molto diverso dalla popolazione generale, la KL è positiva e cresce al crescere della differenza.
La mutua informazione come media di divergenze KL
La relazione centrale è:
In parole:
La mutua informazione è la divergenza media, pesata per la frequenza dei gruppi, tra la distribuzione di \(X\) dentro ciascun gruppo e la distribuzione di \(X\) nella popolazione totale.
Questa formula chiarisce molto bene il significato della mutua informazione. Non misura semplicemente se ci sono tanti gruppi o pochi gruppi. Misura quanto, in media, i gruppi sono diversi dalla popolazione totale rispetto alla variabile osservata.
Se tutti i gruppi assomigliano alla popolazione generale, allora ogni termine:
è uguale a zero, e quindi anche la mutua informazione è zero.
Se invece alcuni gruppi hanno distribuzioni molto diverse dalla distribuzione generale, quei gruppi contribuiscono positivamente alla mutua informazione. Il contributo di ciascun gruppo è pesato da \(p(g)\), cioè dalla sua dimensione relativa nella popolazione.
Dimostrazione del collegamento tra mutua informazione e KL
Partiamo dalla media delle divergenze KL:
Sostituendo la definizione della KL:
Separiamo il logaritmo:
Il primo termine è:
perché:
Per il secondo termine osserviamo che:
quindi:
Ma:
Pertanto:
Combinando i termini otteniamo:
cioè:
Esempio numerico con la KL
Riprendiamo l’esempio della popolazione totale bilanciata:
Consideriamo il gruppo \(g_1\), nel quale:
La divergenza KL tra la distribuzione del gruppo e la distribuzione generale è:
cioè:
Poiché:
abbiamo:
Anche il gruppo \(g_2\), con distribuzione opposta \(0.2,0.8\), ha la stessa divergenza KL rispetto alla popolazione totale:
Se i due gruppi hanno la stessa dimensione:
allora:
Questo è lo stesso valore ottenuto tramite la differenza tra entropia iniziale ed entropia condizionata:
Interpretazione intuitiva della KL nel caso dei gruppi
La divergenza KL del singolo gruppo può essere letta come una misura della sua peculiarità rispetto alla popolazione totale. Se un gruppo ha la stessa distribuzione dell’età della popolazione complessiva, esso non è peculiare rispetto all’età. Guardare quel gruppo non cambia la nostra rappresentazione probabilistica.
Se invece un gruppo contiene molti più giovani della media, oppure molti più anziani della media, allora quel gruppo ha un profilo specifico. La sua distribuzione \(p(x\mid g)\) si allontana da \(p(x)\), e la KL aumenta.
| Distribuzione nel gruppo | Distribuzione generale | Interpretazione | KL |
|---|---|---|---|
| 50% giovani, 50% anziani | 50% giovani, 50% anziani | Il gruppo è uguale alla popolazione totale | 0 bit |
| 80% giovani, 20% anziani | 50% giovani, 50% anziani | Il gruppo è moderatamente specifico | 0.278 bit |
| 100% giovani, 0% anziani | 50% giovani, 50% anziani | Il gruppo è completamente specifico | 1 bit |
Nel caso estremo in cui il gruppo contenga solo giovani:
mentre la popolazione totale è:
la KL è:
Il termine con probabilità zero viene considerato nullo, secondo la convenzione standard \(0\log 0 = 0\).
Mutua informazione come misura della struttura rispetto a una variabile
Possiamo ora riassumere il significato concettuale. Una popolazione può essere divisa in gruppi in molti modi. Ma non ogni divisione è informativa rispetto a una certa variabile. La mutua informazione misura esattamente quanto la divisione in gruppi sia informativa rispetto alla variabile osservata.
Nel caso dell’età, \(I(X;G)\) misura quanto la conoscenza del gruppo riduce l’incertezza sull’età. Equivalentemente, misura quanto i profili di età dei gruppi differiscono, in media, dal profilo di età della popolazione complessiva.
Se la struttura è irrilevante rispetto all’età, allora:
e quindi:
Se invece la struttura separa la popolazione in gruppi con età caratteristiche, allora:
per almeno alcuni gruppi, e la mutua informazione diventa positiva.
Quanto più i gruppi sono distinti rispetto a \(X\), tanto più l’entropia condizionata \(H(X\mid G)\) diminuisce. Di conseguenza, tanto più cresce:
Una lettura ancora più intuitiva
Immaginiamo di dover indovinare l’età di una persona estratta a caso. Se non sappiamo nulla, usiamo la distribuzione generale della popolazione. Questa distribuzione può essere molto incerta: la persona potrebbe essere giovane o anziana con uguale probabilità.
Ora qualcuno ci dice a quale gruppo appartiene quella persona. Se il gruppo è informativo, aggiorniamo le nostre probabilità. Per esempio, se il gruppo è una scuola elementare, assegneremo alta probabilità a età basse. Se il gruppo è una casa di riposo, assegneremo alta probabilità a età elevate.
Questo aggiornamento riduce l’incertezza. La mutua informazione misura la riduzione media di incertezza prodotta da questo aggiornamento.
Vista attraverso la KL, la stessa idea diventa: per ogni gruppo, confrontiamo la distribuzione aggiornata \(p(x\mid g)\) con la distribuzione di partenza \(p(x)\). Se l’aggiornamento è piccolo, il gruppo dice poco. Se l’aggiornamento è grande, il gruppo dice molto. La mutua informazione è la media di questi aggiornamenti su tutti i gruppi.
Conclusione
L’entropia \(H(X)\) misura l’incertezza iniziale sulla variabile \(X\), per esempio l’età di un individuo scelto a caso nella popolazione. L’entropia condizionata \(H(X\mid G)\) misura l’incertezza residua dopo aver conosciuto il gruppo di appartenenza. La differenza tra queste due quantità è la mutua informazione:
Essa quantifica quanta incertezza su \(X\) viene rimossa dalla conoscenza della struttura \(G\).
La stessa quantità può essere scritta come media pesata di divergenze KL:
Questa seconda forma mostra che la mutua informazione misura quanto, in media, le distribuzioni interne ai gruppi differiscono dalla distribuzione complessiva. Dunque una popolazione è strutturata rispetto alla variabile \(X\) quando i gruppi hanno profili diversi di \(X\). In tal caso, conoscere il gruppo permette di ridurre l’incertezza sulla variabile.
La struttura, quindi, non è informativa semplicemente perché esistono gruppi. È informativa quando i gruppi portano differenze statistiche rilevanti. La mutua informazione è precisamente la misura di questa rilevanza.
Alvise Giubelli – HumAI.it©