Entropia, struttura della popolazione e mutua informazione

Entropia, struttura della popolazione e mutua informazione

Supponiamo di avere una popolazione e di osservare su ciascun individuo una variabile aleatoria \(X\). Per rendere l’esempio concreto, immaginiamo che \(X\) rappresenti l’età, oppure una versione discretizzata dell’età: giovane, adulto, anziano; oppure fasce come 0-20, 21-40, 41-60, oltre 60. Alla variabile \(X\) associamo una distribuzione di probabilità \(p(x)\), che descrive quanto è probabile osservare ciascun valore \(x\) nella popolazione complessiva.

Se non sappiamo nulla di un individuo estratto a caso dalla popolazione, la nostra incertezza sull’età è descritta dall’entropia di Shannon:

\[ H(X) = -\sum_x p(x)\log_2 p(x) \]

L’entropia \(H(X)\) misura il grado medio di incertezza associato alla variabile \(X\). Se tutti gli individui hanno la stessa età, l’incertezza è nulla. Se invece le età sono distribuite in modo molto vario e bilanciato tra molte possibilità, l’incertezza è maggiore.

Ora introduciamo una struttura nella popolazione. Supponiamo cioè che la popolazione sia divisa in gruppi:

\[ G \in \{g_1, g_2, g_3, \ldots\} \]

Per esempio, i gruppi potrebbero essere scuole, quartieri, professioni, reparti aziendali, classi sociali, comunità, fasce di reddito, regioni geografiche o qualunque altra partizione della popolazione. Una volta introdotto il gruppo \(G\), possiamo studiare non solo la distribuzione generale \(p(x)\), ma anche la distribuzione condizionata:

\[ p(x \mid g) \]

Questa è la distribuzione della variabile \(X\) all’interno del gruppo \(g\). Nel caso dell’età, \(p(x\mid g)\) dice qual è la distribuzione delle età tra gli individui appartenenti a quel gruppo.

L’incertezza prima e dopo aver conosciuto il gruppo

Prima di sapere a quale gruppo appartiene un individuo, la nostra incertezza sull’età è \(H(X)\). Dopo aver saputo che l’individuo appartiene al gruppo \(g\), la nostra incertezza non è più calcolata usando la distribuzione generale \(p(x)\), ma usando la distribuzione specifica del gruppo:

\[ H(X\mid G=g) = -\sum_x p(x\mid g)\log_2 p(x\mid g) \]

Poiché l’individuo può appartenere a gruppi diversi, l’incertezza media residua dopo aver conosciuto il gruppo è l’entropia condizionata:

\[ H(X\mid G) = \sum_g p(g) H(X\mid G=g) \]

Sviluppando la formula:

\[ H(X\mid G) = -\sum_g p(g)\sum_x p(x\mid g)\log_2 p(x\mid g) \]

Questa quantità misura quanta incertezza resta su \(X\), in media, una volta noto il gruppo di appartenenza.

L’idea fondamentale è questa: se i gruppi sono davvero informativi rispetto all’età, allora conoscere il gruppo riduce l’incertezza sull’età. Se invece i gruppi non hanno alcuna relazione con l’età, conoscere il gruppo non cambia nulla.

Definizione di mutua informazione

La mutua informazione tra \(X\) e \(G\) è definita come:

\[ I(X;G) = H(X) – H(X\mid G) \]

Essa misura quanta incertezza su \(X\) viene eliminata, in media, quando conosciamo il valore di \(G\). Nel nostro esempio:

\(I(X;G)\) misura quanto sapere il gruppo di appartenenza di una persona ci aiuta a prevedere la sua età.

Se conoscere il gruppo non riduce affatto l’incertezza, allora:

\[ H(X\mid G) = H(X) \]

e dunque:

\[ I(X;G)=0 \]

In questo caso la struttura dei gruppi non contiene informazione sulla variabile \(X\).

Se invece conoscere il gruppo elimina completamente l’incertezza su \(X\), allora:

\[ H(X\mid G)=0 \]

e quindi:

\[ I(X;G)=H(X) \]

In questo caso la struttura dei gruppi spiega completamente la variabilità di \(X\).

Un primo esempio: nessuna struttura informativa

Consideriamo una popolazione in cui l’età sia semplificata in due sole categorie: giovane e anziano. Supponiamo che nella popolazione totale le due categorie siano ugualmente probabili:

Valore di \(X\) \(p(x)\)
Giovane 0.5
Anziano 0.5

L’entropia è:

\[ H(X) = -0.5\log_2(0.5)-0.5\log_2(0.5) = 1 \text{ bit} \]

Ora dividiamo la popolazione in due gruppi \(g_1\) e \(g_2\), ma immaginiamo che in entrambi i gruppi la distribuzione dell’età sia la stessa della popolazione totale:

Gruppo Giovani Anziani
\(g_1\) 0.5 0.5
\(g_2\) 0.5 0.5

Sapere che una persona appartiene a \(g_1\) non cambia le probabilità: resta 50% giovane e 50% anziana. Lo stesso vale per \(g_2\). Dunque:

\[ H(X\mid G=g_1)=1 \qquad H(X\mid G=g_2)=1 \]

Se i due gruppi hanno uguale peso, \(p(g_1)=p(g_2)=0.5\), allora:

\[ H(X\mid G)=0.5\cdot 1+0.5\cdot 1=1 \]

Quindi:

\[ I(X;G)=H(X)-H(X\mid G)=1-1=0 \]

La divisione in gruppi esiste, ma non è una struttura informativa rispetto all’età. È una partizione formale, non una struttura che riduce l’incertezza.

Secondo esempio: struttura perfettamente informativa

Consideriamo ancora la stessa popolazione totale:

Valore di \(X\) \(p(x)\)
Giovane 0.5
Anziano 0.5

Perciò:

\[ H(X)=1 \text{ bit} \]

Ora però supponiamo che i gruppi siano così composti:

Gruppo Giovani Anziani
\(g_1\) 1 0
\(g_2\) 0 1

Se so che una persona appartiene a \(g_1\), so con certezza che è giovane. Se so che appartiene a \(g_2\), so con certezza che è anziana. Quindi:

\[ H(X\mid G=g_1)=0 \qquad H(X\mid G=g_2)=0 \]

Di conseguenza:

\[ H(X\mid G)=0 \]

e:

\[ I(X;G)=H(X)-H(X\mid G)=1-0=1 \text{ bit} \]

In questo caso la struttura della popolazione riduce completamente l’incertezza. L’età non è più incerta dopo aver conosciuto il gruppo. La struttura è massimamente informativa rispetto a \(X\).

Terzo esempio: struttura parzialmente informativa

Consideriamo ancora una popolazione complessivamente bilanciata:

\[ p(\text{giovane})=0.5, \qquad p(\text{anziano})=0.5 \]

dunque:

\[ H(X)=1 \text{ bit} \]

Ora immaginiamo due gruppi ugualmente numerosi, ma con composizioni differenti:

Gruppo Giovani Anziani
\(g_1\) 0.8 0.2
\(g_2\) 0.2 0.8

Dentro ciascun gruppo c’è ancora incertezza, perché nessun gruppo è composto da una sola categoria. Però l’incertezza è minore rispetto a quella della popolazione generale.

L’entropia di una distribuzione \(0.8,0.2\) è:

\[ H(0.8,0.2) = -0.8\log_2(0.8)-0.2\log_2(0.2) \approx 0.722 \text{ bit} \]

Anche il gruppo \(g_2\), avendo distribuzione \(0.2,0.8\), ha la stessa entropia:

\[ H(X\mid G=g_1) = H(X\mid G=g_2) \approx 0.722 \]

Se i due gruppi hanno peso uguale:

\[ H(X\mid G) = 0.5\cdot 0.722+0.5\cdot 0.722 = 0.722 \]

La mutua informazione è quindi:

\[ I(X;G)=1-0.722=0.278 \text{ bit} \]

Il gruppo riduce l’incertezza, ma non la elimina. Sapere che una persona è in \(g_1\) rende più probabile che sia giovane; sapere che è in \(g_2\) rende più probabile che sia anziana. Tuttavia resta una quota di incertezza, perché in entrambi i gruppi sono presenti entrambe le categorie.

Più struttura significa più mutua informazione?

Bisogna essere precisi. Avere più gruppi, o avere una partizione più fine della popolazione, non significa automaticamente avere più informazione su \(X\). La mutua informazione aumenta solo se la struttura dei gruppi è associata a differenze reali nella distribuzione di \(X\).

Se ogni gruppo ha la stessa distribuzione della popolazione totale, allora per ogni \(g\):

\[ p(x\mid g)=p(x) \]

In questo caso conoscere il gruppo non modifica le probabilità di \(X\), e dunque:

\[ I(X;G)=0 \]

Invece, se i gruppi hanno distribuzioni molto diverse dalla distribuzione generale, allora conoscere \(G\) cambia in modo significativo le probabilità assegnate ai diversi valori di \(X\). In tal caso \(H(X\mid G)\) diminuisce e \(I(X;G)\) aumenta.

La popolazione è strutturata rispetto a \(X\) quando i gruppi non sono semplici etichette, ma corrispondono a profili diversi della variabile \(X\).

Per esempio, se i gruppi sono “scuola elementare”, “università” e “casa di riposo”, allora il gruppo contiene molta informazione sull’età. Se invece i gruppi sono “maglia rossa”, “maglia blu” e “maglia verde”, e il colore della maglia è indipendente dall’età, allora la struttura non aiuta a prevedere l’età.

La relazione con la divergenza di Kullback-Leibler

La mutua informazione può essere interpretata in modo ancora più profondo attraverso la divergenza di Kullback-Leibler, o divergenza KL. La KL confronta due distribuzioni di probabilità. Date due distribuzioni \(p(x)\) e \(q(x)\), la divergenza di KL è:

\[ D_{KL}(p\|q) = \sum_x p(x)\log_2\frac{p(x)}{q(x)} \]

Essa misura quanto la distribuzione \(q\) sia inadeguata come modello quando la distribuzione vera è \(p\). Non è una distanza ordinaria, perché in generale:

\[ D_{KL}(p\|q)\neq D_{KL}(q\|p) \]

Tuttavia ha un significato informativo molto chiaro: misura il costo medio, in bit se usiamo il logaritmo in base 2, di descrivere dati generati da \(p\) usando un modello \(q\).

Nel nostro caso, per ogni gruppo \(g\), possiamo confrontare la distribuzione interna al gruppo:

\[ p(x\mid g) \]

con la distribuzione generale della popolazione:

\[ p(x) \]

La divergenza KL del gruppo \(g\) rispetto alla popolazione totale è:

\[ D_{KL}\bigl(p(X\mid g)\|p(X)\bigr) = \sum_x p(x\mid g)\log_2 \frac{p(x\mid g)}{p(x)} \]

Questa quantità misura quanto il gruppo \(g\) è statisticamente specifico rispetto alla variabile \(X\). Se la distribuzione dell’età dentro il gruppo è uguale alla distribuzione dell’età nella popolazione totale, allora la KL è zero. Se invece il gruppo ha un profilo di età molto diverso dalla popolazione generale, la KL è positiva e cresce al crescere della differenza.

La mutua informazione come media di divergenze KL

La relazione centrale è:

\[ I(X;G) = \sum_g p(g) D_{KL}\bigl(p(X\mid g)\|p(X)\bigr) \]

In parole:

La mutua informazione è la divergenza media, pesata per la frequenza dei gruppi, tra la distribuzione di \(X\) dentro ciascun gruppo e la distribuzione di \(X\) nella popolazione totale.

Questa formula chiarisce molto bene il significato della mutua informazione. Non misura semplicemente se ci sono tanti gruppi o pochi gruppi. Misura quanto, in media, i gruppi sono diversi dalla popolazione totale rispetto alla variabile osservata.

Se tutti i gruppi assomigliano alla popolazione generale, allora ogni termine:

\[ D_{KL}\bigl(p(X\mid g)\|p(X)\bigr) \]

è uguale a zero, e quindi anche la mutua informazione è zero.

Se invece alcuni gruppi hanno distribuzioni molto diverse dalla distribuzione generale, quei gruppi contribuiscono positivamente alla mutua informazione. Il contributo di ciascun gruppo è pesato da \(p(g)\), cioè dalla sua dimensione relativa nella popolazione.

Dimostrazione del collegamento tra mutua informazione e KL

Partiamo dalla media delle divergenze KL:

\[ \sum_g p(g) D_{KL}\bigl(p(X\mid g)\|p(X)\bigr) \]

Sostituendo la definizione della KL:

\[ = \sum_g p(g) \sum_x p(x\mid g) \log_2\frac{p(x\mid g)}{p(x)} \]

Separiamo il logaritmo:

\[ = \sum_g p(g) \sum_x p(x\mid g) \log_2 p(x\mid g) – \sum_g p(g) \sum_x p(x\mid g) \log_2 p(x) \]

Il primo termine è:

\[ -H(X\mid G) \]

perché:

\[ H(X\mid G) = -\sum_g p(g) \sum_x p(x\mid g) \log_2 p(x\mid g) \]

Per il secondo termine osserviamo che:

\[ \sum_g p(g)p(x\mid g)=p(x) \]

quindi:

\[ \sum_g p(g) \sum_x p(x\mid g)\log_2 p(x) = \sum_x p(x)\log_2 p(x) \]

Ma:

\[ H(X) = -\sum_x p(x)\log_2 p(x) \]

Pertanto:

\[ -\sum_x p(x)\log_2 p(x) = H(X) \]

Combinando i termini otteniamo:

\[ \sum_g p(g) D_{KL}\bigl(p(X\mid g)\|p(X)\bigr) = H(X)-H(X\mid G) \]

cioè:

\[ I(X;G) = \sum_g p(g) D_{KL}\bigl(p(X\mid g)\|p(X)\bigr) \]

Esempio numerico con la KL

Riprendiamo l’esempio della popolazione totale bilanciata:

\[ p(\text{giovane})=0.5, \qquad p(\text{anziano})=0.5 \]

Consideriamo il gruppo \(g_1\), nel quale:

\[ p(\text{giovane}\mid g_1)=0.8, \qquad p(\text{anziano}\mid g_1)=0.2 \]

La divergenza KL tra la distribuzione del gruppo e la distribuzione generale è:

\[ D_{KL}\bigl(p(X\mid g_1)\|p(X)\bigr) = 0.8\log_2\frac{0.8}{0.5} + 0.2\log_2\frac{0.2}{0.5} \]

cioè:

\[ = 0.8\log_2(1.6) + 0.2\log_2(0.4) \]

Poiché:

\[ \log_2(1.6)\approx 0.678 \qquad \log_2(0.4)\approx -1.322 \]

abbiamo:

\[ D_{KL} \approx 0.8\cdot 0.678 + 0.2\cdot (-1.322) = 0.542-0.264 = 0.278 \text{ bit} \]

Anche il gruppo \(g_2\), con distribuzione opposta \(0.2,0.8\), ha la stessa divergenza KL rispetto alla popolazione totale:

\[ D_{KL}\bigl(p(X\mid g_2)\|p(X)\bigr) \approx 0.278 \text{ bit} \]

Se i due gruppi hanno la stessa dimensione:

\[ p(g_1)=p(g_2)=0.5 \]

allora:

\[ I(X;G) = 0.5\cdot 0.278 + 0.5\cdot 0.278 = 0.278 \text{ bit} \]

Questo è lo stesso valore ottenuto tramite la differenza tra entropia iniziale ed entropia condizionata:

\[ I(X;G)=H(X)-H(X\mid G)=1-0.722=0.278 \]

Interpretazione intuitiva della KL nel caso dei gruppi

La divergenza KL del singolo gruppo può essere letta come una misura della sua peculiarità rispetto alla popolazione totale. Se un gruppo ha la stessa distribuzione dell’età della popolazione complessiva, esso non è peculiare rispetto all’età. Guardare quel gruppo non cambia la nostra rappresentazione probabilistica.

Se invece un gruppo contiene molti più giovani della media, oppure molti più anziani della media, allora quel gruppo ha un profilo specifico. La sua distribuzione \(p(x\mid g)\) si allontana da \(p(x)\), e la KL aumenta.

Distribuzione nel gruppo Distribuzione generale Interpretazione KL
50% giovani, 50% anziani 50% giovani, 50% anziani Il gruppo è uguale alla popolazione totale 0 bit
80% giovani, 20% anziani 50% giovani, 50% anziani Il gruppo è moderatamente specifico 0.278 bit
100% giovani, 0% anziani 50% giovani, 50% anziani Il gruppo è completamente specifico 1 bit

Nel caso estremo in cui il gruppo contenga solo giovani:

\[ p(X\mid g)=(1,0) \]

mentre la popolazione totale è:

\[ p(X)=(0.5,0.5) \]

la KL è:

\[ D_{KL}((1,0)\|(0.5,0.5)) = 1\cdot\log_2\frac{1}{0.5} + 0\cdot\log_2\frac{0}{0.5} = 1 \]

Il termine con probabilità zero viene considerato nullo, secondo la convenzione standard \(0\log 0 = 0\).

Mutua informazione come misura della struttura rispetto a una variabile

Possiamo ora riassumere il significato concettuale. Una popolazione può essere divisa in gruppi in molti modi. Ma non ogni divisione è informativa rispetto a una certa variabile. La mutua informazione misura esattamente quanto la divisione in gruppi sia informativa rispetto alla variabile osservata.

Nel caso dell’età, \(I(X;G)\) misura quanto la conoscenza del gruppo riduce l’incertezza sull’età. Equivalentemente, misura quanto i profili di età dei gruppi differiscono, in media, dal profilo di età della popolazione complessiva.

Se la struttura è irrilevante rispetto all’età, allora:

\[ p(x\mid g)=p(x) \quad \text{per ogni } g \]

e quindi:

\[ I(X;G)=0 \]

Se invece la struttura separa la popolazione in gruppi con età caratteristiche, allora:

\[ p(x\mid g) \neq p(x) \]

per almeno alcuni gruppi, e la mutua informazione diventa positiva.

Quanto più i gruppi sono distinti rispetto a \(X\), tanto più l’entropia condizionata \(H(X\mid G)\) diminuisce. Di conseguenza, tanto più cresce:

\[ I(X;G)=H(X)-H(X\mid G) \]

Una lettura ancora più intuitiva

Immaginiamo di dover indovinare l’età di una persona estratta a caso. Se non sappiamo nulla, usiamo la distribuzione generale della popolazione. Questa distribuzione può essere molto incerta: la persona potrebbe essere giovane o anziana con uguale probabilità.

Ora qualcuno ci dice a quale gruppo appartiene quella persona. Se il gruppo è informativo, aggiorniamo le nostre probabilità. Per esempio, se il gruppo è una scuola elementare, assegneremo alta probabilità a età basse. Se il gruppo è una casa di riposo, assegneremo alta probabilità a età elevate.

Questo aggiornamento riduce l’incertezza. La mutua informazione misura la riduzione media di incertezza prodotta da questo aggiornamento.

Vista attraverso la KL, la stessa idea diventa: per ogni gruppo, confrontiamo la distribuzione aggiornata \(p(x\mid g)\) con la distribuzione di partenza \(p(x)\). Se l’aggiornamento è piccolo, il gruppo dice poco. Se l’aggiornamento è grande, il gruppo dice molto. La mutua informazione è la media di questi aggiornamenti su tutti i gruppi.

Conclusione

L’entropia \(H(X)\) misura l’incertezza iniziale sulla variabile \(X\), per esempio l’età di un individuo scelto a caso nella popolazione. L’entropia condizionata \(H(X\mid G)\) misura l’incertezza residua dopo aver conosciuto il gruppo di appartenenza. La differenza tra queste due quantità è la mutua informazione:

\[ I(X;G)=H(X)-H(X\mid G) \]

Essa quantifica quanta incertezza su \(X\) viene rimossa dalla conoscenza della struttura \(G\).

La stessa quantità può essere scritta come media pesata di divergenze KL:

\[ I(X;G) = \sum_g p(g) D_{KL}\bigl(p(X\mid g)\|p(X)\bigr) \]

Questa seconda forma mostra che la mutua informazione misura quanto, in media, le distribuzioni interne ai gruppi differiscono dalla distribuzione complessiva. Dunque una popolazione è strutturata rispetto alla variabile \(X\) quando i gruppi hanno profili diversi di \(X\). In tal caso, conoscere il gruppo permette di ridurre l’incertezza sulla variabile.

La struttura, quindi, non è informativa semplicemente perché esistono gruppi. È informativa quando i gruppi portano differenze statistiche rilevanti. La mutua informazione è precisamente la misura di questa rilevanza.

Alvise Giubelli – HumAI.it©