La mutua informazione
La mutua informazione è una delle nozioni più profonde della teoria dell’informazione. A prima vista può sembrare solo una formula tra probabilità, logaritmi ed entropie; in realtà esprime un’idea molto semplice e potente: quanto sapere qualcosa su una variabile riduce l’incertezza su un’altra. Se due variabili casuali non hanno nulla da dirsi, la loro mutua informazione è nulla. Se invece una contiene molta informazione sull’altra, la mutua informazione è grande. In questo senso essa misura la parte di informazione condivisa tra due sorgenti.
Ma questa descrizione intuitiva, da sola, non basta. Per comprendere davvero la mutua informazione bisogna vederla da più punti di vista: come riduzione di entropia, come distanza dall’indipendenza, come intersezione informativa in una rappresentazione geometrica intuitiva, e come quantità operativa che compare nei problemi di comunicazione, inferenza e apprendimento automatico.
1. Entropia: il punto di partenza
Per capire la mutua informazione bisogna partire dall’entropia di Shannon. Se \(X\) è una variabile casuale discreta con distribuzione \(p(x)\), la sua entropia è
Questa quantità misura l’incertezza media associata a \(X\). Più \(X\) è imprevedibile, più \(H(X)\) è grande. L’entropia non descrive il valore che \(X\) assumerà, ma la difficoltà media di predirlo prima di osservarlo.
Se introduciamo una seconda variabile casuale \(Y\), possiamo chiederci quanta incertezza resti su \(X\) dopo aver osservato \(Y\). Questa quantità è l’entropia condizionata:
Se conoscere \(Y\) aiuta molto a prevedere \(X\), allora \(H(X\mid Y)\) sarà piccola; se invece \(Y\) non aiuta affatto, \(H(X\mid Y)\) sarà quasi uguale a \(H(X)\). L’entropia condizionata rappresenta l’incertezza residua.
2. Definizione della mutua informazione
La mutua informazione tra \(X\) e \(Y\), indicata con \(I(X;Y)\), è definita come
Questa formula si legge così: la mutua informazione è l’incertezza iniziale su \(X\) meno l’incertezza che rimane su \(X\) dopo aver osservato \(Y\). In altre parole, è quanta informazione \(Y\) fornisce su \(X\).
Per simmetria vale anche
Questa uguaglianza mostra che la mutua informazione non privilegia una variabile rispetto all’altra: misura la quantità di informazione condivisa, non una freccia causale.
3. Dalla definizione alla formula fondamentale
A partire dalla definizione si può ricavare la formula più celebre:
Il passaggio si ottiene scrivendo esplicitamente le due entropie e raccogliendo i termini:
Riscrivendo il primo termine come somma doppia (poiché \(\sum_y p(x,y)=p(x)\)) e usando \(p(x\mid y)=p(x,y)/p(y)\), si ottiene la forma compatta sopra. Questa formula confronta la distribuzione congiunta reale \(p(x,y)\) con quella che si avrebbe se \(X\) e \(Y\) fossero indipendenti, cioè \(p(x)p(y)\).
4. Le forme equivalenti della mutua informazione
La mutua informazione può essere scritta in diversi modi equivalenti:
La prima e la seconda forma parlano di riduzione dell’incertezza; la terza suggerisce un’interpretazione geometrica; l’ultima evidenzia la deviazione dall’indipendenza.
5. Perché la mutua informazione misura la dipendenza
Se \(X\) e \(Y\) sono indipendenti, allora \(p(x,y)=p(x)p(y)\) per ogni coppia \((x,y)\), quindi \(\log\frac{p(x,y)}{p(x)p(y)} = \log 1 = 0\) e di conseguenza \(I(X;Y)=0\).
Viceversa, se \(I(X;Y)=0\), la distribuzione congiunta coincide con il prodotto delle marginali. La mutua informazione è dunque una misura completa della dipendenza statistica: non coglie solo dipendenze lineari, come la correlazione, ma qualunque forma di dipendenza.
6. La connessione con la divergenza di Kullback-Leibler
La formula precedente può essere letta come una divergenza di Kullback-Leibler:
Da qui segue subito una proprietà essenziale: \(I(X;Y)\geq 0\). La mutua informazione non può mai essere negativa. Può non aiutare (e allora vale zero), oppure può aiutare (e allora è positiva).
7. L’interpretazione geometrica: utile ma metaforica
Un modo efficace per pensare alla mutua informazione è usare una metafora simile ai diagrammi di Venn. Se immaginiamo \(H(X)\) e \(H(Y)\) come insiemi con una parte condivisa \(S\):
Da cui segue immediatamente:
La mutua informazione rappresenta la parte condivisa tra le due sorgenti. Questa immagine va intesa come metafora strutturale, non come geometria letterale: le entropie non sono aree fisiche, ma quantità che soddisfano identità formali analoghe a quelle degli insiemi.
8. Chain rule e senso profondo di \(H(X,Y)\)
Un’altra identità fondamentale è la regola della catena:
Il significato è limpido: per conoscere la coppia \((X,Y)\), posso prima conoscere \(X\) e poi aggiungere soltanto la parte di \(Y\) che non era già contenuta in \(X\). La mutua informazione è dunque ciò che non bisogna più imparare su una variabile una volta nota l’altra.
9. Esempio 1 — Indipendenza totale
Sia \(X\) il risultato di una moneta equa e \(Y\) un’altra moneta indipendente. Allora \(H(X)=H(Y)=1\) bit, ma \(H(X\mid Y)=H(X)=1\), quindi:
Due sorgenti realmente indipendenti non condividono alcuna informazione.
10. Esempio 2 — Copia perfetta
Supponiamo ora che \(X\) sia una moneta equa e che \(Y=X\). Allora \(H(X\mid Y)=0\) e \(H(X,Y)=1\), perciò:
Tutta l’informazione di \(X\) è condivisa con \(Y\), e viceversa.
11. Esempio 3 — Copia rumorosa
Sia \(X\sim\mathrm{Bernoulli}(1/2)\) e sia \(Y\) una copia rumorosa di \(X\) con probabilità di errore \(\varepsilon\). Si ottiene:
- Se \(\varepsilon=0\), il canale è perfetto e \(I(X;Y)=1\).
- Se \(\varepsilon=\tfrac12\), l’uscita è puro rumore e \(I(X;Y)=0\).
- Per valori intermedi, \(Y\) trasmette solo una parte dell’informazione di \(X\).
12. Esempio 4 — Dipendenza non lineare
Considera una variabile simmetrica \(X\) e poni \(Y=X^2\). Qui \(Y\) dipende chiaramente da \(X\), ma la correlazione lineare può essere nulla, perché i valori positivi e negativi di \(X\) si compensano. Eppure conoscere \(Y\) restringe fortemente ciò che \(X\) può essere (se \(Y=9\), allora \(X\in\{3,-3\}\)), quindi la mutua informazione è positiva. Questo mostra che \(I(X;Y)\) misura la dipendenza in quanto tale, non solo quella lineare.
13. La versione continua
Per variabili continue la definizione resta analoga:
La mutua informazione conserva le proprietà essenziali anche nel continuo: resta non negativa e vale zero se e solo se c’è indipendenza, a differenza dell’entropia differenziale che può essere negativa.
14. Una lettura ancora più intuitiva
In un singolo esito \((x,y)\), la quantità \(\log\frac{p(x,y)}{p(x)p(y)}\) misura quanto quella coppia è più o meno frequente di quanto ci si aspetterebbe sotto indipendenza. La mutua informazione è la media pesata di questa quantità rispetto a \(p(x,y)\): misura quanto il mondo reale si discosta dal mondo ipotetico in cui \(X\) e \(Y\) non hanno alcun legame.
15. Proprietà fondamentali
- Non negatività \(I(X;Y)\ge 0\)
- Simmetria \(I(X;Y)=I(Y;X)\)
- Zero ↔ indipendenza \(I(X;Y)=0 \iff p(x,y)=p(x)p(y)\)
- Limitazione superiore \(I(X;Y)\le \min\{H(X),H(Y)\}\)
L’ultima proprietà è naturale: una variabile non può dirti su un’altra più informazione di quanta quella variabile contenga complessivamente.
16. Perché la mutua informazione è così importante
La teoria di Shannon nasce dal problema della comunicazione. Se \(X\) è il messaggio inviato e \(Y\) quello ricevuto, allora \(I(X;Y)\) misura quanta informazione dell’input sopravvive nell’output. La capacità di un canale rumoroso è:
Questa formula dice che la velocità massima con cui si può comunicare in modo affidabile è determinata dalla massima mutua informazione ottenibile tra input e output del canale.
17. Mutua informazione e apprendimento nei modelli di AI
Nei modelli di intelligenza artificiale la mutua informazione compare in molti modi. Una rappresentazione interna \(T\) è utile se conserva informazione rilevante sul bersaglio \(Y\): si vuole che \(I(T;Y)\) sia grande. Ma allo stesso tempo non dovrebbe conservare ogni dettaglio dell’input \(X\). Questo porta all’idea dell’Information Bottleneck:
La tensione è profonda e naturale: un modello che memorizza tutto l’input può sovra-adattarsi; uno che comprime troppo perde il segnale utile. La mutua informazione fornisce un linguaggio matematico per esprimere il compromesso tra compressione e predittività.
Nel contrastive learning si cercano rappresentazioni che mantengano l’informazione comune tra due viste dello stesso oggetto o tra il presente e il futuro di una sequenza, lasciando cadere ciò che è puramente accidentale. Molti obiettivi moderni si possono leggere come approssimazioni o limiti inferiori di quantità mutual-information-like.
18. Mutua informazione, effective information e il quadro di Erik Hoel
La teoria di Erik Hoel sulla causal emergence si colloca in continuità con la teoria dell’informazione, specializzandola al problema causale. L’idea di fondo è che un modello macroscopico, ottenuto tramite coarse-graining degli stati, possa essere più informativo causalmente del modello microscopico da cui deriva.
L’effective information di Hoel può essere letta come una mutua informazione tra interventi sulle cause e distribuzione degli effetti, valutata sotto una distribuzione di intervento massimamente entropica:
Hoel mostra che questa effective information si scompone come:
Il determinism misura quanto le transizioni del sistema sono nette e poco rumorose. La degeneracy misura quanto cause diverse confluiscono negli stessi effetti. Un buon livello macroscopico può aumentare questa dipendenza causale effettiva: raggruppando microstati rumorosi in macrostati appropriati, si può diminuire l’indeterminazione e ridurre la convergenza degenerativa di molte cause sugli stessi effetti.
La tesi della causal emergence non è che il macro aggiunga misteriosamente informazione, ma che una descrizione a scala più alta può essere più efficace nel rendere esplicita l’informazione causalmente rilevante.
Conclusione
La mutua informazione è una nozione unificante. Nasce come misura della riduzione d’incertezza, si esprime come confronto con l’indipendenza, si lascia intuire come parte condivisa tra due sorgenti, e diventa operativamente decisiva nei problemi di comunicazione, inferenza, apprendimento e modellizzazione causale. La sua forza sta nel fatto che non dipende da un particolare modello lineare o da una particolare applicazione: misura una relazione informativa nel senso più generale.
Quando diciamo che due variabili “si informano a vicenda”, la mutua informazione ci dice precisamente quanto. Quando diciamo che una rappresentazione è buona, spesso intendiamo che conserva la mutua informazione giusta. Per questo la mutua informazione non è solo una formula elegante: è uno dei modi più profondi per pensare il rapporto tra struttura, dipendenza, conoscenza e previsione.
Ulteriori approfondimenti sulla teoria di Erik Hoel
Alvise Giubelli – HumAI.it©