Informazione di Shannon e informazione di Fisher
Informazione di Shannon e informazione di Fisher: analogie, differenze, verosimiglianza, divergenza di Kullback-Leibler ed evoluzione
La parola informazione compare in matematica, statistica, teoria dei segnali, fisica e biologia evolutiva con significati strettamente connessi ma non identici. Due nozioni fondamentali sono l’informazione nel senso di Shannon e l’informazione nel senso di Fisher. La prima riguarda soprattutto l’incertezza di una distribuzione probabilistica e la quantità media di sorpresa associata agli esiti di una variabile aleatoria. La seconda riguarda invece la sensibilità di una famiglia di distribuzioni rispetto a un parametro, e misura quanto bene valori vicini del parametro possano essere distinti sulla base delle osservazioni.
Queste due nozioni sono diverse, ma non estranee. Esse si congiungono in modo naturale attraverso la divergenza di Kullback-Leibler, che fornisce una misura della separazione tra distribuzioni probabilistiche e ha un duplice ruolo: da un lato appartiene al quadro concettuale dell’informazione di Shannon, dall’altro, nel limite locale, genera la metrica di Fisher. Nel caso in cui il parametro sia il tempo, come accade in molte dinamiche evolutive, la Fisher information smette di essere soltanto una misura di precisione inferenziale e diventa anche una misura della velocità con cui una distribuzione cambia. È proprio qui che si apre il ponte con la biologia evolutiva, con la Price equation e con il modello di replicator dynamics.
L’obiettivo di questo saggio è mostrare con rigore e chiarezza il significato delle due nozioni di informazione, le loro analogie e differenze, il ruolo della funzione di verosimiglianza in statistica, la struttura della score function nella Fisher information, la relazione con la divergenza KL, e infine l’interpretazione evolutiva nel caso in cui il parametro sia il tempo.
1. Che cosa significa “informazione” in probabilità e statistica
Quando si parla di informazione in un contesto probabilistico non si intende, in primo luogo, il significato semantico di un messaggio, bensì una quantità matematica che misura uno o più dei seguenti aspetti:
- quanto una distribuzione probabilistica è incerta o dispersa;
- quanto un esito osservato è sorprendente;
- quanto bene due distribuzioni consentono di distinguere alternative;
- quanto una famiglia di distribuzioni cambia al variare di un parametro;
- quanto bene i dati permettono di inferire il valore di un parametro ignoto.
Non esiste dunque una sola definizione di informazione valida per ogni scopo. Esistono invece misure diverse, adatte a domande diverse. L’informazione di Shannon risponde soprattutto alla domanda:
quanto è incerta una variabile aleatoria prima dell’osservazione?
L’informazione di Fisher risponde invece alla domanda:
quanto è sensibile la distribuzione dei dati rispetto a un parametro, e quindi quanto bene quel parametro può essere distinto o stimato?
Le due idee sono parenti strette, ma non coincidono. Per vederlo bene conviene definire le quantità con precisione.
2. Informazione di Shannon: sorpresa, entropia, incertezza
Sia \(X\) una variabile aleatoria discreta con distribuzione \(p(x)\). La quantità
\[ I_{\mathrm{self}}(x) = -\log p(x) \]si chiama spesso self-information o contenuto informativo del singolo esito \(x\). Essa esprime l’idea intuitiva che un evento raro è più informativo di un evento quasi certo. Se \(p(x)\) è piccolo, allora \(-\log p(x)\) è grande: l’evento sorprende di più. Se \(p(x)\) è vicino a \(1\), l’evento aggiunge poca informazione.
L’entropia di Shannon è la media di questa sorpresa:
\[ H(X) = – \sum_x p(x)\log p(x). \]Nel caso continuo, per una densità \(p(x)\), si considera la differential entropy
\[ h(X)= -\int p(x)\log p(x)\,dx, \]anche se, dal punto di vista concettuale e tecnico, il caso discreto è più stabile e intuitivamente più trasparente.
2.1 Interpretazione intuitiva
L’entropia di Shannon misura l’incertezza media della sorgente. Se gli esiti sono quasi equiprobabili, l’incertezza è maggiore. Se invece un esito domina, l’incertezza è minore. In altre parole, Shannon guarda alla struttura interna di una singola distribuzione e quantifica quanto essa sia dispersa, imprevedibile o ricca di possibili esiti.
Si noti un punto essenziale: nell’entropia di Shannon non compare alcun parametro rispetto al quale la distribuzione stia cambiando. L’oggetto è una distribuzione \(p\), non una famiglia parametrica \(\{p_\theta\}\).
3. Informazione di Fisher: sensibilità locale rispetto a un parametro
Supponiamo ora di avere una famiglia di distribuzioni \(p(x\mid \theta)\), dipendente da un parametro \(\theta\). Qui il problema tipico non è descrivere l’incertezza di \(X\) in sé, ma capire quanto le osservazioni possano informare sul valore di \(\theta\).
La funzione fondamentale è la score function:
\[ U_\theta(x)=\frac{\partial}{\partial \theta}\log p(x\mid \theta). \]La Fisher information è definita da
\[ I(\theta)=\mathbb{E}_\theta\!\left[\left(\frac{\partial}{\partial \theta}\log p(X\mid \theta)\right)^2\right]. \]Sotto opportune ipotesi di regolarità, essa è anche uguale a
\[ I(\theta)= – \mathbb{E}_\theta\!\left[\frac{\partial^2}{\partial \theta^2}\log p(X\mid \theta)\right]. \]3.1 Cosa misura la score function
La score function misura quanto la log-densità del dato \(x\) cambia quando si modifica infinitesimamente il parametro \(\theta\). Se la score è grande in valore assoluto, allora il dato \(x\) è molto sensibile a piccole variazioni del parametro. La Fisher information ne misura il quadrato medio sotto il modello.
Perciò la Fisher information non misura l’incertezza della variabile \(X\), ma la distinguibilità locale di modelli parametrizzati da \(\theta\). Se valori vicini di \(\theta\) generano distribuzioni molto diverse, allora la Fisher information è grande; se invece generano distribuzioni quasi indistinguibili, è piccola.
3.2 Ruolo inferenziale
La Fisher information ha un ruolo centrale nell’inferenza statistica perché regola la precisione con cui un parametro può essere stimato. Essa compare, per esempio, nel limite di Cramér-Rao:
\[ \mathrm{Var}(\hat{\theta}) \ge \frac{1}{I(\theta)} \]per stimatori non distorti in un modello a un parametro. L’idea è chiara: maggiore è l’informazione di Fisher, più stretta può essere la precisione della stima.
4. La funzione di verosimiglianza e la differenza con la score
In statistica è fondamentale distinguere tra probabilità e verosimiglianza. Se \(x\) è il dato osservato e \(\theta\) è il parametro, la quantità \(p(x\mid \theta)\) può essere letta in due modi:
- come funzione di \(x\), a \(\theta\) fissato, è una probabilità o una densità;
- come funzione di \(\theta\), a \(x\) fissato, è la funzione di verosimiglianza.
La likelihood si scrive
\[ L(\theta\mid x)=p(x\mid \theta). \]Il suo ruolo è concentrato nell’idea seguente: una volta osservato il dato \(x\), tutta l’evidenza statistica sul parametro è contenuta nel modo in cui \(L(\theta\mid x)\) varia con \(\theta\). Se la likelihood ha un picco netto, il dato discrimina bene fra valori del parametro. Se è piatta, discrimina poco.
La score function non è la likelihood stessa, ma la derivata della log-likelihood:
\[ U_\theta(x)=\frac{\partial}{\partial \theta}\log L(\theta\mid x). \]Essa descrive la pendenza locale della log-verosimiglianza. La Fisher information prende il quadrato medio di questa pendenza. Quindi:
- la likelihood descrive l’evidenza sul parametro in modo globale;
- la score descrive la variazione locale della log-likelihood;
- la Fisher information misura la curvatura o sensibilità locale media della log-likelihood.
Vicino a un massimo \(\hat{\theta}\), si ha spesso l’approssimazione quadratica
\[ \log L(\theta\mid x)\approx \log L(\hat{\theta}\mid x)-\frac{1}{2}J(\hat{\theta})(\theta-\hat{\theta})^2, \]dove \(J(\hat{\theta})\) è l’informazione osservata. Prendendone il valore medio teorico si ottiene la Fisher information. La curvatura locale della log-likelihood spiega quindi in senso preciso perché la Fisher information è una misura di “informatività” rispetto al parametro.
5. Analogie e differenze tra Shannon e Fisher
5.1 Analogie
- Entrambe sono quantità costruite a partire da distribuzioni probabilistiche.
- Entrambe meritano il nome di “informazione” perché quantificano, in modi diversi, la capacità di distinguere alternative o ridurre incertezza.
- Entrambe sono collegate al logaritmo delle probabilità o densità.
- Entrambe hanno una lettura geometrica, soprattutto quando vengono collegate alla divergenza di Kullback-Leibler.
5.2 Differenze
- L’entropia di Shannon riguarda una singola distribuzione \(p\).
- La Fisher information riguarda una famiglia parametrica \(p(x\mid \theta)\).
- Shannon misura l’incertezza interna di una distribuzione.
- Fisher misura la sensibilità locale rispetto a un parametro.
- Shannon risponde alla domanda “quanto è imprevedibile \(X\)?”
- Fisher risponde alla domanda “quanto bene posso distinguere o stimare \(\theta\)?”
Le formule sono quindi diverse perché diversi sono gli oggetti misurati. In Shannon compare la media di \(-\log p(x)\). In Fisher compare la media del quadrato della derivata di \(\log p(x\mid \theta)\) rispetto al parametro. La prima è una quantità statica relativa a una distribuzione; la seconda è una quantità differenziale relativa a un cambiamento infinitesimo.
6. La divergenza di Kullback-Leibler come ponte tra Shannon e Fisher
La divergenza di Kullback-Leibler tra due distribuzioni \(p\) e \(q\) è definita, nel caso discreto, da
\[ D_{\mathrm{KL}}(p\|q)=\sum_x p(x)\log\frac{p(x)}{q(x)}. \]Nel caso continuo:
\[ D_{\mathrm{KL}}(p\|q)=\int p(x)\log\frac{p(x)}{q(x)}\,dx. \]La KL divergence misura quanto \(q\) sia inadeguata a rappresentare \(p\). Non è una distanza in senso metrico, perché non è simmetrica e non soddisfa in generale la disuguaglianza triangolare, ma è una misura fondamentale di separazione informativa tra distribuzioni.
6.1 Relazione con Shannon
La KL è legata all’entropia di Shannon dalla decomposizione
\[ D_{\mathrm{KL}}(p\|q)= -H(p)-\sum_x p(x)\log q(x). \]Il termine \(-\sum_x p(x)\log q(x)\) è la cross-entropy. Quindi la KL misura l’eccesso di codice medio o di sorpresa media che si paga usando \(q\) invece della distribuzione vera \(p\).
6.2 Relazione con Fisher
Ora considera una famiglia parametrica \(p_\theta(x)\). Se confrontiamo \(p_\theta\) con una distribuzione infinitesimamente vicina \(p_{\theta+d\theta}\), allora, sotto regolarità, vale l’espansione locale
\[ D_{\mathrm{KL}}(p_\theta\|p_{\theta+d\theta})= \frac{1}{2}I(\theta)\,d\theta^2 + o(d\theta^2). \]Questa formula è cruciale. Essa mostra che la Fisher information è la forma quadratica locale della divergenza KL. La KL misura la separazione globale tra due distribuzioni; la Fisher ne fornisce la versione infinitesimale. In questo senso:
- Shannon e KL appartengono al lato “globale” dell’informazione;
- Fisher appartiene al lato “locale” e differenziale.
La differenza non è quindi una frattura, ma un passaggio di scala: la KL confronta distribuzioni finite; la Fisher misura come quella separazione nasce localmente all’interno di una famiglia parametrica.
7. Il caso in cui il parametro è il tempo
Se il parametro \(\theta\) è il tempo, si ha una famiglia di distribuzioni \(p_t(x)\). Allora la Fisher information rispetto al tempo è
\[ I(t)=\int p_t(x)\left(\partial_t\log p_t(x)\right)^2 dx \]oppure, nel caso discreto,
\[ I(t)=\sum_x p_t(x)\left(\partial_t\log p_t(x)\right)^2. \]Poiché
\[ \partial_t\log p_t(x)=\frac{\dot p_t(x)}{p_t(x)}, \]segue che
\[ I(t)=\sum_x \frac{\dot p_t(x)^2}{p_t(x)}. \]A questo punto l’interpretazione cambia in modo importante. Se \(\theta\) era un parametro statico, la Fisher information misurava la precisione con cui esso poteva essere stimato. Se invece \(\theta=t\), essa misura la velocità con cui la distribuzione cambia nel tempo.
Più precisamente, \(I(t)\) misura quanto siano localmente distinguibili distribuzioni corrispondenti a tempi infinitamente vicini. Se \(I(t)\) è grande, distribuzioni a tempi \(t\) e \(t+dt\) sono separabili in modo più netto. Se è piccola, il sistema cambia lentamente e tempi vicini sono difficili da distinguere.
Questo non significa che “il campione ha tanta informazione” in senso assoluto o semantico. Significa che la mappa
\[ t\mapsto p_t \]ha una grande derivata nello spazio delle distribuzioni, e quindi il parametro tempo lascia una traccia osservabile forte nella distribuzione.
8. Dinamica evolutiva: tipi, caratteri, dati
Per applicare queste idee alla biologia evolutiva bisogna distinguere con precisione tre nozioni: tipi, caratteri e dati.
8.1 Tipi
Un tipo è una classe o categoria di individui che il modello distingue. Può essere:
- un allele;
- un genotipo;
- un fenotipo discreto;
- una strategia in un modello di teoria dei giochi evolutiva;
- più in generale, una categoria riproduttivamente o dinamicamente rilevante.
Se i tipi sono indicizzati da \(i=1,\dots,n\), allora la loro frequenza al tempo \(t\) è
\[ p_i(t),\qquad \sum_i p_i(t)=1. \]Il vettore \(p(t)=(p_1(t),\dots,p_n(t))\) descrive lo stato composizionale della popolazione.
8.2 Caratteri
Un carattere è una quantità \(z_i\) associata al tipo \(i\). Può essere, per esempio:
- altezza media;
- numero medio di figli;
- resistenza a un antibiotico;
- fitness;
- qualunque tratto quantitativo o qualitativo codificato numericamente.
Il tipo non coincide col carattere. Il tipo è la classe; il carattere è il valore assegnato alla classe. La media del carattere nella popolazione è
\[ \bar z = \sum_i p_i z_i. \]8.3 Dati nella dinamica evolutiva
Nel contesto empirico, i dati possono essere conteggi, sequenze genetiche, osservazioni fenotipiche, eccetera. Ma nel contesto teorico della dinamica evolutiva, l’oggetto primario non è il singolo dato osservato \(x\) della statistica classica: è piuttosto la distribuzione delle frequenze dei tipi, cioè il vettore \(p(t)\).
In questo senso, nella dinamica evolutiva i “dati” su cui si ragiona sono spesso le frequenze dei tipi o la loro evoluzione temporale. È questa distribuzione che gioca il ruolo centrale analogo a quello che in statistica ha la legge \(p(x\mid \theta)\).
9. La Price equation e il ruolo dei caratteri
La Price equation è una decomposizione generale del cambiamento della media di un carattere. In una formulazione discreta standard:
\[ \Delta \bar z = \frac{\mathrm{Cov}(w,z)}{\bar w} + \frac{\mathbb{E}(w\,\Delta z)}{\bar w}. \]Qui:
- \(w_i\) è la fitness del tipo \(i\);
- \(\bar w = \sum_i p_i w_i\) è la fitness media;
- \(z_i\) è il valore del carattere del tipo \(i\);
- \(\Delta z_i\) rappresenta il cambiamento del carattere tra genitori e discendenti all’interno della linea del tipo.
L’equazione afferma che il cambiamento totale della media del carattere si scompone in:
- un termine di selezione, \(\mathrm{Cov}(w,z)/\bar w\), dovuto al fatto che tipi con valori di \(z\) differenti lasciano numeri differenti di discendenti;
- un termine di trasmissione o trasformazione, \(\mathbb{E}(w\Delta z)/\bar w\), dovuto al fatto che il carattere può cambiare lungo la trasmissione.
La Price equation è importante perché distingue nettamente il cambiamento dovuto al mutare delle frequenze dal cambiamento dovuto al mutare dei valori del carattere. Questa distinzione è essenziale per collegare la selezione naturale alla Fisher information: quest’ultima, nella sua lettura evolutiva, riguarda la parte del cambiamento che passa attraverso le frequenze.
10. Replicator dynamics
Un modello classico di dinamica evolutiva per le frequenze dei tipi è la replicator dynamics. Essa si scrive:
\[ \dot p_i = p_i(f_i-\bar f), \]dove:
- \(p_i\) è la frequenza del tipo \(i\);
- \(f_i\) è la fitness o payoff del tipo \(i\);
- \(\bar f = \sum_i p_i f_i\) è la fitness media.
Per la dimostrazione vedi Dalla Fisher information alla biologia evolutiva di Fisher e Frank
Il significato è semplice e profondo: la frequenza di un tipo cresce se la sua fitness supera la media e decresce se la sua fitness è inferiore alla media.
Dividendo per \(p_i\) si ottiene
\[ \frac{\dot p_i}{p_i}=f_i-\bar f. \]Ma il lato sinistro è anche
\[ \frac{d}{dt}\log p_i. \]Quindi:
\[ \frac{d}{dt}\log p_i = f_i-\bar f. \]Questa identità è decisiva perché connette direttamente il cambiamento logaritmico delle frequenze con lo scarto della fitness del tipo dalla fitness media.
11. Fisher information nella dinamica evolutiva
Se il parametro è il tempo e lo stato del sistema è la distribuzione dei tipi \(p_i(t)\), la Fisher information vale
\[ I(t)=\sum_i p_i(t)\left(\frac{d}{dt}\log p_i(t)\right)^2. \]Usando la replicator dynamics otteniamo
\[ \frac{d}{dt}\log p_i = f_i-\bar f. \]Sostituendo:
\[ I(t)=\sum_i p_i(f_i-\bar f)^2. \]Ma questa è precisamente la varianza della fitness nella popolazione:
\[ \mathrm{Var}(f)=\sum_i p_i(f_i-\bar f)^2. \]Dunque:
\[ I(t)=\mathrm{Var}(f). \]Questa relazione è una delle più importanti del ponte tra teoria dell’informazione e biologia evolutiva. Essa mostra che, sotto la replicator dynamics, la Fisher information rispetto al tempo coincide con la varianza della fitness.
11.1 Interpretazione
Se la varianza della fitness è alta, i tipi differiscono molto nel loro successo riproduttivo relativo. Ciò produce cambiamenti rapidi nelle frequenze e quindi una grande Fisher information rispetto al tempo. Se invece le fitness sono quasi uguali, le frequenze cambiano lentamente e la Fisher information è piccola.
In questo senso la selezione naturale può essere letta come il meccanismo che rende rapidamente distinguibili distribuzioni di popolazione a tempi vicini. La popolazione si muove nello spazio delle distribuzioni con una velocità governata proprio dalla varianza nella fitness.
Se la capacità di riproduzione differisce molto tra i tipi, la selezione favorisce quelli con fitness più alta: essi lasciano più discendenti e, se i caratteri associati a quel vantaggio sono trasmissibili, tali caratteri tendono a diffondersi. In questo modo la frequenza dei tipi più avvantaggiati cresce, mentre quella degli altri diminuisce. Se col tempo la popolazione diventa più omogenea e le differenze di fitness si riducono, allora anche la varianza della fitness cala e il cambiamento selettivo delle frequenze rallenta.
– grande differenza di fitness ⇒ grande varianza;
– grande varianza ⇒ cambiamento rapido delle frequenze;
– cambiamento rapido delle frequenze ⇒ selezione forte;
– se la selezione porta a omogeneizzazione, la varianza cala;
– se la varianza cala, anche il cambiamento rallenta.
12. Relazione con la parte selettiva della Price equation
Prendendo nella Price equation come carattere \(z_i=f_i\), oppure più in generale isolando il contributo dovuto al cambiamento di frequenze, si vede che la selezione naturale è governata da termini di covarianza o varianza.
In particolare, la parte selettiva dipende dal fatto che i tipi con fitness superiore alla media aumentano di frequenza. Questo stesso scarto \(f_i-\bar f\) è ciò che compare nella derivata logaritmica delle frequenze e quindi nella Fisher information. Ne segue che la Fisher information cattura precisamente la componente del cambiamento evolutivo dovuta alla selezione differenziale.
È importante non confondere questa relazione con un’identità universale per ogni possibile dinamica biologica. La formula
\[ I(t)=\mathrm{Var}(f) \]vale nella forma mostrata quando la dinamica è effettivamente quella replicativa e quando si considera il contributo di selezione espresso dal cambiamento delle frequenze. Se entrano in gioco mutazione, migrazione, trasformazioni dei tipi, cambiamenti ambientali o termini di trasmissione non banali, allora il cambiamento totale richiede la scomposizione alla Price equation e il termine selettivo va isolato dai restanti contributi.
13. Cosa si intende davvero per “informazione” in tutto questo quadro
A questo punto possiamo rispondere con maggiore precisione alla domanda generale: quando si parla di informazione, si intende una misura di quanto una distribuzione probabilistica sia capace di distinguere alternative, ridurre incertezza, o qualcosa di diverso?
La risposta più rigorosa è: dipende dal contesto e dalla nozione di informazione adottata. In particolare:
- nell’entropia di Shannon, l’informazione riguarda la sorpresa degli esiti e l’incertezza media della distribuzione;
- nella KL divergence, l’informazione riguarda la distinguibilità tra distribuzioni;
- nella Fisher information, l’informazione riguarda la distinguibilità locale di modelli vicini lungo un parametro.
Queste tre letture non sono in contraddizione. Sono tre modi compatibili di formalizzare un’idea generale:
una distribuzione probabilistica contiene “informazione” nella misura in cui struttura l’incertezza e rende possibile distinguere alternative, sia tra esiti, sia tra modelli, sia tra valori di un parametro.
Shannon mette l’accento sull’incertezza degli esiti. Fisher mette l’accento sulla risoluzione parametrica. La KL mette l’accento sulla separazione tra modelli. Nel caso evolutivo, quando il parametro è il tempo, questa separazione diventa una misura della velocità del cambiamento selettivo.
14. Sintesi conclusiva
L’informazione di Shannon e l’informazione di Fisher sono due nozioni differenti ma profondamente connesse. L’entropia di Shannon misura l’incertezza media di una distribuzione e la sorpresa associata ai suoi esiti. La Fisher information misura la sensibilità locale di una famiglia di distribuzioni rispetto a un parametro e quindi la distinguibilità locale di modelli vicini.
La funzione di verosimiglianza svolge in statistica il ruolo di contenere tutta l’evidenza sui parametri alla luce dei dati osservati. La score function è la derivata della log-likelihood e la Fisher information ne misura la variabilità quadratica media, fornendo così una nozione precisa di quanto i dati siano informativi su un parametro.
La divergenza di Kullback-Leibler costituisce il ponte naturale tra il quadro di Shannon e quello di Fisher: essa misura la separazione tra distribuzioni in modo globale, mentre la Fisher emerge come sua approssimazione quadratica locale.
Quando il parametro è il tempo, la Fisher information misura la velocità con cui una distribuzione cambia. Nella biologia evolutiva, lo stato rilevante è la distribuzione delle frequenze dei tipi; i tipi sono categorie della popolazione, i caratteri sono quantità associate a tali categorie, e i “dati” dinamici sono precisamente le frequenze dei tipi nel tempo. La Price equation separa il cambiamento medio di un carattere nella componente dovuta alla selezione e in quella dovuta alla trasmissione. Nel caso della replicator dynamics, la derivata logaritmica delle frequenze è data dallo scarto della fitness dalla media, e la Fisher information rispetto al tempo coincide con la varianza della fitness:
\[ I(t)=\sum_i p_i\left(\frac{d}{dt}\log p_i\right)^2 = \sum_i p_i(f_i-\bar f)^2 = \mathrm{Var}(f). \]Questa identità mostra in modo limpido che la parte selettiva del cambiamento evolutivo può essere letta come una forma di informazione: non nel senso di contenuto semantico, ma nel senso preciso di una misura della capacità della distribuzione di distinguere stati vicini e di registrare, attraverso il cambiamento delle frequenze, differenze di successo riproduttivo.
La nozione di informazione, dunque, non va pensata come univoca, ma come una famiglia di concetti collegati: informazione come incertezza, informazione come sorpresa, informazione come separazione tra distribuzioni, informazione come sensibilità parametrica, e infine, nel quadro evolutivo, informazione come struttura quantitativa del cambiamento selettivo.
Vedi anche
Alvise Giubelli – HumAI.it©