La distinzione come forza: informazione, struttura e covarianza

La distinzione come forza: informazione, struttura e covarianza

Teoria dell’informazione  ·  Selezione  ·  Covarianza strutturale

Riconoscere una struttura nell’ambiente è un atto di acquisizione di informazione. Quell’informazione si traduce matematicamente in covarianze inter-blocco che prima erano zero. La connessione tra entropia di Shannon, divergenza di Kullback-Leibler e l’equazione di Price gerarchica non è una metafora: è un’identità.

Saggio di teoria formale  ·  Terzo di una serie sull’equazione di Price e le strutture emergenti
L’informazione, nella definizione di Shannon, è capacità di distinzione: un messaggio informa nella misura in cui riduce l’incertezza, cioè nella misura in cui distingue tra stati del mondo che prima erano indistinguibili. Una partizione $\Pi$ su uno spazio $\Omega$ è precisamente un atto di distinzione: separa $\Omega$ in blocchi, rendendo visibili differenze che nella struttura piatta erano aggregate. Il teorema centrale di questo saggio è che l’informazione mutua $\operatorname{I}(\Pi; W)$ tra la struttura e il payoff è proporzionale — sotto condizioni precise — alla covarianza inter-blocco $\operatorname{Cov}_\Pi(\bar{w}_B, \bar{z}_B)$ dell’equazione di Price. Acquisire informazione sulla struttura dell’ambiente è, matematicamente, generare quella covarianza.

Informazione come capacità di distinzione

Shannon definisce l’informazione in modo sorprendentemente austero: non come contenuto semantico, non come verità, ma come riduzione di incertezza. L’entropia $\operatorname{H}(X)$ di una variabile aleatoria discreta $X$ con distribuzione $p$ è:

$$\operatorname{H}(X) \;=\; -\sum_{x} p(x)\,\log_2 p(x)$$

Essa misura quanti bit sono necessari in media per descrivere un’osservazione di $X$ — ovvero quanto $X$ sia imprevedibile, quanto i suoi valori siano indistinguibili a priori. Un’entropia alta significa che tutti i valori sono circa ugualmente probabili: nessuno si distingue dagli altri. Un’entropia bassa significa che alcuni valori sono molto più probabili: c’è una struttura.

La nozione duale è l’informazione mutua. Date due variabili $X$ e $Y$, l’informazione mutua $\operatorname{I}(X; Y)$ misura quanto conoscere $X$ riduce l’incertezza su $Y$:

Vedi anche l’articolo La mutua informazione

Informazione mutua $$\operatorname{I}(X;\,Y) \;=\; \operatorname{H}(Y) \;-\; \operatorname{H}(Y \mid X) \;=\; \sum_{x,y} p(x,y)\,\log \frac{p(x,y)}{p(x)\,p(y)}$$

$\operatorname{I}(X;Y) \geq 0$ sempre, con uguaglianza se e solo se $X$ e $Y$ sono indipendenti. È simmetrica: $\operatorname{I}(X;Y) = \operatorname{I}(Y;X)$.

Crucialmente, $\operatorname{I}(X;Y) = 0$ quando $X$ e $Y$ sono indipendenti — quando conoscere $X$ non aiuta a distinguere i valori di $Y$. $\operatorname{I}(X;Y) > 0$ quando c’è dipendenza: $X$ discrimina tra i valori di $Y$.

Partizioni come atti di distinzione

Una partizione $\Pi = \{B_1, \ldots, B_k\}$ di $\Omega$ induce una variabile aleatoria discreta $B : \Omega \to \{1,\ldots,k\}$ che assegna a ogni elemento il blocco di appartenenza. L’entropia di $B$:

$$\operatorname{H}(\Pi) \;=\; \operatorname{H}(B) \;=\; -\sum_{j=1}^k p_j \log p_j, \qquad p_j = \P(B = j)$$

misura quanto la partizione sia bilanciata — quanta incertezza resti sul blocco di un elemento scelto a caso. Ma la quantità decisiva per i nostri scopi è l’informazione mutua tra la partizione e il payoff $W$:

$$\operatorname{I}(\Pi;\, W) \;=\; \operatorname{H}(W) \;-\; \operatorname{H}(W \mid B)$$

Questa misura quanto conoscere il blocco di appartenenza di un agente riduca l’incertezza sul suo payoff. Se $\operatorname{I}(\Pi; W) = 0$, la struttura è irrilevante: i payoff sono distribuiti allo stesso modo in ogni blocco, e la partizione non rivela nulla di utile. Se $\operatorname{I}(\Pi; W) > 0$, la struttura è informativa: i blocchi si distinguono per payoff, e questa distinzione è esattamente la covarianza inter-blocco che cercavamo.

L’equivalenza fondamentale

Riconoscere la struttura $\Pi$ equivale a misurare $\operatorname{I}(\Pi; W)$. Una struttura con $\operatorname{I}(\Pi; W) = 0$ non aggiunge nulla all’analisi piatta. Una struttura con $\operatorname{I}(\Pi; W) > 0$ genera distinzioni tra blocchi — e quelle distinzioni si manifestano esattamente come covarianza inter-blocco nel framework di Price. La domanda «quanto è informativa questa struttura?» e la domanda «quanto è grande il termine inter-blocco di Price?» hanno la stessa risposta.

✦ ✦ ✦

Il teorema di connessione: da $\operatorname{I}(\Pi; W)$ a $\operatorname{Cov}_\Pi$

Rendiamo precisa la connessione tra informazione mutua e covarianza strutturale. Lavoreremo prima nel caso gaussiano, dove le formule sono esplicite e la connessione è diretta, poi nella forma generale.

Il caso gaussiano

Supponiamo che il payoff $W$ e il tratto $Z$ siano congiuntamente normali all’interno di ciascun blocco $B_j$, con medie $(\bar{w}_j, \bar{z}_j)$ e matrice di covarianza intra-blocco comune $\Sigma$. La distribuzione marginale su tutti i blocchi è una mistura di gaussiane.

L’informazione mutua tra la variabile di blocco $B$ e il payoff $W$ in questa mistura vale:

$$\operatorname{I}(B;\, W) \;=\; \operatorname{H}(W) \;-\; \operatorname{H}(W \mid B)$$

Il termine $\operatorname{H}(W \mid B) = \frac{1}{2}\log(2\pi e\,\sigma^2_w)$ è l’entropia intra-blocco comune (non dipende da $j$ per ipotesi). Il termine $\operatorname{H}(W)$ è l’entropia della mistura marginale, che è maggiore dell’entropia intra-blocco in misura proporzionale alla varianza tra le medie di blocco. In particolare, per una mistura equipesata ($p_j = 1/k$):

Connessione informazione — varianza inter-blocco (caso gaussiano) $$\operatorname{I}(B;\, W) \;\approx\; \frac{1}{2}\log\!\left(1 + \frac{\operatorname{Var}_j(\bar{w}_j)}{\sigma^2_w}\right) \;\approx\; \frac{\operatorname{Var}_j(\bar{w}_j)}{2\sigma^2_w \ln 2}$$

L’approssimazione è esatta al primo ordine per $\operatorname{Var}_j(\bar{w}_j) \ll \sigma^2_w$. La varianza inter-blocco del payoff $\operatorname{Var}_j(\bar{w}_j)$ è il quadrato di ciò che in Price compare come covarianza: misura quanto le medie di blocco differiscano tra loro.

In modo analogo, l’informazione mutua congiunta $\operatorname{I}(B; W, Z)$ tra blocchi e la coppia (payoff, tratto) è connessa alla matrice di covarianza inter-blocco $\Sigma_{\text{inter}} = \operatorname{Cov}_j((\bar{w}_j, \bar{z}_j))$:

$$\operatorname{I}(B;\, W,Z) \;\approx\; \frac{1}{2\ln 2}\,\mathrm{tr}\!\left(\Sigma^{-1}_{\text{intra}}\,\Sigma_{\text{inter}}\right)$$

dove $\Sigma_{\text{intra}}$ è la matrice di covarianza intra-blocco. Il termine di Price $\operatorname{Cov}_j(\bar{w}_j, \bar{z}_j)$ è esattamente l’elemento fuori-diagonale di $\Sigma_{\text{inter}}$. Dunque:

Teorema di connessione (caso gaussiano) $$\operatorname{Cov}_j(\bar{w}_j,\, \bar{z}_j) \;=\; \sigma_{wz}^{\text{intra}} \;+\; \frac{\sigma_w^2 \sigma_z^2 – (\sigma_{wz}^{\text{intra}})^2}{\sigma_{wz}^{\text{intra}}} \left(e^{2\ln 2 \cdot \operatorname{I}(B;W,Z)} – 1\right)^{1/2} \cdot \operatorname{sgn}(\Delta\bar{w}\,\Delta\bar{z})$$

In forma qualitativa: $\operatorname{Cov}_j(\bar{w}_j, \bar{z}_j)$ è una funzione strettamente crescente di $\operatorname{I}(B; W, Z)$. Più è alta l’informazione mutua tra la struttura e la coppia (payoff, tratto), più grande è il termine inter-blocco di Price.

La forma generale: divergenza KL e covarianza

La connessione più profonda e generale non passa per il caso gaussiano ma per la divergenza di Kullback-Leibler. La KL-divergenza tra due distribuzioni $p$ e $q$ è:

$$\operatorname{D_{KL}}(p \,\|\, q) \;=\; \sum_x p(x)\,\log\frac{p(x)}{q(x)} \;\geq\; 0$$

con uguaglianza solo se $p = q$. Essa misura quanto $p$ e $q$ siano distinguibili: una KL alta significa che chi conosce $p$ può distinguere facilmente tra le due distribuzioni; una KL bassa significa che le distribuzioni sono quasi indistinguibili.

Ora: l’informazione mutua è la KL-divergenza tra la distribuzione congiunta e il prodotto delle marginali:

$$\operatorname{I}(X;\,Y) \;=\; \operatorname{D_{KL}}\!\bigl(p_{XY} \,\|\, p_X \otimes p_Y\bigr)$$

Quindi $\operatorname{I}(\Pi; W) > 0$ equivale a dire che la distribuzione congiunta $(B, W)$ è distinguibile dal prodotto delle sue marginali — ovvero che conoscere il blocco cambia la distribuzione attesa del payoff. Questo è precisamente la condizione per cui la struttura $\Pi$ rivela informazione su $W$, e questa informazione è la sorgente della covarianza inter-blocco.

Lemma di equivalenza generale

Siano $B$ la variabile di blocco indotta da $\Pi$, $W$ il payoff, $Z$ il tratto. Allora:

$$\operatorname{I}(\Pi;\, W) \;=\; 0 \;\iff\; \operatorname{Var}_j(\bar{w}_j) \;=\; 0 \;\iff\; \operatorname{Cov}_j(\bar{w}_j,\, \bar{z}_j) \;=\; 0 \quad \forall\, z$$

e dualmente:

$$\operatorname{I}(\Pi;\, W) \;>\; 0 \;\iff\; \exists\, z : \operatorname{Cov}_j(\bar{w}_j,\, \bar{z}_j) \;\neq\; 0$$

La struttura è informativa sul payoff se e solo se le medie di blocco del payoff variano tra i blocchi — e questa variazione è la sorgente di ogni covarianza inter-blocco non nulla.

Dimostrazione del lemma

$(\Rightarrow)$ Se $\operatorname{I}(\Pi; W) = 0$, allora $W \perp B$, cioè $p(W \mid B = j) = p(W)$ per ogni $j$. In particolare $\operatorname{E}[W \mid B = j] = \operatorname{E}[W]$ per ogni $j$, quindi $\bar{w}_j = \bar{w}$ costante in $j$, e dunque $\operatorname{Var}_j(\bar{w}_j) = 0$. Poiché $\operatorname{Cov}_j(\bar{w}_j, \bar{z}_j) \leq \sqrt{\operatorname{Var}_j(\bar{w}_j)\cdot\operatorname{Var}_j(\bar{z}_j)} = 0$, segue $\operatorname{Cov}_j(\bar{w}_j, \bar{z}_j) = 0$. $\square$
$(\Leftarrow)$ Se $\operatorname{Var}_j(\bar{w}_j) > 0$, esistono almeno due blocchi $j_1, j_2$ con $\bar{w}_{j_1} \neq \bar{w}_{j_2}$. Questo implica $p(W \mid B = j_1) \neq p(W \mid B = j_2)$ (le distribuzioni condizionali hanno medie diverse), e quindi $p(W, B) \neq p(W)p(B)$, ovvero $\operatorname{I}(\Pi; W) > 0$. $\square$
✦ ✦ ✦

La catena fondamentale: informazione → distinzione → covarianza → selezione

Possiamo ora enunciare la catena completa che connette la teoria dell’informazione all’equazione di Price. Ogni freccia è un’implicazione matematica precisa.

Acquisizione di Informazione
$\operatorname{I}(\Pi; W) > 0$
Genera Distinzione
$\operatorname{Var}_j(\bar{w}_j) > 0$
Produce Covarianza
$\operatorname{Cov}_j(\bar{w}_j, \bar{z}_j)$
Determina Selezione
$\bar{w}\,\Delta\bar{z} \neq 0$

La catena si legge in entrambe le direzioni. Da sinistra a destra: acquisire informazione sulla struttura dell’ambiente genera distinzioni tra blocchi, che si manifestano come covarianza inter-blocco, che determina il cambiamento nella frequenza del tratto. Da destra a sinistra: se osserviamo un cambiamento evolutivo inaspettato — un tratto che si diffonde contro la logica della selezione individuale — dobbiamo cercare quale struttura informativa, non ancora riconosciuta, sta generando quella covarianza.

Informazione mutua e riduzione dell’incertezza sui payoff

C’è un modo particolarmente illuminante di scrivere la connessione, usando la decomposizione dell’entropia. L’entropia del payoff si decompone rispetto alla struttura $\Pi$ come:

$$\operatorname{H}(W) \;=\; \underbrace{\operatorname{H}(W \mid B)}_{\text{incertezza residua intra-blocco}} + \underbrace{\operatorname{I}(\Pi;\, W)}_{\text{riduzione per la struttura}}$$

Questa è la decomposizione duale di quella di Price. Mentre Price decompone la covarianza in un termine inter-blocco e uno intra-blocco, Shannon decompone l’entropia in un termine intra-blocco (incertezza residua dopo aver conosciuto il blocco) e un termine di guadagno informativo (quanto la struttura riduce l’incertezza totale). Le due decomposizioni sono duale: l’una misura la varianza spiegata dalla struttura, l’altra misura l’incertezza rimossa dalla struttura.

Dualità Price — Shannon $$\underbrace{\operatorname{Cov}(w,z)}_{\text{covarianza totale}} = \underbrace{\operatorname{Cov}_\Pi(\bar{w}_B, \bar{z}_B)}_{\substack{\text{spiegato dalla}\\\text{struttura}}} + \underbrace{\E_B[\operatorname{Cov}(w,z \mid B)]}_{\substack{\text{residuo}\\\text{intra-blocco}}}\quad \longleftrightarrow \quad \underbrace{\operatorname{H}(W)}_{\text{incertezza totale}} = \underbrace{\operatorname{I}(\Pi; W)}_{\substack{\text{rimosso dalla}\\\text{struttura}}} + \underbrace{\operatorname{H}(W \mid B)}_{\substack{\text{residuo}\\\text{intra-blocco}}}$$

A sinistra la decomposizione di Price, a destra quella di Shannon. Entrambe partizionano una quantità globale in un termine «tra blocchi» e uno «dentro i blocchi». La covarianza inter-blocco di Price e l’informazione mutua di Shannon misurano la stessa cosa da due angolazioni complementari.

✦ ✦ ✦

KL-divergenza, fitness logaritmica e selezione naturale

La connessione più profonda tra teoria dell’informazione e selezione non passa per la covarianza lineare ma per la fitness logaritmica e la KL-divergenza. Questo è il risultato di Frank (2012) e, nella sua radice, di Kullback stesso.

Crescita log-ottimale e KL-divergenza

Consideriamo una popolazione di tipi $i = 1, \ldots, n$ con frequenze $q_i$ alla generazione $t$ e fitness $w_i$. Le frequenze alla generazione $t+1$ sono:

$$q’_i \;=\; \frac{w_i\, q_i}{\bar{w}}$$

Il tasso di crescita della popolazione è $\bar{w}$. Ma la quantità informativamente rilevante è il tasso di crescita del log-fitness medio — la media geometrica, che governa la crescita a lungo termine di una popolazione in ambiente variabile:

$$\overline{\log w} \;=\; \sum_i q_i \log w_i$$

Frank dimostra che il cambiamento in $\overline{\log w}$ tra generazioni successive si decompone come differenza di KL-divergenze:

Teorema di Frank — selezione come KL-divergenza $$\Delta \overline{\log w} \;=\; \operatorname{D_{KL}}(q’ \,\|\, q) \;-\; \operatorname{D_{KL}}(q’ \,\|\, p^*)$$

dove $p^*_i \propto w_i q_i$ è la distribuzione ottimale (quella che massimizza il log-fitness), e $q’$ è la distribuzione dopo la selezione.

Il primo termine $\operatorname{D_{KL}}(q’ \| q)$ misura quanto la selezione ha mosso la popolazione dalla distribuzione attuale. Il secondo termine misura la distanza residua dall’ottimo. La selezione naturale riduce la KL-divergenza dalla distribuzione ottimale — è un processo di approssimazione bayesiana.

Connessione con l’equazione di Price

L’equazione di Price e il framework KL-divergenza non sono alternativi: sono la stessa cosa vista con lenti diverse. Per vederlo, scriviamo la fitness come $w_i = e^{f_i}$ (fitness log-lineare) e sviluppiamo al primo ordine:

Sviluppo al primo ordine

Con $w_i = e^{f_i} \approx 1 + f_i$ per $f_i$ piccolo, il termine di selezione di Price diventa:

$$\operatorname{Cov}(w_i, z_i) \;\approx\; \operatorname{Cov}(f_i, z_i)$$

e la KL-divergenza tra $q’$ e $q$, sviluppata al secondo ordine, è:

$$\operatorname{D_{KL}}(q’ \,\|\, q) \;=\; \sum_i q’_i \log\frac{q’_i}{q_i} \;\approx\; \frac{1}{2}\chi^2(q’, q) \;\approx\; \frac{\operatorname{Var}(w_i)}{2\bar{w}^2}$$
La velocità di selezione

La velocità con cui la selezione si muove nello spazio delle distribuzioni (in metrica KL) è proporzionale alla varianza di fitness, che è il quadrato della «intensità di selezione»:

$$\text{velocità} \;\propto\; \operatorname{Var}(w_i) \;=\; \operatorname{Var}_j(\bar{w}_j) + \E_j[\operatorname{Var}_i(w_{ij})]$$

Il primo termine è la varianza inter-blocco, il secondo è quella intra-blocco. Di nuovo la struttura di Price.

Il risultato fondamentale è questo: la velocità dell’evoluzione per selezione è misurata dalla varianza di fitness — che è la varianza inter-blocco più quella intra-blocco — e la varianza inter-blocco è non nulla se e solo se la struttura è informativa sul payoff, cioè se $\operatorname{I}(\Pi; W) > 0$. La selezione è tanto più rapida quanto più la struttura è informativa.

Selezione come inferenza bayesiana

La selezione naturale è, formalmente, un processo di inferenza bayesiana: aggiorna la distribuzione delle frequenze $q_i$ nella direzione della distribuzione ottimale $p^*$, con «velocità» proporzionale all’informazione disponibile. Ogni generazione di selezione è un passo di aggiornamento bayesiano. L’equazione di Price descrive il contenuto di ogni passo; la KL-divergenza ne misura la distanza percorsa.

In questo senso, riconoscere una nuova struttura — un nuovo livello gerarchico — equivale ad acquisire una nuova variabile latente nell’inferenza bayesiana, riducendo l’incertezza sul payoff e accelerando la convergenza verso la distribuzione ottimale.

✦ ✦ ✦

Il valore dell’informazione come covarianza emergente

Torniamo ora al punto sollevato nel saggio precedente e lo formalizziamo completamente. Avevamo scritto che il valore dell’informazione ambientale è la differenza di covarianza tra norma adattiva e strategia fissa. Ecco la derivazione rigorosa.

Setup: ambienti, strategie e informazione

  • $E \in \mathcal{E}$   variabile aleatoria che descrive lo stato dell’ambiente, con distribuzione $p(e)$
  • $Z \in \mathcal{Z}$   azione/strategia dell’agente
  • $W = f(Z, E)$   payoff, funzione dell’azione e dell’ambiente
  • $Z_0$   strategia fissa (non condizionata all’ambiente)
  • $Z^*(E)$   norma adattiva ottimale: $Z^*(e) = \arg\max_z \operatorname{E}[W \mid Z=z, E=e]$

Il teorema del valore dell’informazione

Teorema — valore dell’informazione come covarianza strutturale

Il guadagno di payoff atteso dall’usare la norma adattiva $Z^*(E)$ rispetto alla strategia fissa ottimale $Z_0^* = \arg\max_z \operatorname{E}[f(z, E)]$ è:

$$\operatorname{VoI}(\Pi_{\mathcal{E}}) \;:=\; \operatorname{E}_{E}[f(Z^*(E), E)] \;-\; f(Z_0^*, \bar{E})$$ $$= \;\operatorname{Cov}_{\Pi_{\mathcal{E}}}\!\bigl(\bar{w}_e,\; z^*(e)\bigr) \;-\; \operatorname{Cov}_{\Pi_{\mathcal{E}}}\!\bigl(\bar{w}_e,\; z_0^*\bigr)$$

Il secondo termine è zero (la strategia fissa non covaria con l’ambiente per definizione). Quindi $\operatorname{VoI} = \operatorname{Cov}_{\Pi_{\mathcal{E}}}(\bar{w}_e, z^*(e))$ — il valore dell’informazione è la covarianza inter-ambiente tra il payoff medio e la strategia adattiva.

Dimostrazione

Scriviamo il payoff atteso della norma adattiva come media su $e$:

$$\operatorname{E}[f(Z^*(E), E)] = \sum_e p(e) f(z^*(e), e) = \sum_e p(e) \bar{w}_e^* + \sum_e p(e)\operatorname{E}[f(Z^*(e),E) – \bar{w}_e^* \mid E=e]$$

Il secondo termine è zero per definizione di $\bar{w}_e^*$. Il primo termine è $\bar{w} + \operatorname{Cov}_e(\bar{w}_e^*, z^*(e))$ dove la covarianza è tra la media del payoff in ogni ambiente e la strategia scelta in quell’ambiente. La strategia fissa $Z_0^*$ dà $\operatorname{E}[f(Z_0^*, E)] = \bar{w}$. La differenza è la covarianza inter-ambiente. $\square$

Connessione con l’informazione mutua

Il teorema di Good (1967) sulla «utilità dell’informazione» afferma che il valore atteso dell’informazione perfetta sull’ambiente è:

$$\operatorname{VoI}_{\text{perfetta}} \;=\; \operatorname{E}_{E}\!\left[\max_z f(z, E)\right] – \max_z \operatorname{E}_{E}[f(z, E)]$$

Questa quantità è sempre non negativa (disuguaglianza di Jensen) e si annulla se e solo se l’azione ottimale è la stessa in tutti gli ambienti — cioè se e solo se $\operatorname{I}(\Pi_{\mathcal{E}}; W^*) = 0$, dove $W^*$ è il payoff ottimale. In forma di covarianza:

$$\operatorname{VoI}_{\text{perfetta}} \;=\; \operatorname{Cov}_{\Pi_{\mathcal{E}}}\!\bigl(\bar{w}^*_e,\; z^*(e)\bigr) \;\geq\; 0$$

con uguaglianza se la struttura ambientale non è informativa sul payoff. Questo dimostra formalmente il punto del saggio precedente: il valore dell’informazione è la covarianza inter-blocco che emerge riconoscendo la struttura, ed è zero precisamente quando quella struttura è irrilevante.

Il cerchio si chiude

Riconoscere la struttura ambientale $\Pi_{\mathcal{E}}$ significa acquisire informazione $\operatorname{I}(\Pi_{\mathcal{E}}; W) > 0$. Quella informazione genera distinzioni tra ambienti: i payoff attesi $\bar{w}_e$ variano tra i blocchi. Quella variazione è la covarianza inter-blocco $\operatorname{Cov}_{\Pi_{\mathcal{E}}}(\bar{w}_e, z^*(e))$. Quella covarianza è il valore dell’informazione, che è il guadagno di payoff rispetto all’agente non informato. L’equazione di Price, la teoria dell’informazione di Shannon e il valore dell’informazione di Good convergono sulla stessa quantità.

✦ ✦ ✦

Entropia come misura di struttura latente non ancora riconosciuta

C’è un’altra angolazione, più filosofica ma ugualmente precisa, che illumina il rapporto tra entropia e struttura. L’entropia alta di un sistema non significa che il sistema sia caotico o privo di struttura: significa che la struttura presente non è stata ancora identificata dall’osservatore.

Riduzione di entropia come identificazione di struttura

Sia $W$ una variabile di payoff con entropia $\operatorname{H}(W)$ alta. Un osservatore che non conosce alcuna struttura su $\Omega$ descrive $W$ con $\operatorname{H}(W)$ bit. Se quell’osservatore scopre una struttura $\Pi$ tale che $\operatorname{I}(\Pi; W) = \Delta H > 0$, ora descrive $W$ con soli $\operatorname{H}(W) – \Delta H$ bit condizionatamente a $\Pi$. Il guadagno di descrizione compressiva è $\Delta H$ bit.

Ma — e questo è il punto cruciale — questo guadagno descrittivo è la stessa cosa del guadagno di covarianza strutturale:

$$\Delta H \;=\; \operatorname{I}(\Pi; W) \;\propto\; \operatorname{Var}_j(\bar{w}_j) \;\propto\; \operatorname{Cov}_j(\bar{w}_j, \bar{z}_j)$$

Un agente che comprime meglio la descrizione del payoff — che trova una struttura $\Pi$ con alta $\operatorname{I}(\Pi; W)$ — è anche l’agente che può sfruttare la covarianza inter-blocco più grande. La compressione della descrizione e il vantaggio selettivo sono la stessa cosa misurata in unità diverse: bit la prima, fitness la seconda.

Il principio del minimo di descrizione e la selezione

Il principio MDL (Minimum Description Length) di Rissanen afferma che la miglior struttura per descrivere un insieme di dati è quella che comprime di più la loro descrizione. Tradotto nel framework di Price: la miglior struttura $\Pi^*$ è quella che massimizza $\operatorname{I}(\Pi; W)$ — ovvero quella che rivela la covarianza inter-blocco più grande e quindi il maggiore vantaggio selettivo. Trovare la struttura ottimale è un problema di compressione: l’evoluzione lo risolve per tentativi ed errori attraverso le generazioni; un agente razionale lo risolve costruendo modelli dell’ambiente.

Strutture annidate e gerarchia dell’informazione

Nella gerarchia di strutture $\Pi_0 \preceq \Pi_1 \preceq \cdots \preceq \Pi_k$, ogni raffinamento aggiunge informazione. L’informazione mutua è sottoadditiva rispetto al raffinamento:

$$\operatorname{I}(\Pi_{l+1}; W) \;\geq\; \operatorname{I}(\Pi_l; W)$$

con uguaglianza solo se il raffinamento da $\Pi_l$ a $\Pi_{l+1}$ non aggiunge informazione su $W$ — se i sotto-blocchi sono omogenei in payoff. Ogni livello della gerarchia di Price corrisponde a un incremento di informazione mutua: più livelli si riconoscono, più si riduce l’entropia residua del payoff, più covarianze strutturali diventano visibili.

Questo ha una conseguenza notevole: la gerarchia di Price è anche una gerarchia di compressione dell’incertezza. Il livello più fine — individui singoli — è quello con massima informazione ma massima complessità descrittiva. Il livello più grosso — un solo blocco — è quello con minima complessità ma massima entropia residua. La scelta del livello è un compromesso tra informazione acquisita e costo di descrizione: un compromesso che è il nucleo della statistica, dell’apprendimento automatico, e — suggerisce la connessione con Price — dell’evoluzione stessa.

Gerarchia di Price come gerarchia di compressione $$\underbrace{\operatorname{H}(W)}_{\text{entropia piatta}} \;=\; \underbrace{\sum_{l=1}^k \operatorname{I}(\Pi_l \setminus \Pi_{l-1};\, W)}_{\text{informazione da ogni livello}} \;+\; \underbrace{\operatorname{H}(W \mid \Pi_k)}_{\text{residuo irriducibile}}$$

Ogni termine $\operatorname{I}(\Pi_l \setminus \Pi_{l-1}; W)$ è l’informazione aggiuntiva fornita dal passare dal livello $l-1$ al livello $l$ — il «contributo informativo» del livello $l$. È la controparte informazionale del termine inter-blocco di Price a quel livello.

✦ ✦ ✦

Applicazioni: dove la distinzione genera valore

Es.
01

Il mercato finanziario come sistema di acquisizione di informazione

In un mercato efficiente alla Fama, tutti gli agenti condividono la stessa struttura informativa $\Pi$, quindi $\operatorname{I}(\Pi; W) = \operatorname{I}(\Pi_{\text{comune}}; W)$ è uguale per tutti e non esiste vantaggio competitivo. I payoff attesi sono uguali per tutti gli agenti informati allo stesso modo.

Un agente con informazione privata possiede una struttura $\Pi^* \supset \Pi_{\text{comune}}$ — più fine della struttura condivisa. Questa struttura più fine ha $\operatorname{I}(\Pi^*; W) > \operatorname{I}(\Pi_{\text{comune}}; W)$, ovvero genera una covarianza inter-blocco positiva che gli altri non vedono. Il profitto anomalo dell’insider è esattamente $\operatorname{VoI}(\Pi^*) – \operatorname{VoI}(\Pi_{\text{comune}})$ — la differenza di valore dell’informazione tra la struttura privata e quella pubblica — ed è formalmente la covarianza inter-blocco aggiuntiva che la struttura privata rivela.

La legge sull’insider trading vieta questo vantaggio; la teoria dei mercati lo misura esattamente come differenza di informazione mutua.

Es.
02

Segmentazione del mercato come raffinamento della struttura

Un’impresa che offre un prodotto unico a tutti i clienti usa la struttura piatta $\Pi_0$: non distingue tra segmenti. La covarianza inter-blocco è zero perché non ci sono blocchi. Il payoff è la media globale.

Un’impresa che segmenta il mercato in $k$ cluster — per reddito, preferenze, uso — introduce la struttura $\Pi_k$. Se $\operatorname{I}(\Pi_k; W) > 0$, i cluster si distinguono per willingness-to-pay. La discriminazione di prezzo di terzo grado è esattamente l’estrazione della covarianza inter-blocco: l’impresa cattura $\operatorname{Cov}_{\Pi_k}(\bar{w}_B, z^*(B))$ come surplus aggiuntivo, dove $z^*(B)$ è il prezzo ottimale per il segmento $B$.

Il profitto marginale della segmentazione è il valore dell’informazione del clustering: $\operatorname{VoI}(\Pi_k) – \operatorname{VoI}(\Pi_0)$. Ogni raffinamento aggiuntivo (da $k$ a $k+1$ segmenti) aggiunge informazione $\operatorname{I}(\Pi_{k+1}; W) – \operatorname{I}(\Pi_k; W)$ e profitto proporzionale — finché il costo di gestire un segmento aggiuntivo supera il suo contributo informativo.

Es.
03

Apprendimento adattivo e transfer learning

Un sistema di apprendimento automatico addestrato su un solo dominio ha imparato una struttura $\Pi_{\text{dominio}}$. Quando si confronta con un nuovo dominio, la struttura imparata può essere uninformativa: $\operatorname{I}(\Pi_{\text{dominio}}; W_{\text{nuovo}}) \approx 0$, quindi nessuna covarianza inter-blocco trasferibile, performance vicina al caso.

Il transfer learning è il tentativo di trovare una struttura $\Pi_{\text{comune}}$ che sia informativa su entrambi i domini: $\operatorname{I}(\Pi_{\text{comune}}; W_{\text{sorgente}}) > 0$ e $\operatorname{I}(\Pi_{\text{comune}}; W_{\text{target}}) > 0$. Il «trasferimento» di conoscenza è letteralmente il trasferimento di una struttura informativa da un contesto all’altro. Funziona nella misura in cui le strutture latenti dei due domini si sovrappongono — cioè nella misura in cui la partizione $\Pi_{\text{comune}}$ ha alta informazione mutua in entrambi.

Es.
04

Diagnosi medica come identificazione di struttura

Un paziente con sintomi generici appartiene alla struttura piatta: alta entropia sul payoff del trattamento $\operatorname{H}(W_{\text{trat}})$. Ogni esame diagnostico è un raffinamento della struttura: introduce una partizione $\Pi_{\text{esame}}$ sull’insieme dei possibili stati di salute. Il valore di un esame diagnostico è esattamente $\operatorname{I}(\Pi_{\text{esame}}; W_{\text{trat}})$ — quanta incertezza sul payoff del trattamento riduce — e per il teorema connette direttamente alla covarianza tra diagnosi e scelta terapeutica ottimale.

Il principio di parsimonia diagnostica — non fare esami se non cambiano la terapia — è il principio che $\operatorname{VoI}(\Pi_{\text{esame}}) = 0$ implica $\operatorname{I}(\Pi_{\text{esame}}; W_{\text{trat}}) = 0$: se tutti i risultati portano alla stessa terapia, l’esame non distingue nulla di rilevante e il suo valore è zero.

✦ ✦ ✦

Tavola delle corrispondenze tra i tre framework

Concetto Teoria dell’informazione Equazione di Price Teoria delle decisioni
Struttura su $\Omega$ $\sigma$-algebra $\mathcal{F}$, partizione $\Pi$ Livello gerarchico, raggruppamento Variabile di stato osservata
Incertezza senza struttura Entropia $\operatorname{H}(W)$ Varianza totale $\operatorname{Var}(w)$ Payoff atteso con strategia fissa
Informazione della struttura $\operatorname{I}(\Pi; W)$ $\operatorname{Var}_j(\bar{w}_j)$ (varianza inter-blocco) $\operatorname{VoI}(\Pi)$ (valore dell’informazione)
Struttura irrilevante $\operatorname{I}(\Pi; W) = 0$ $\operatorname{Cov}_j(\bar{w}_j, \bar{z}_j) = 0$ $\operatorname{VoI}(\Pi) = 0$
Struttura informativa $\operatorname{I}(\Pi; W) > 0$ $\operatorname{Cov}_j(\bar{w}_j, \bar{z}_j) \neq 0$ $\operatorname{VoI}(\Pi) > 0$
Gerarchia di strutture Catena di Markov $\Pi_0 \preceq \cdots \preceq \Pi_k$ Equazione di Price gerarchica Raffinamento sequenziale della politica
Residuo irriducibile $\operatorname{H}(W \mid \Pi_k)$ $\E[\operatorname{Cov}(w,z \mid B_k)]$ (intra-blocco fine) Incertezza fondamentale dell’ambiente
Distanza dall’ottimo $\operatorname{D_{KL}}(q’ \| p^*)$ $\Delta\bar{z}$ residuo Regret atteso rispetto all’ottimale
Processo di convergenza Aggiornamento bayesiano Selezione naturale iterata Apprendimento per rinforzo
✦ ✦ ✦

Conclusioni: la distinzione come atto fondativo

La connessione che abbiamo tracciato non è una metafora. È un’identità matematica: la covarianza inter-blocco dell’equazione di Price è non nulla se e solo se l’informazione mutua tra la struttura e il payoff è positiva. Riconoscere una struttura è acquisire informazione. Acquisire informazione è generare covarianza. Generare covarianza è creare vantaggio selettivo.

Questo unifica tre tradizioni intellettuali che si sono sviluppate in modo quasi indipendente. Shannon (1948) costruisce la teoria dell’informazione come misura della distinzione tra stati. Price (1970) costruisce la teoria della selezione multilivello come misura della covarianza tra struttura e payoff. Good (1967) e Blackwell (1953) costruiscono la teoria del valore dell’informazione come misura del guadagno di payoff dall’acquisire distinzioni. Le tre misure — $\operatorname{I}(\Pi; W)$, $\operatorname{Cov}_j(\bar{w}_j, \bar{z}_j)$, $\operatorname{VoI}(\Pi)$ — sono facce diverse dello stesso oggetto matematico.

La conseguenza pratica è netta. Quando un agente — biologico, economico, computazionale — non riesce a sfruttare un vantaggio potenziale, spesso la causa è l’assenza di una struttura informativa adeguata: non percepisce distinzioni che sarebbero rilevanti, aggrega ciò che dovrebbe separare, tratta come omogeneo ciò che è eterogeneo. L’evoluzione risolve questo problema per selezione su scala temporale generazionale. Un agente razionale può risolverlo costruendo modelli, raccogliendo dati, raffinando partizioni.

In entrambi i casi, il meccanismo è lo stesso: trovare la struttura $\Pi^*$ che massimizza $\operatorname{I}(\Pi; W)$ — che comprime meglio la descrizione del payoff — è trovare la struttura che massimizza la covarianza inter-blocco e quindi il vantaggio selettivo. La distinzione è la forza prima dell’evoluzione, dell’apprendimento e della strategia.

Il principio fondamentale unificato

Ogni vantaggio selettivo, evolutivo o strategico, ha origine in una distinzione: la capacità di separare stati del mondo che differiscono nei payoff. Quella distinzione è informazione ($\operatorname{I} > 0$), si manifesta come covarianza ($\operatorname{Cov}_\Pi > 0$), e genera valore ($\operatorname{VoI} > 0$). I tre numeri sono la stessa cosa misurata in bit, in unità di fitness, e in unità di payoff. L’equazione di Price gerarchica, la teoria dell’informazione di Shannon, e il valore dell’informazione di Good convergono su un’unica legge: chi distingue meglio, vince meglio.

Shannon, C. E. (1948). A mathematical theory of communication. Bell System Technical Journal, 27, 379–423.  ·  Price, G. R. (1972). Extension of covariance selection mathematics. Annals of Human Genetics, 35, 485–490.  ·  Good, I. J. (1967). On the principle of total evidence. British Journal for the Philosophy of Science, 17, 319–321.  ·  Frank, S. A. (2012). Natural selection. IV. The Price equation. Journal of Evolutionary Biology, 25, 1002–1019.  ·  Blackwell, D. (1953). Equivalent comparisons of experiments. Annals of Mathematical Statistics, 24, 265–272.  ·  Rissanen, J. (1978). Modeling by shortest data description. Automatica, 14, 465–471.  ·  Tishby, N., Pereira, F. C., & Bialek, W. (1999). The information bottleneck method. Proceedings of the 37th Allerton Conference.

Alvise Giubelli – HumAI.it©