La distinzione come forza: informazione, struttura e covarianza
Riconoscere una struttura nell’ambiente è un atto di acquisizione di informazione. Quell’informazione si traduce matematicamente in covarianze inter-blocco che prima erano zero. La connessione tra entropia di Shannon, divergenza di Kullback-Leibler e l’equazione di Price gerarchica non è una metafora: è un’identità.
IInformazione come capacità di distinzione
Shannon definisce l’informazione in modo sorprendentemente austero: non come contenuto semantico, non come verità, ma come riduzione di incertezza. L’entropia $\operatorname{H}(X)$ di una variabile aleatoria discreta $X$ con distribuzione $p$ è:
$$\operatorname{H}(X) \;=\; -\sum_{x} p(x)\,\log_2 p(x)$$Essa misura quanti bit sono necessari in media per descrivere un’osservazione di $X$ — ovvero quanto $X$ sia imprevedibile, quanto i suoi valori siano indistinguibili a priori. Un’entropia alta significa che tutti i valori sono circa ugualmente probabili: nessuno si distingue dagli altri. Un’entropia bassa significa che alcuni valori sono molto più probabili: c’è una struttura.
La nozione duale è l’informazione mutua. Date due variabili $X$ e $Y$, l’informazione mutua $\operatorname{I}(X; Y)$ misura quanto conoscere $X$ riduce l’incertezza su $Y$:
Vedi anche l’articolo La mutua informazione
$\operatorname{I}(X;Y) \geq 0$ sempre, con uguaglianza se e solo se $X$ e $Y$ sono indipendenti. È simmetrica: $\operatorname{I}(X;Y) = \operatorname{I}(Y;X)$.
Crucialmente, $\operatorname{I}(X;Y) = 0$ quando $X$ e $Y$ sono indipendenti — quando conoscere $X$ non aiuta a distinguere i valori di $Y$. $\operatorname{I}(X;Y) > 0$ quando c’è dipendenza: $X$ discrimina tra i valori di $Y$.
Partizioni come atti di distinzione
Una partizione $\Pi = \{B_1, \ldots, B_k\}$ di $\Omega$ induce una variabile aleatoria discreta $B : \Omega \to \{1,\ldots,k\}$ che assegna a ogni elemento il blocco di appartenenza. L’entropia di $B$:
$$\operatorname{H}(\Pi) \;=\; \operatorname{H}(B) \;=\; -\sum_{j=1}^k p_j \log p_j, \qquad p_j = \P(B = j)$$misura quanto la partizione sia bilanciata — quanta incertezza resti sul blocco di un elemento scelto a caso. Ma la quantità decisiva per i nostri scopi è l’informazione mutua tra la partizione e il payoff $W$:
$$\operatorname{I}(\Pi;\, W) \;=\; \operatorname{H}(W) \;-\; \operatorname{H}(W \mid B)$$Questa misura quanto conoscere il blocco di appartenenza di un agente riduca l’incertezza sul suo payoff. Se $\operatorname{I}(\Pi; W) = 0$, la struttura è irrilevante: i payoff sono distribuiti allo stesso modo in ogni blocco, e la partizione non rivela nulla di utile. Se $\operatorname{I}(\Pi; W) > 0$, la struttura è informativa: i blocchi si distinguono per payoff, e questa distinzione è esattamente la covarianza inter-blocco che cercavamo.
Riconoscere la struttura $\Pi$ equivale a misurare $\operatorname{I}(\Pi; W)$. Una struttura con $\operatorname{I}(\Pi; W) = 0$ non aggiunge nulla all’analisi piatta. Una struttura con $\operatorname{I}(\Pi; W) > 0$ genera distinzioni tra blocchi — e quelle distinzioni si manifestano esattamente come covarianza inter-blocco nel framework di Price. La domanda «quanto è informativa questa struttura?» e la domanda «quanto è grande il termine inter-blocco di Price?» hanno la stessa risposta.
IIIl teorema di connessione: da $\operatorname{I}(\Pi; W)$ a $\operatorname{Cov}_\Pi$
Rendiamo precisa la connessione tra informazione mutua e covarianza strutturale. Lavoreremo prima nel caso gaussiano, dove le formule sono esplicite e la connessione è diretta, poi nella forma generale.
Il caso gaussiano
Supponiamo che il payoff $W$ e il tratto $Z$ siano congiuntamente normali all’interno di ciascun blocco $B_j$, con medie $(\bar{w}_j, \bar{z}_j)$ e matrice di covarianza intra-blocco comune $\Sigma$. La distribuzione marginale su tutti i blocchi è una mistura di gaussiane.
L’informazione mutua tra la variabile di blocco $B$ e il payoff $W$ in questa mistura vale:
$$\operatorname{I}(B;\, W) \;=\; \operatorname{H}(W) \;-\; \operatorname{H}(W \mid B)$$Il termine $\operatorname{H}(W \mid B) = \frac{1}{2}\log(2\pi e\,\sigma^2_w)$ è l’entropia intra-blocco comune (non dipende da $j$ per ipotesi). Il termine $\operatorname{H}(W)$ è l’entropia della mistura marginale, che è maggiore dell’entropia intra-blocco in misura proporzionale alla varianza tra le medie di blocco. In particolare, per una mistura equipesata ($p_j = 1/k$):
L’approssimazione è esatta al primo ordine per $\operatorname{Var}_j(\bar{w}_j) \ll \sigma^2_w$. La varianza inter-blocco del payoff $\operatorname{Var}_j(\bar{w}_j)$ è il quadrato di ciò che in Price compare come covarianza: misura quanto le medie di blocco differiscano tra loro.
In modo analogo, l’informazione mutua congiunta $\operatorname{I}(B; W, Z)$ tra blocchi e la coppia (payoff, tratto) è connessa alla matrice di covarianza inter-blocco $\Sigma_{\text{inter}} = \operatorname{Cov}_j((\bar{w}_j, \bar{z}_j))$:
$$\operatorname{I}(B;\, W,Z) \;\approx\; \frac{1}{2\ln 2}\,\mathrm{tr}\!\left(\Sigma^{-1}_{\text{intra}}\,\Sigma_{\text{inter}}\right)$$dove $\Sigma_{\text{intra}}$ è la matrice di covarianza intra-blocco. Il termine di Price $\operatorname{Cov}_j(\bar{w}_j, \bar{z}_j)$ è esattamente l’elemento fuori-diagonale di $\Sigma_{\text{inter}}$. Dunque:
In forma qualitativa: $\operatorname{Cov}_j(\bar{w}_j, \bar{z}_j)$ è una funzione strettamente crescente di $\operatorname{I}(B; W, Z)$. Più è alta l’informazione mutua tra la struttura e la coppia (payoff, tratto), più grande è il termine inter-blocco di Price.
La forma generale: divergenza KL e covarianza
La connessione più profonda e generale non passa per il caso gaussiano ma per la divergenza di Kullback-Leibler. La KL-divergenza tra due distribuzioni $p$ e $q$ è:
$$\operatorname{D_{KL}}(p \,\|\, q) \;=\; \sum_x p(x)\,\log\frac{p(x)}{q(x)} \;\geq\; 0$$con uguaglianza solo se $p = q$. Essa misura quanto $p$ e $q$ siano distinguibili: una KL alta significa che chi conosce $p$ può distinguere facilmente tra le due distribuzioni; una KL bassa significa che le distribuzioni sono quasi indistinguibili.
Ora: l’informazione mutua è la KL-divergenza tra la distribuzione congiunta e il prodotto delle marginali:
$$\operatorname{I}(X;\,Y) \;=\; \operatorname{D_{KL}}\!\bigl(p_{XY} \,\|\, p_X \otimes p_Y\bigr)$$Quindi $\operatorname{I}(\Pi; W) > 0$ equivale a dire che la distribuzione congiunta $(B, W)$ è distinguibile dal prodotto delle sue marginali — ovvero che conoscere il blocco cambia la distribuzione attesa del payoff. Questo è precisamente la condizione per cui la struttura $\Pi$ rivela informazione su $W$, e questa informazione è la sorgente della covarianza inter-blocco.
Siano $B$ la variabile di blocco indotta da $\Pi$, $W$ il payoff, $Z$ il tratto. Allora:
$$\operatorname{I}(\Pi;\, W) \;=\; 0 \;\iff\; \operatorname{Var}_j(\bar{w}_j) \;=\; 0 \;\iff\; \operatorname{Cov}_j(\bar{w}_j,\, \bar{z}_j) \;=\; 0 \quad \forall\, z$$e dualmente:
$$\operatorname{I}(\Pi;\, W) \;>\; 0 \;\iff\; \exists\, z : \operatorname{Cov}_j(\bar{w}_j,\, \bar{z}_j) \;\neq\; 0$$La struttura è informativa sul payoff se e solo se le medie di blocco del payoff variano tra i blocchi — e questa variazione è la sorgente di ogni covarianza inter-blocco non nulla.
Dimostrazione del lemma
IIILa catena fondamentale: informazione → distinzione → covarianza → selezione
Possiamo ora enunciare la catena completa che connette la teoria dell’informazione all’equazione di Price. Ogni freccia è un’implicazione matematica precisa.
$\operatorname{I}(\Pi; W) > 0$
$\operatorname{Var}_j(\bar{w}_j) > 0$
$\operatorname{Cov}_j(\bar{w}_j, \bar{z}_j)$
$\bar{w}\,\Delta\bar{z} \neq 0$
La catena si legge in entrambe le direzioni. Da sinistra a destra: acquisire informazione sulla struttura dell’ambiente genera distinzioni tra blocchi, che si manifestano come covarianza inter-blocco, che determina il cambiamento nella frequenza del tratto. Da destra a sinistra: se osserviamo un cambiamento evolutivo inaspettato — un tratto che si diffonde contro la logica della selezione individuale — dobbiamo cercare quale struttura informativa, non ancora riconosciuta, sta generando quella covarianza.
Informazione mutua e riduzione dell’incertezza sui payoff
C’è un modo particolarmente illuminante di scrivere la connessione, usando la decomposizione dell’entropia. L’entropia del payoff si decompone rispetto alla struttura $\Pi$ come:
$$\operatorname{H}(W) \;=\; \underbrace{\operatorname{H}(W \mid B)}_{\text{incertezza residua intra-blocco}} + \underbrace{\operatorname{I}(\Pi;\, W)}_{\text{riduzione per la struttura}}$$Questa è la decomposizione duale di quella di Price. Mentre Price decompone la covarianza in un termine inter-blocco e uno intra-blocco, Shannon decompone l’entropia in un termine intra-blocco (incertezza residua dopo aver conosciuto il blocco) e un termine di guadagno informativo (quanto la struttura riduce l’incertezza totale). Le due decomposizioni sono duale: l’una misura la varianza spiegata dalla struttura, l’altra misura l’incertezza rimossa dalla struttura.
A sinistra la decomposizione di Price, a destra quella di Shannon. Entrambe partizionano una quantità globale in un termine «tra blocchi» e uno «dentro i blocchi». La covarianza inter-blocco di Price e l’informazione mutua di Shannon misurano la stessa cosa da due angolazioni complementari.
IVKL-divergenza, fitness logaritmica e selezione naturale
La connessione più profonda tra teoria dell’informazione e selezione non passa per la covarianza lineare ma per la fitness logaritmica e la KL-divergenza. Questo è il risultato di Frank (2012) e, nella sua radice, di Kullback stesso.
Crescita log-ottimale e KL-divergenza
Consideriamo una popolazione di tipi $i = 1, \ldots, n$ con frequenze $q_i$ alla generazione $t$ e fitness $w_i$. Le frequenze alla generazione $t+1$ sono:
$$q’_i \;=\; \frac{w_i\, q_i}{\bar{w}}$$Il tasso di crescita della popolazione è $\bar{w}$. Ma la quantità informativamente rilevante è il tasso di crescita del log-fitness medio — la media geometrica, che governa la crescita a lungo termine di una popolazione in ambiente variabile:
$$\overline{\log w} \;=\; \sum_i q_i \log w_i$$Frank dimostra che il cambiamento in $\overline{\log w}$ tra generazioni successive si decompone come differenza di KL-divergenze:
dove $p^*_i \propto w_i q_i$ è la distribuzione ottimale (quella che massimizza il log-fitness), e $q’$ è la distribuzione dopo la selezione.
Il primo termine $\operatorname{D_{KL}}(q’ \| q)$ misura quanto la selezione ha mosso la popolazione dalla distribuzione attuale. Il secondo termine misura la distanza residua dall’ottimo. La selezione naturale riduce la KL-divergenza dalla distribuzione ottimale — è un processo di approssimazione bayesiana.
Connessione con l’equazione di Price
L’equazione di Price e il framework KL-divergenza non sono alternativi: sono la stessa cosa vista con lenti diverse. Per vederlo, scriviamo la fitness come $w_i = e^{f_i}$ (fitness log-lineare) e sviluppiamo al primo ordine:
Con $w_i = e^{f_i} \approx 1 + f_i$ per $f_i$ piccolo, il termine di selezione di Price diventa:
$$\operatorname{Cov}(w_i, z_i) \;\approx\; \operatorname{Cov}(f_i, z_i)$$e la KL-divergenza tra $q’$ e $q$, sviluppata al secondo ordine, è:
$$\operatorname{D_{KL}}(q’ \,\|\, q) \;=\; \sum_i q’_i \log\frac{q’_i}{q_i} \;\approx\; \frac{1}{2}\chi^2(q’, q) \;\approx\; \frac{\operatorname{Var}(w_i)}{2\bar{w}^2}$$La velocità con cui la selezione si muove nello spazio delle distribuzioni (in metrica KL) è proporzionale alla varianza di fitness, che è il quadrato della «intensità di selezione»:
$$\text{velocità} \;\propto\; \operatorname{Var}(w_i) \;=\; \operatorname{Var}_j(\bar{w}_j) + \E_j[\operatorname{Var}_i(w_{ij})]$$Il primo termine è la varianza inter-blocco, il secondo è quella intra-blocco. Di nuovo la struttura di Price.
Il risultato fondamentale è questo: la velocità dell’evoluzione per selezione è misurata dalla varianza di fitness — che è la varianza inter-blocco più quella intra-blocco — e la varianza inter-blocco è non nulla se e solo se la struttura è informativa sul payoff, cioè se $\operatorname{I}(\Pi; W) > 0$. La selezione è tanto più rapida quanto più la struttura è informativa.
La selezione naturale è, formalmente, un processo di inferenza bayesiana: aggiorna la distribuzione delle frequenze $q_i$ nella direzione della distribuzione ottimale $p^*$, con «velocità» proporzionale all’informazione disponibile. Ogni generazione di selezione è un passo di aggiornamento bayesiano. L’equazione di Price descrive il contenuto di ogni passo; la KL-divergenza ne misura la distanza percorsa.
In questo senso, riconoscere una nuova struttura — un nuovo livello gerarchico — equivale ad acquisire una nuova variabile latente nell’inferenza bayesiana, riducendo l’incertezza sul payoff e accelerando la convergenza verso la distribuzione ottimale.
VIl valore dell’informazione come covarianza emergente
Torniamo ora al punto sollevato nel saggio precedente e lo formalizziamo completamente. Avevamo scritto che il valore dell’informazione ambientale è la differenza di covarianza tra norma adattiva e strategia fissa. Ecco la derivazione rigorosa.
Setup: ambienti, strategie e informazione
- $E \in \mathcal{E}$ variabile aleatoria che descrive lo stato dell’ambiente, con distribuzione $p(e)$
- $Z \in \mathcal{Z}$ azione/strategia dell’agente
- $W = f(Z, E)$ payoff, funzione dell’azione e dell’ambiente
- $Z_0$ strategia fissa (non condizionata all’ambiente)
- $Z^*(E)$ norma adattiva ottimale: $Z^*(e) = \arg\max_z \operatorname{E}[W \mid Z=z, E=e]$
Il teorema del valore dell’informazione
Il guadagno di payoff atteso dall’usare la norma adattiva $Z^*(E)$ rispetto alla strategia fissa ottimale $Z_0^* = \arg\max_z \operatorname{E}[f(z, E)]$ è:
$$\operatorname{VoI}(\Pi_{\mathcal{E}}) \;:=\; \operatorname{E}_{E}[f(Z^*(E), E)] \;-\; f(Z_0^*, \bar{E})$$ $$= \;\operatorname{Cov}_{\Pi_{\mathcal{E}}}\!\bigl(\bar{w}_e,\; z^*(e)\bigr) \;-\; \operatorname{Cov}_{\Pi_{\mathcal{E}}}\!\bigl(\bar{w}_e,\; z_0^*\bigr)$$Il secondo termine è zero (la strategia fissa non covaria con l’ambiente per definizione). Quindi $\operatorname{VoI} = \operatorname{Cov}_{\Pi_{\mathcal{E}}}(\bar{w}_e, z^*(e))$ — il valore dell’informazione è la covarianza inter-ambiente tra il payoff medio e la strategia adattiva.
Scriviamo il payoff atteso della norma adattiva come media su $e$:
$$\operatorname{E}[f(Z^*(E), E)] = \sum_e p(e) f(z^*(e), e) = \sum_e p(e) \bar{w}_e^* + \sum_e p(e)\operatorname{E}[f(Z^*(e),E) – \bar{w}_e^* \mid E=e]$$Il secondo termine è zero per definizione di $\bar{w}_e^*$. Il primo termine è $\bar{w} + \operatorname{Cov}_e(\bar{w}_e^*, z^*(e))$ dove la covarianza è tra la media del payoff in ogni ambiente e la strategia scelta in quell’ambiente. La strategia fissa $Z_0^*$ dà $\operatorname{E}[f(Z_0^*, E)] = \bar{w}$. La differenza è la covarianza inter-ambiente. $\square$
Connessione con l’informazione mutua
Il teorema di Good (1967) sulla «utilità dell’informazione» afferma che il valore atteso dell’informazione perfetta sull’ambiente è:
$$\operatorname{VoI}_{\text{perfetta}} \;=\; \operatorname{E}_{E}\!\left[\max_z f(z, E)\right] – \max_z \operatorname{E}_{E}[f(z, E)]$$Questa quantità è sempre non negativa (disuguaglianza di Jensen) e si annulla se e solo se l’azione ottimale è la stessa in tutti gli ambienti — cioè se e solo se $\operatorname{I}(\Pi_{\mathcal{E}}; W^*) = 0$, dove $W^*$ è il payoff ottimale. In forma di covarianza:
$$\operatorname{VoI}_{\text{perfetta}} \;=\; \operatorname{Cov}_{\Pi_{\mathcal{E}}}\!\bigl(\bar{w}^*_e,\; z^*(e)\bigr) \;\geq\; 0$$con uguaglianza se la struttura ambientale non è informativa sul payoff. Questo dimostra formalmente il punto del saggio precedente: il valore dell’informazione è la covarianza inter-blocco che emerge riconoscendo la struttura, ed è zero precisamente quando quella struttura è irrilevante.
Riconoscere la struttura ambientale $\Pi_{\mathcal{E}}$ significa acquisire informazione $\operatorname{I}(\Pi_{\mathcal{E}}; W) > 0$. Quella informazione genera distinzioni tra ambienti: i payoff attesi $\bar{w}_e$ variano tra i blocchi. Quella variazione è la covarianza inter-blocco $\operatorname{Cov}_{\Pi_{\mathcal{E}}}(\bar{w}_e, z^*(e))$. Quella covarianza è il valore dell’informazione, che è il guadagno di payoff rispetto all’agente non informato. L’equazione di Price, la teoria dell’informazione di Shannon e il valore dell’informazione di Good convergono sulla stessa quantità.
VIEntropia come misura di struttura latente non ancora riconosciuta
C’è un’altra angolazione, più filosofica ma ugualmente precisa, che illumina il rapporto tra entropia e struttura. L’entropia alta di un sistema non significa che il sistema sia caotico o privo di struttura: significa che la struttura presente non è stata ancora identificata dall’osservatore.
Riduzione di entropia come identificazione di struttura
Sia $W$ una variabile di payoff con entropia $\operatorname{H}(W)$ alta. Un osservatore che non conosce alcuna struttura su $\Omega$ descrive $W$ con $\operatorname{H}(W)$ bit. Se quell’osservatore scopre una struttura $\Pi$ tale che $\operatorname{I}(\Pi; W) = \Delta H > 0$, ora descrive $W$ con soli $\operatorname{H}(W) – \Delta H$ bit condizionatamente a $\Pi$. Il guadagno di descrizione compressiva è $\Delta H$ bit.
Ma — e questo è il punto cruciale — questo guadagno descrittivo è la stessa cosa del guadagno di covarianza strutturale:
$$\Delta H \;=\; \operatorname{I}(\Pi; W) \;\propto\; \operatorname{Var}_j(\bar{w}_j) \;\propto\; \operatorname{Cov}_j(\bar{w}_j, \bar{z}_j)$$Un agente che comprime meglio la descrizione del payoff — che trova una struttura $\Pi$ con alta $\operatorname{I}(\Pi; W)$ — è anche l’agente che può sfruttare la covarianza inter-blocco più grande. La compressione della descrizione e il vantaggio selettivo sono la stessa cosa misurata in unità diverse: bit la prima, fitness la seconda.
Il principio MDL (Minimum Description Length) di Rissanen afferma che la miglior struttura per descrivere un insieme di dati è quella che comprime di più la loro descrizione. Tradotto nel framework di Price: la miglior struttura $\Pi^*$ è quella che massimizza $\operatorname{I}(\Pi; W)$ — ovvero quella che rivela la covarianza inter-blocco più grande e quindi il maggiore vantaggio selettivo. Trovare la struttura ottimale è un problema di compressione: l’evoluzione lo risolve per tentativi ed errori attraverso le generazioni; un agente razionale lo risolve costruendo modelli dell’ambiente.
Strutture annidate e gerarchia dell’informazione
Nella gerarchia di strutture $\Pi_0 \preceq \Pi_1 \preceq \cdots \preceq \Pi_k$, ogni raffinamento aggiunge informazione. L’informazione mutua è sottoadditiva rispetto al raffinamento:
$$\operatorname{I}(\Pi_{l+1}; W) \;\geq\; \operatorname{I}(\Pi_l; W)$$con uguaglianza solo se il raffinamento da $\Pi_l$ a $\Pi_{l+1}$ non aggiunge informazione su $W$ — se i sotto-blocchi sono omogenei in payoff. Ogni livello della gerarchia di Price corrisponde a un incremento di informazione mutua: più livelli si riconoscono, più si riduce l’entropia residua del payoff, più covarianze strutturali diventano visibili.
Questo ha una conseguenza notevole: la gerarchia di Price è anche una gerarchia di compressione dell’incertezza. Il livello più fine — individui singoli — è quello con massima informazione ma massima complessità descrittiva. Il livello più grosso — un solo blocco — è quello con minima complessità ma massima entropia residua. La scelta del livello è un compromesso tra informazione acquisita e costo di descrizione: un compromesso che è il nucleo della statistica, dell’apprendimento automatico, e — suggerisce la connessione con Price — dell’evoluzione stessa.
Ogni termine $\operatorname{I}(\Pi_l \setminus \Pi_{l-1}; W)$ è l’informazione aggiuntiva fornita dal passare dal livello $l-1$ al livello $l$ — il «contributo informativo» del livello $l$. È la controparte informazionale del termine inter-blocco di Price a quel livello.
VIIApplicazioni: dove la distinzione genera valore
01
Il mercato finanziario come sistema di acquisizione di informazione
In un mercato efficiente alla Fama, tutti gli agenti condividono la stessa struttura informativa $\Pi$, quindi $\operatorname{I}(\Pi; W) = \operatorname{I}(\Pi_{\text{comune}}; W)$ è uguale per tutti e non esiste vantaggio competitivo. I payoff attesi sono uguali per tutti gli agenti informati allo stesso modo.
Un agente con informazione privata possiede una struttura $\Pi^* \supset \Pi_{\text{comune}}$ — più fine della struttura condivisa. Questa struttura più fine ha $\operatorname{I}(\Pi^*; W) > \operatorname{I}(\Pi_{\text{comune}}; W)$, ovvero genera una covarianza inter-blocco positiva che gli altri non vedono. Il profitto anomalo dell’insider è esattamente $\operatorname{VoI}(\Pi^*) – \operatorname{VoI}(\Pi_{\text{comune}})$ — la differenza di valore dell’informazione tra la struttura privata e quella pubblica — ed è formalmente la covarianza inter-blocco aggiuntiva che la struttura privata rivela.
La legge sull’insider trading vieta questo vantaggio; la teoria dei mercati lo misura esattamente come differenza di informazione mutua.
02
Segmentazione del mercato come raffinamento della struttura
Un’impresa che offre un prodotto unico a tutti i clienti usa la struttura piatta $\Pi_0$: non distingue tra segmenti. La covarianza inter-blocco è zero perché non ci sono blocchi. Il payoff è la media globale.
Un’impresa che segmenta il mercato in $k$ cluster — per reddito, preferenze, uso — introduce la struttura $\Pi_k$. Se $\operatorname{I}(\Pi_k; W) > 0$, i cluster si distinguono per willingness-to-pay. La discriminazione di prezzo di terzo grado è esattamente l’estrazione della covarianza inter-blocco: l’impresa cattura $\operatorname{Cov}_{\Pi_k}(\bar{w}_B, z^*(B))$ come surplus aggiuntivo, dove $z^*(B)$ è il prezzo ottimale per il segmento $B$.
Il profitto marginale della segmentazione è il valore dell’informazione del clustering: $\operatorname{VoI}(\Pi_k) – \operatorname{VoI}(\Pi_0)$. Ogni raffinamento aggiuntivo (da $k$ a $k+1$ segmenti) aggiunge informazione $\operatorname{I}(\Pi_{k+1}; W) – \operatorname{I}(\Pi_k; W)$ e profitto proporzionale — finché il costo di gestire un segmento aggiuntivo supera il suo contributo informativo.
03
Apprendimento adattivo e transfer learning
Un sistema di apprendimento automatico addestrato su un solo dominio ha imparato una struttura $\Pi_{\text{dominio}}$. Quando si confronta con un nuovo dominio, la struttura imparata può essere uninformativa: $\operatorname{I}(\Pi_{\text{dominio}}; W_{\text{nuovo}}) \approx 0$, quindi nessuna covarianza inter-blocco trasferibile, performance vicina al caso.
Il transfer learning è il tentativo di trovare una struttura $\Pi_{\text{comune}}$ che sia informativa su entrambi i domini: $\operatorname{I}(\Pi_{\text{comune}}; W_{\text{sorgente}}) > 0$ e $\operatorname{I}(\Pi_{\text{comune}}; W_{\text{target}}) > 0$. Il «trasferimento» di conoscenza è letteralmente il trasferimento di una struttura informativa da un contesto all’altro. Funziona nella misura in cui le strutture latenti dei due domini si sovrappongono — cioè nella misura in cui la partizione $\Pi_{\text{comune}}$ ha alta informazione mutua in entrambi.
04
Diagnosi medica come identificazione di struttura
Un paziente con sintomi generici appartiene alla struttura piatta: alta entropia sul payoff del trattamento $\operatorname{H}(W_{\text{trat}})$. Ogni esame diagnostico è un raffinamento della struttura: introduce una partizione $\Pi_{\text{esame}}$ sull’insieme dei possibili stati di salute. Il valore di un esame diagnostico è esattamente $\operatorname{I}(\Pi_{\text{esame}}; W_{\text{trat}})$ — quanta incertezza sul payoff del trattamento riduce — e per il teorema connette direttamente alla covarianza tra diagnosi e scelta terapeutica ottimale.
Il principio di parsimonia diagnostica — non fare esami se non cambiano la terapia — è il principio che $\operatorname{VoI}(\Pi_{\text{esame}}) = 0$ implica $\operatorname{I}(\Pi_{\text{esame}}; W_{\text{trat}}) = 0$: se tutti i risultati portano alla stessa terapia, l’esame non distingue nulla di rilevante e il suo valore è zero.
VIIITavola delle corrispondenze tra i tre framework
| Concetto | Teoria dell’informazione | Equazione di Price | Teoria delle decisioni |
|---|---|---|---|
| Struttura su $\Omega$ | $\sigma$-algebra $\mathcal{F}$, partizione $\Pi$ | Livello gerarchico, raggruppamento | Variabile di stato osservata |
| Incertezza senza struttura | Entropia $\operatorname{H}(W)$ | Varianza totale $\operatorname{Var}(w)$ | Payoff atteso con strategia fissa |
| Informazione della struttura | $\operatorname{I}(\Pi; W)$ | $\operatorname{Var}_j(\bar{w}_j)$ (varianza inter-blocco) | $\operatorname{VoI}(\Pi)$ (valore dell’informazione) |
| Struttura irrilevante | $\operatorname{I}(\Pi; W) = 0$ | $\operatorname{Cov}_j(\bar{w}_j, \bar{z}_j) = 0$ | $\operatorname{VoI}(\Pi) = 0$ |
| Struttura informativa | $\operatorname{I}(\Pi; W) > 0$ | $\operatorname{Cov}_j(\bar{w}_j, \bar{z}_j) \neq 0$ | $\operatorname{VoI}(\Pi) > 0$ |
| Gerarchia di strutture | Catena di Markov $\Pi_0 \preceq \cdots \preceq \Pi_k$ | Equazione di Price gerarchica | Raffinamento sequenziale della politica |
| Residuo irriducibile | $\operatorname{H}(W \mid \Pi_k)$ | $\E[\operatorname{Cov}(w,z \mid B_k)]$ (intra-blocco fine) | Incertezza fondamentale dell’ambiente |
| Distanza dall’ottimo | $\operatorname{D_{KL}}(q’ \| p^*)$ | $\Delta\bar{z}$ residuo | Regret atteso rispetto all’ottimale |
| Processo di convergenza | Aggiornamento bayesiano | Selezione naturale iterata | Apprendimento per rinforzo |
IXConclusioni: la distinzione come atto fondativo
La connessione che abbiamo tracciato non è una metafora. È un’identità matematica: la covarianza inter-blocco dell’equazione di Price è non nulla se e solo se l’informazione mutua tra la struttura e il payoff è positiva. Riconoscere una struttura è acquisire informazione. Acquisire informazione è generare covarianza. Generare covarianza è creare vantaggio selettivo.
Questo unifica tre tradizioni intellettuali che si sono sviluppate in modo quasi indipendente. Shannon (1948) costruisce la teoria dell’informazione come misura della distinzione tra stati. Price (1970) costruisce la teoria della selezione multilivello come misura della covarianza tra struttura e payoff. Good (1967) e Blackwell (1953) costruiscono la teoria del valore dell’informazione come misura del guadagno di payoff dall’acquisire distinzioni. Le tre misure — $\operatorname{I}(\Pi; W)$, $\operatorname{Cov}_j(\bar{w}_j, \bar{z}_j)$, $\operatorname{VoI}(\Pi)$ — sono facce diverse dello stesso oggetto matematico.
La conseguenza pratica è netta. Quando un agente — biologico, economico, computazionale — non riesce a sfruttare un vantaggio potenziale, spesso la causa è l’assenza di una struttura informativa adeguata: non percepisce distinzioni che sarebbero rilevanti, aggrega ciò che dovrebbe separare, tratta come omogeneo ciò che è eterogeneo. L’evoluzione risolve questo problema per selezione su scala temporale generazionale. Un agente razionale può risolverlo costruendo modelli, raccogliendo dati, raffinando partizioni.
In entrambi i casi, il meccanismo è lo stesso: trovare la struttura $\Pi^*$ che massimizza $\operatorname{I}(\Pi; W)$ — che comprime meglio la descrizione del payoff — è trovare la struttura che massimizza la covarianza inter-blocco e quindi il vantaggio selettivo. La distinzione è la forza prima dell’evoluzione, dell’apprendimento e della strategia.
Ogni vantaggio selettivo, evolutivo o strategico, ha origine in una distinzione: la capacità di separare stati del mondo che differiscono nei payoff. Quella distinzione è informazione ($\operatorname{I} > 0$), si manifesta come covarianza ($\operatorname{Cov}_\Pi > 0$), e genera valore ($\operatorname{VoI} > 0$). I tre numeri sono la stessa cosa misurata in bit, in unità di fitness, e in unità di payoff. L’equazione di Price gerarchica, la teoria dell’informazione di Shannon, e il valore dell’informazione di Good convergono su un’unica legge: chi distingue meglio, vince meglio.
Alvise Giubelli – HumAI.it©