L’ipotesi platonica (Strong Platonic Representation Hypothesis)
L’idea che sia possibile presupporre l’esistenza di un sistema di concetti universale, una semantica condivisa da tutti gli uomini è suggestiva, ma anche abbastanza intuitiva se si pensa che gli esseri umani hanno bisogni comuni che generano comportamenti altrettanto comuni e che spesso vengono educati secondo modelli molto simili.
Gli esperimenti fatti con i modelli di intelligenza artificiale sembrano dare credito a questa idea.
In questo articolo parliamo dell’ipotesi platonica (Strong Platonic Representation Hypothesis) che sostiene che tutti i modelli linguistici di sufficiente capacità convergano a una rappresentazione semantica latente universale, comune a modelli diversi.
Facciamo alcune premesse utili per capire l’argomento.
La vettorializzazione è il processo con cui una parola, una frase o un intero documento viene trasformato in un vettore numerico. Questo è utile perché i computer non capiscono il linguaggio umano, ma possono fare calcoli con numeri. Un vettore è semplicemente una lista ordinata di numeri che rappresenta il “significato” della parola in uno spazio astratto.
Ad esempio, la parola “re” potrebbe essere trasformata in un vettore come [0.5, -0.3, 0.8, …]
La parola “regina” avrà un vettore simile, perché i due concetti sono vicini nel significato.
Cosa fanno encoder e decoder?
Un encoder prende un testo (es. una parola o frase) e lo trasforma in un vettore.
Un decoder prende quel vettore e cerca di ricostruire il testo originale, oppure lo traduce in un’altra lingua o compito (es. completamento del testo).
Quindi l’encoder “capisce”, il decoder “esprime”.
Puoi leggere i seguenti articoli per avere le basi utili alla comprensione di quanto segue
Word embedding e il modello Skip-gram
Architettura del sistema encoder-decoder con reti RNN
Ricordiamoci che grazie ai modelli transformer è possibile distinguere i significati (concetti) oltre ai segni (parole).
Un modello Transformer, come BERT o GPT, non assegna un vettore fisso a ogni parola. Invece, per ogni occorrenza di una parola, prende in input tutta la frase o paragrafo e calcola il significato in base al contesto.
Per esempio, queste due frasi:
“L’energia cinetica dipende dalla velocità.”
“L’energia dell’amore lo trasformò.”
Il modello analizza non solo la parola “energia”, ma anche le parole vicine, e tramite meccanismi di attenzione decide di cosa sta parlando. Quindi produrrà due vettori diversi per “energia”.
Approfondimento sul transformer
L’ipotesi platonica (Strong Platonic Representation Hypothesis)
Prendiamo spunto dallo studio Harnessing the Universal Geometry of Embeddings
Il lavoro si fonda sulla Strong Platonic Representation Hypothesis, che sostiene che tutti i modelli linguistici di sufficiente capacità convergano a una rappresentazione semantica latente universale, comune a modelli diversi. In altre parole anche se modelli diversi usano “linguaggi interni” diversi per rappresentare i testi (i cosiddetti embedding), in fondo stanno tutti dicendo la stessa cosa, solo con parole diverse.
vec2vec è un modello di apprendimento automatico che permette di tradurre embedding testuali da un modello all’altro senza bisogno di dati accoppiati, trasforma un vettore (embedding) generato da un modello A in un vettore compatibile con un modello B, anche se non conosciamo né il testo originale né i dettagli dei modelli.
Quello che vedremo nel dettaglio è la procedura che si avvale delle seguenti componenti:
Dato un vettore u generato da un modello A (es. BERT) associato ad un documento sconosciuto
l’adattatore A₁ “Adatta” il vettore u per poterlo elaborare. È come tradurre da un accento all’altro.
Il Trasformatore T prende u “adattato” e lo trasforma in un vettore latente z.
Questo z è in una lingua universale: la rappresentazione platonica.
L’Adattatore B₂ prende z e lo traduce nello stile di un altro modello (es. T5).
Il risultato è un nuovo vettore v′ che dovrebbe sembrare quello che T5 avrebbe prodotto per lo stesso testo.
f(u) = B₂(T(A₁(u)))
f(u) viene confrontato con v = M₂(d), cioè l’embedding reale prodotto dal modello 2 (M₂) per lo stesso input d (ma senza mai vedere direttamente d).
La similarità del coseno cos(f(u), v) viene usata per misurare quanto f(u) è vicino a v nello spazio vettoriale.
Ricorda che cos’è la similarità del coseno.
Esaminiamo da vicino l’architettura del modello vec2vec







Formulazione matematica dell’intero procedimento



