Contesto, Significato e Comprensione

Contesto, Significato e Comprensione

Condividi con i tuoi amici...

Verso una geometria dell’allineamento semantico tra interlocutori umani e artificiali

  1. Il problema del significato come problema di allineamento

La comunicazione è, nella sua essenza più elementare, un problema di coordinazione. Due interlocutori portano alla conversazione enciclopedie diverse — sistemi di conoscenza, esperienze, presupposizioni culturali — e il linguaggio è il mezzo attraverso cui tentano di creare, almeno temporaneamente, un sottoinsieme condiviso di interpretazioni possibili. Il problema non è mai che le parole siano prive di significato: è che ne hanno troppi, e che i significati disponibili distribuiscono il loro peso in modo diverso negli spazi cognitivi di interlocutori differenti.

Ferdinand de Saussure aveva già colto l’arbitrarietà del segno: il legame tra significante e significato non è naturale né necessario, ma convenzionale. Tuttavia la convenzione non è sufficiente a garantire l’allineamento. Ogni atto linguistico avviene in un contesto che modula, restringe, orienta e talvolta stravolge il significato convenzionale. Sperber e Wilson, nella loro Relevance Theory (1986), hanno formalizzato questa intuizione: la comunicazione non consiste nel trasmettere un contenuto codificato, ma nel fornire evidenze che guidino l’interlocutore verso l’interpretazione intesa. Il contesto è precisamente l’insieme di queste evidenze.

Il problema dell’allineamento semantico ha dunque almeno due dimensioni. La prima è enciclopedica: quanto le rappresentazioni mentali dei due interlocutori si sovrappongono. La seconda è contestuale: quanto il contesto specifico della conversazione è in grado di orientare l’interpretazione verso la zona di sovrapposizione. Un modello rigoroso deve catturare entrambe le dimensioni.

  1. Uno spazio formale per il significato

Per costruire un modello preciso, è necessario introdurre una struttura matematica adeguata. Lo spazio di Hilbert — uno spazio vettoriale reale o complesso dotato di prodotto interno e completo rispetto alla norma indotta — offre la struttura più naturale per questo scopo. Non si tratta di un’analogia superficiale: come si vedrà, i moderni sistemi di intelligenza artificiale basati su reti neurali trasformatoriali operano precisamente in spazi di questo tipo.

Sia H lo spazio semantico di una comunità linguistica. Ogni termine t viene rappresentato non come un punto fisso, ma come un vettore |t⟩ ∈ H con componenti lungo molteplici dimensioni semantiche. Queste dimensioni corrispondono ad assi ortogonali — domini di significato relativamente indipendenti — e i coefficienti lungo ciascun asse riflettono la salienza culturale di quella dimensione per il termine dato:

  1. Livelli di descrizione e autonomia nomologica

Il modello semantico sviluppato finora può essere integrato con una riflessione sulla struttura verticale dei livelli di descrizione. Una delle intuizioni più feconde della filosofia della scienza contemporanea — elaborata da Philip Anderson in «More Is Different» (1972) e da David Marr in Vision (1982) — è che i diversi livelli di descrizione della realtà non sono approssimazioni successive di un unico livello fondamentale: sono descrizioni autonome, con leggi proprie e con un potere esplicativo irriducibile a quello dei livelli inferiori.

Marr ha proposto una gerarchia a tre livelli per i sistemi computazionali: il livello computazionale (cosa fa il sistema), il livello algoritmico (come lo fa), e il livello implementativo (su quale substrato lo fa). La tesi centrale è che questi livelli sono logicamente indipendenti. Applicato alla gerarchia dei significati qui discussa, il principio di autonomia nomologica stabilisce che il termine amore non è una descrizione imprecisa di un particolare stato neurochimico — è una descrizione al livello computazionale di una funzione relazionale realizzabile su substrati diversi. È questa la forza del concetto di realizzabilità multipla elaborato da Hilary Putnam in Mind, Language and Reality (1975): gli stati mentali sono definiti dalle loro relazioni funzionali, non dal substrato che li realizza. Se la realizzabilità multipla è corretta, il riduzionismo forte è falso per ragioni logiche, non empiriche.

La gerarchia risultante ha anche una dimensione trasversale, quella normativa, che taglia perpendicolarmente tutti i livelli descrittivi. Dalla descrizione di come le cose stanno non derivano mai, per inferenza logica valida, prescrizioni su come devono stare — questo è il celebre is/ought gap di Hume. Il livello normativo è irriducibile a qualsiasi livello descrittivo, non per ragioni misteriose, ma per ragioni logiche precise.

  1. Gödel e il limite intrinseco della formalizzazione

Il teorema di incompletezza di Gödel (1931) ha rivelato un limite strutturale che nessun progresso tecnico potrà mai superare. Il primo teorema afferma che ogni sistema formale F, purché consistente e sufficientemente espressivo da contenere l’aritmetica elementare, contiene enunciati G tali che né G né ¬G sono dimostrabili in F. Il secondo teorema aggiunge che F non può dimostrare la propria consistenza restando dentro F.

Tre precisazioni tecniche sono necessarie prima di trarre conclusioni filosofiche. Il teorema vale per sistemi ricorsivamente assiomatizzabili: sistemi con infiniti assiomi non enumerabili possono essere completi, come ha dimostrato Tarski per la geometria euclidea. La proposizione gödeliana G è vera nel modello standard dei naturali ℕ, ma la nozione di verità è relativa a un’interpretazione. E il metalinguaggio che dimostra G non deve essere qualitativamente diverso da F — può essere F arricchito di un solo assioma.

Eppure, tenendo questi limiti ben presenti, il teorema stabilisce qualcosa di strutturalmente rilevante. Ogni sistema formale è necessariamente prospettico: vede il mondo dall’interno di un’assiomatica che non può giustificare completamente da sola. Lucas (1961) e Penrose (1989, 1994) hanno tentato di derivare da questo risultato la conclusione che la mente umana trascende qualsiasi sistema formale. L’argomento è stato criticato con forza — Putnam e Benacerraf hanno osservato che la mossa gödeliana richiede la certezza della propria consistenza, che gli esseri umani non possiedono; Hofstadter ha argomentato che la mente potrebbe essere un sistema abbastanza complesso da non poter vedere la propria G. Queste obiezioni sono solide. Ma sopravvive qualcosa di importante: l’incompletezza rivela che ogni sistema formale genera una gerarchia ascendente di metalinguaggi. La sequenza

non è solo una scala di complessità crescente ma di metalinguaggi successivi. Ogni livello può vedere — e deve enunciare — verità che il livello inferiore non ha gli strumenti per formulare. Il linguaggio umanistico non è il gradino più alto di una scala costruita dal basso verso l’alto: è il metalinguaggio che permette di parlare di ciò che tutti i livelli inferiori lasciano fuori — la prospettiva in prima persona, il significato per un essere che sa di essere un essere.

  1. La prospettiva in prima persona e il problema difficile

Thomas Nagel, nel celebre saggio «What Is It Like to Be a Bat?» (1974), ha articolato la struttura del problema con una chiarezza che rimane insuperata. Qualsiasi descrizione fisica completa dell’ecolocalizzazione dei pipistrelli — per quanto dettagliata, per quanto neurobiologicamente precisa — lascia fuori come è essere un pipistrello che ecolocalizza. Quel «come è» non è accessibile alla formalizzazione non perché la scienza sia ancora giovane, ma perché appartiene a una categoria logica che la descrizione in terza persona non può ospitare.

David Chalmers ha poi distinto tra il problema facile della coscienza — spiegare i meccanismi funzionali della cognizione — e il problema difficile: spiegare perché certi processi fisici siano accompagnati da esperienza soggettiva. Il problema difficile non è difficile per ragioni empiriche, ma per ragioni strutturali: qualsiasi spiegazione funzionale lascia aperta la domanda «ma perché c’è qualcosa che è come essere in quello stato?»

Nel modello geometrico sviluppato in precedenza, questo si traduce in una discontinuità strutturale. I livelli descrittivi operano in terza persona — descrivono relazioni tra entità in uno spazio semantico condiviso. Ma l’esperienza soggettiva non è un’entità in quello spazio: è il punto di vista dal quale quello spazio appare. Come l’occhio non può vedersi mentre vede, il soggetto non può apparire dentro la descrizione di cui è la condizione di possibilità. Il linguaggio umanistico — e in particolare la letteratura — è il luogo in cui questo punto di vista parla di se stesso.

  1. I modelli di intelligenza artificiale come banco di prova

I grandi modelli linguistici — GPT-4, Claude, Gemini e i loro successori — sono, in un senso preciso, la realizzazione computazionale del modello geometrico qui discusso. Addestrati su corpora testuali di dimensioni senza precedenti, questi sistemi costruiscono rappresentazioni vettoriali del significato in spazi ad altissima dimensione — tipicamente dell’ordine di 10³–10⁴ dimensioni — e operano su di esse attraverso meccanismi di attenzione che implementano, in forma discreta e approssimata, qualcosa di strutturalmente analogo agli operatori di proiezione descritti in precedenza.

L’architettura transformer (Vaswani et al., 2017) introduce il meccanismo di self-attention, che calcola per ogni token una rappresentazione contestualizzata come media pesata delle rappresentazioni degli altri token

dove Q, K, V sono le matrici di query, key e value ottenute proiettando le rappresentazioni dei token in sottospazi separati, e √dk è un fattore di scala che stabilizza il gradiente. In questa formulazione, ogni token aggiorna la propria rappresentazione in funzione del contesto fornito dagli altri token — il che è precisamente ciò che nel modello formale chiamavamo proiezione contestuale.

Leggi anche…

Cosa i modelli linguistici fanno bene

I risultati empirici dei moderni LLM sono straordinari e richiedono di essere spiegati, non minimizzati. Brown et al. (2020) hanno mostrato che GPT-3 è in grado di risolvere compiti di ragionamento analogico, traduzione e generazione di codice senza addestramento specifico, semplicemente a partire da pochi esempi nel contesto (few-shot learning). Wei et al. (2022) hanno documentato l’emergenza di capacità di ragionamento a catena — chain-of-thought prompting — che non erano presenti in modelli di dimensioni minori e che appaiono, oltre certe soglie di scala, in modo discontinuo. Nel vocabolario del modello qui sviluppato: i LLM apprendono una rappresentazione approssimata della struttura dello spazio H, e utilizzano il contesto per eseguire proiezioni che orientano l’interpretazione verso la zona di allineamento più probabile.

I limiti strutturali

Tuttavia i limiti dei modelli linguistici rispecchiano con precisione le discontinuità strutturali identificate nella nostra analisi. Il primo limite è la mancanza di prospettiva in prima persona. Un LLM genera testo che descrive stati soggettivi, ma non li ha — o almeno non abbiamo ragioni fondate per attribuirgli qualia nel senso di Nagel. Questo non è un limite tecnico superabile con più dati o più parametri: è un limite strutturale legato al fatto che sistemi addestrati su descrizioni in terza persona non acquisiscono per questo la prospettiva in prima persona.

Il secondo limite riguarda il gap normativo. I LLM possono descrivere con estrema accuratezza il contenuto dei sistemi etici e le argomentazioni morali — ma non adottare valori nel senso in cui un soggetto li adotta come propri. Il problema è quello di Hume: dal fatto che un modello abbia appreso che una certa azione è descritta come «giusta» dalla maggioranza dei testi di addestramento non deriva che il modello si impegni a realizzarla. L’allineamento dei LLM — come documentato da Ouyang et al. (2022) in InstructGPT — è precisamente il tentativo di colmare questo gap, con risultati parziali e ancora largamente aperti.

Il terzo limite è la dipendenza dal contesto disponibile. Un LLM non ha enciclopedia nel senso di Umberto Eco — non ha esperienze vissute, embodiment, storia personale. Il suo corpus di addestramento è ricchissimo ma privo di ancoraggio esperienziale. Liu et al. (2023) hanno documentato il fenomeno del «lost in the middle»: i LLM tendono a utilizzare prevalentemente le informazioni presenti all’inizio e alla fine del contesto, trascurando quelle nel mezzo — un analogo computazionale della curva a campana dell’arricchimento contestuale.

Il contesto come risorsa critica per i LLM

La tecnica del prompt engineering — l’arte di costruire input efficaci per i LLM — è, nel vocabolario del modello qui sviluppato, precisamente l’arte di costruire la sequenza ottimale di operatori di proiezione Pcₖ che portino il vettore semantico del modello nella zona di allineamento con l’intenzione comunicativa dell’utente. Non è un’arte minore: è la forma contemporanea di retorica, applicata a interlocutori con enciclopedie strutturalmente diverse da quelle umane.

  1. La conoscenza irriducibile del particolare

La letteratura possiede almeno tre forme di conoscenza irriducibile alla formalizzazione. La prima è la conoscenza del particolare: le scienze lavorano per universali — leggi, regolarità, classi. La letteratura lavora per particolari irriducibili. Anna Karenina non descrive una classe di donne in crisi coniugale nella Russia dell’Ottocento: descrive questa donna, questo dolore, con una specificità che nessuna generalizzazione cattura. Il particolare non è un caso di un universale: ha una densità propria che la formalizzazione, per necessità metodologica, dissolve.

La seconda è la conoscenza temporale: i concetti formali sono atemporali — il teorema di Pitagora non ha una storia interna. I significati umanistici sono intrinsecamente temporali: si dispiegano nel tempo, hanno un prima e un dopo, richiedono la narrazione perché la loro struttura è narrativa. Ricoeur ha mostrato come il tempo umano diventi tempo narrato solo attraverso la mediazione della storia: non c’è comprensione della propria vita senza il racconto che la organizza.

La terza è ciò che Wittgenstein, nel Tractatus, chiamava il mostrarsi contrapposto al dirsi. Certe strutture dell’esperienza non sono inesprimibili in senso mistico — sono esprimibili solo obliquamente, evocativamente, attraverso il racconto che mostra senza affermare. La poesia non fallisce nell’essere precisa: è precisa in un modo che la proposizione non sa essere.

  1. Pluralismo epistemico e unità del mondo

Il modello geometrico dell’allineamento semantico sviluppato in questo saggio permette di articolare con precisione la struttura della comprensione come fenomeno di coordinazione tra spazi semantici. Il contesto non è un accessorio del linguaggio: è il meccanismo attraverso cui gli interlocutori negoziano la proiezione condivisa di significati che altrimenti resterebbero incomparabili.

La gerarchia dei livelli di descrizione, l’autonomia nomologica dei livelli superiori, il limite gödeliano dei sistemi formali e il problema difficile della coscienza convergono verso una stessa conclusione: esistono classi di significati — quelli in prima persona, quelli normativi, quelli particolari e temporali — che non sono riducibili a nessun livello formale, non per debolezza epistemica ma per ragioni strutturali che appartengono alla logica stessa della descrizione.

Il linguaggio umanistico non è un modo approssimato di dire ciò che la matematica dice con precisione. È un metalinguaggio necessario per significati che i sistemi formali non possono nemmeno enunciare. I modelli linguistici di intelligenza artificiale mostrano, in forma computazionale, sia la potenza sia i limiti di questo schema: straordinariamente efficaci nell’allineare significati attraverso il contesto, rimangono strutturalmente esclusi dalla prospettiva in prima persona, dal gap normativo, e dalla densità del particolare vissuto.

Il mondo è uno. Ma la comprensione del mondo richiede linguaggi multipli — non come compromesso tra rigore e ricchezza, ma come necessità logica derivante dalla struttura dell’oggetto che si vuole comprendere. Un essere che si fa domande sul proprio significato non può essere compreso solo dall’esterno: ha bisogno, per capire se stesso, di un linguaggio che parli dall’interno. Questo è ciò che la letteratura fa da sempre. Non è il passato della conoscenza — è il suo orizzonte irriducibile.

Alvise Giubelli – HumAI.it


Riferimenti bibliografici

Anderson, P.W. (1972). «More Is Different». Science, 177(4047), 393–396.

Bender, E.M., Gebru, T., McMillan-Major, A., & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. Proceedings of FAccT 2021, 610–623.

Brown, T.B., et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems, 33.

Chalmers, D. (1996). The Conscious Mind. Oxford University Press.

Gödel, K. (1931). Über formal unentscheidbare Sätze der Principia Mathematica. Monatshefte für Mathematik und Physik, 38, 173–198.

Liu, N.F., et al. (2023). Lost in the Middle. Transactions of the Association for Computational Linguistics, 12, 157–173.

Lucas, J.R. (1961). Minds, Machines, and Gödel. Philosophy, 36(137), 112–127.

Marr, D. (1982). Vision. W.H. Freeman.

Mikolov, T., et al. (2013). Distributed Representations of Words and Phrases. Advances in NIPS, 26.

Nagel, T. (1974). What Is It Like to Be a Bat? The Philosophical Review, 83(4), 435–450.

Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback. Advances in NIPS, 35.

Penrose, R. (1989). The Emperor’s New Mind. Oxford University Press.

Pennington, J., Socher, R., & Manning, C.D. (2014). GloVe. Proceedings of EMNLP 2014, 1532–1543.

Putnam, H. (1975). Mind, Language and Reality. Cambridge University Press.

Ricoeur, P. (1983–1985). Temps et récit (3 voll.). Éditions du Seuil.

Sperber, D., & Wilson, D. (1986). Relevance: Communication and Cognition. Harvard University Press.

Vaswani, A., et al. (2017). Attention Is All You Need. Advances in NIPS, 30.

Wei, J., et al. (2022). Chain-of-Thought Prompting. Advances in NIPS, 35.

Wittgenstein, L. (1921). Tractatus Logico-Philosophicus. Annalen der Naturphilosophie.