Intelligenza artificiale, scacchi e vita.

Intelligenza artificiale, scacchi e vita.

Condividi con i tuoi amici...
Scacchi, AI e Intelligenza: un saggio

I. La scacchiera come laboratorio del pensiero

C’è un momento iconico che ha segnato la storia dell’intelligenza artificiale: il maggio del 1997, quando Deep Blue — un sistema sviluppato da IBM capace di analizzare duecento milioni di posizioni al secondo — sconfisse per la prima volta in match ufficiale il campione del mondo in carica, Garry Kasparov. Il mondo assistette sbigottito. Se una macchina poteva battere il più grande scacchista vivente, si chiedeva la gente, cosa restava di esclusivamente umano?

Quella domanda non ha ancora una risposta semplice. E nel corso del tempo si è rivelata molto più ricca di quanto l’euforia del momento lasciasse intendere. Perché la vittoria agli scacchi, come vedremo, non dice quasi nulla sulla capacità delle macchine di camminare in un bosco, di riconoscere la paura sul volto di un bambino, di navigare l’ambiguità di una trattativa commerciale. Dice invece moltissimo su cosa significa formalizzare un problema, e su dove tale formalizzazione riesce e dove fallisce.

Questo saggio muove dagli scacchi come caso paradigmatico per esplorare una serie di questioni più ampie: come l’intelligenza artificiale si sviluppa in ambienti chiusi e in ambienti aperti; cosa il Paradosso di Moravec rivela sulla gerarchia reale delle competenze cognitive; e come la teoria dell’Informazione Causale Effettiva di Erik Hoel — nata in neuroscienze — possa illuminare la struttura interna di una partita, e forse di molto altro.

◆ ◆ ◆

II. Sistemi completamente informati e sistemi aperti

La perfezione degli scacchi come sistema chiuso

Gli scacchi sono un sistema completamente informato e deterministicamente chiuso. Ogni stato del gioco è definito da una lista finita di parametri — posizione dei 32 pezzi, turno, diritti di arrocco, presa en passant, contatore di mosse — e la funzione di transizione da uno stato al successivo è perfettamente nota, non probabilistica, e interamente contenuta nel regolamento. Non esiste informazione nascosta: entrambi i giocatori vedono l’intera scacchiera.

Definizione — Sistema completamente informato
Un sistema si dice completamente informato (o perfect information game nella teoria dei giochi) quando ogni agente conosce l’intero stato del sistema in ogni momento. Gli scacchi, la dama e il Go sono esempi canonici. Si distinguono dai giochi a informazione imperfetta come il poker, dove parte dello stato è nascosto agli agenti.

Questa chiusura ha una conseguenza fondamentale: il problema dell’ottimalità è in linea di principio risolto. L’albero di gioco degli scacchi è finito (Shannon stimò circa 10120 posizioni legali, il “numero di Shannon”), e un agente con risorse computazionali illimitate potrebbe navigarlo completamente e trovare la mossa perfetta in ogni posizione. Il problema è puramente pratico: lo spazio è troppo grande per l’esplorazione esaustiva, ma la sua struttura è matematicamente trasparente.

Questo rende gli scacchi un dominio ideale per testare algoritmi. Non c’è ambiguità su cosa significhi “vincere”. Non ci sono fattori nascosti. Non cambia nulla di esterno durante la partita. Il mondo non irrompe sulla scacchiera. È un laboratorio sterile, e proprio per questo estremamente utile — ma anche, come vedremo, gravemente fuorviante se si tenta di generalizzare.

Il mondo reale come sistema radicalmente aperto

Il mondo in cui viviamo e lavoriamo è l’esatto opposto. È un sistema aperto, parzialmente osservabile, non stazionario e ad alta dimensionalità. Le informazioni disponibili sono sempre incomplete. Le regole del gioco cambiano mentre lo si gioca. Gli obiettivi sono spesso contraddittori, impliciti, o non formulabili in forma matematica. Il feedback non è immediato né privo di rumore.

Guidare un’automobile in una città affollata implica la gestione simultanea di pedoni imprevedibili, segnali ambigui, condizioni meteo variabili, intenzioni altrui leggibili solo da indizi sociali sottili. Non esiste un “regolamento” completo della guida urbana; ogni situazione è parzialmente inedita. Il medico che visita un paziente non ha accesso a una lista esaustiva dei parametri rilevanti: deve ipotizzare, escludere, aggiornare la sua comprensione a ogni nuovo dato. Il manager che negozia con un fornitore naviga un campo di interessi, emozioni, vincoli impliciti e relazioni storiche che nessun albero di gioco potrebbe rappresentare.

Caratteristica Scacchi (sistema chiuso) Mondo reale (sistema aperto)
Informazione disponibile Completa Parziale e rumorosa
Regole Fisse, complete, note Implicite, mutevoli
Spazio degli stati Finito (enorme) Infinito e continuo
Criterio di successo Univoco (matto) Ambiguo, multiplo
Feedback Immediato, preciso Ritardato, rumoroso
Generalizzazione richiesta Nessuna (dominio fisso) Continua, imprevedibile
Costo errore Perdita partita Potenzialmente irreversibile

La distinzione non è accademica: è la ragione per cui un motore scacchistico che batte qualunque umano vivente non sa attraversare una stanza senza inciampare, non sa interpretare il tono ironico di un contratto, non sa adattarsi a un interlocutore che cambia le regole a metà trattativa. Queste non sono limitazioni ingegneristiche superabili con più potenza di calcolo: riflettono una differenza strutturale nel tipo di problema affrontato.

◆ ◆ ◆

III. Come la macchina ha imparato a giocare

Dalla forza bruta alla comprensione posizionale

La storia dei motori scacchistici è, in miniatura, la storia dell’intelligenza artificiale. La prima generazione — da Shannon (1950) a Deep Blue (1997) — si basava su una combinazione di ricerca per forza bruta nell’albero di gioco (algoritmo minimax con potatura alpha-beta) e funzioni di valutazione codificate a mano da esperti: struttura dei pedoni, sicurezza del re, mobilità dei pezzi, controllo del centro. Questi sistemi non “capivano” gli scacchi; applicavano euristiche ingegneristiche a velocità inumana.

La svolta concettuale arriva nel 2017 con AlphaZero di DeepMind.1 Il sistema partiva da zero — senza alcuna conoscenza umana incorporata oltre alle regole — e apprendeva giocando milioni di partite contro se stesso attraverso il reinforcement learning. La sua architettura combinava una rete neurale profonda per la valutazione delle posizioni con il Monte Carlo Tree Search (MCTS) per l’esplorazione dell’albero di gioco. Il risultato fu strabiliante: in poche ore di autoapprendimento, AlphaZero superò Stockfish, il motore più forte al mondo, con uno stile di gioco che i Grandi Maestri descrivevano come “alieno” per la sua creatività posizionale.

“AlphaZero ha scoperto da solo concetti scacchistici che l’umanità ha impiegato secoli a elaborare: il valore dei pezzi attivi, la debolezza delle case, il sacrificio posizionale. Li ha reinventati in poche ore.” — Garry Kasparov, prefazione a Game Changer, 2018

La terza generazione — rappresentata da Stockfish 12 in poi — è ibrida: mantiene la ricerca alpha-beta tradizionale (che su CPU è molto più efficiente del MCTS) ma sostituisce la funzione di valutazione manuale con una rete neurale di tipo NNUE (Efficiently Updatable Neural Network), addestrata su milioni di partite annotate. Il risultato è un sistema che combina la velocità dell’architettura classica con la comprensione posizionale di quella neurale, e che oggi supera l’Elo 3900 — circa 700 punti sopra qualsiasi umano vivente.

La stessa traiettoria nel lavoro e nella vita

L’analogia con l’AI nel mondo del lavoro è strutturalmente precisa. La prima ondata — anni ’80 e ’90 — era fatta di sistemi esperti: regole codificate a mano da specialisti di dominio, capaci di ragionare bene entro i confini esplicitamente definiti, e totalmente ciechi fuori da essi. La seconda ondata — machine learning supervisionato, anni 2000-2010 — ha imparato da dati etichettati da umani, replicando i pattern senza comprenderli. La terza ondata — i Large Language Model, dal 2020 in poi — emerge dall’autoapprendimento su corpus enormi, sviluppando capacità che i progettisti non avevano esplicitamente codificato, proprio come AlphaZero ha scoperto la strategia scacchistica senza che nessuno gliela insegnasse.

In entrambi i casi — scacchi e lavoro — il passaggio cruciale non è stato aumentare la potenza di calcolo, ma cambiare il paradigma di apprendimento: da regole esplicite a pattern emergenti dall’esperienza. E in entrambi i casi questo ha prodotto sistemi più capaci ma anche più opachi, meno interpretabili, e con failure mode meno prevedibili.

◆ ◆ ◆

IV. Il Paradosso di Moravec: la gerarchia capovolta

L’enunciato

Nel 1988, il robotico Hans Moravec formulò un’osservazione che sembrava paradossale — e che tale rimane, anche se oggi la comprendiamo meglio:2

“È comparativamente facile far esibire ai computer prestazioni di livello adulto nei test di intelligenza o agli scacchi, ed enormemente difficile — o impossibile — dargli le abilità percettive e motorie di un bambino di un anno.” — Hans Moravec, Mind Children, Harvard University Press, 1988

L’intuizione comune — che la logica astratta sia la forma più alta di intelligenza e le abilità fisiche siano banali — si rivela esatta nella direzione sbagliata. Ciò che riteniamo primitivo, elementare, “solo fisico”, è computazionalmente proibitivo. Ciò che riteniamo sofisticato — il calcolo, la logica, gli scacchi — è, per una macchina, relativamente agevole.

Visione comune Logica / scacchi Linguaggio Percezione Senso-motorio ← “facile” — “difficile” → Realtà computazionale Senso-motorio Percezione Linguaggio Logica / scacchi ← “facile” — “difficile” →

Fig. 1 — Il Paradosso di Moravec. Le due piramidi sono capovolte: ciò che l’uomo percepisce come “banale” (senso-motorio) è computazionalmente il più difficile, e viceversa.

La spiegazione evolutiva

Perché questa inversione? La risposta è evolutiva. Il sistema nervoso degli animali ha avuto circa 500 milioni di anni per affinarsi nel controllo motorio e percettivo — nell’equilibrio bipede, nel riconoscimento di predatori, nella coordinazione mano-occhio, nell’interpretazione delle espressioni facciali. Ogni generazione ha selezionato i circuiti neurali più efficienti per questi compiti. Il risultato è un’architettura biologica di complessità straordinaria, talmente ottimizzata che non richiede sforzo consapevole per operare.

Il linguaggio formale ha circa 5.000 anni. La matematica astratta, qualche millennio di più. Gli scacchi, 1.500 anni. Sono acquisizioni recenti, sovraimposte su un substrato evolutivo antichissimo. La corteccia prefrontale che le gestisce è evolutivamente giovane, energeticamente costosa, e — paradossalmente — più facile da replicare artificialmente proprio perché è più “trasparente”: opera su simboli discreti, con regole esplicite, in un modo che si presta alla formalizzazione.

Il cervelletto — che coordina il movimento — contiene circa il 80% dei neuroni del cervello pur rappresentandone il 10% in volume.3 È un supercomputer biologico dedicato interamente al controllo senso-motorio, e la sua complessità ci è largamente incomprensibile. Quando un pianista esegue un arpeggio a 120 BPM, il suo cervelletto sta risolvendo in tempo reale un problema di controllo motorio che nessun robot attuale riesce a replicare con la stessa fluidità e adattabilità.

La conoscenza tacita: sapere senza poter dire

Michael Polanyi, filosofo della scienza, introdusse negli anni ’50 il concetto di conoscenza tacita (tacit knowledge): “We can know more than we can tell”.4 Sappiamo più di quanto possiamo dire. Un ciclista non sa spiegare come mantiene l’equilibrio — eppure lo mantiene perfettamente. Un carpentiere riconosce la qualità del legno al tatto, senza poter tradurre quella competenza in algoritmo. Un violinista regola la pressione dell’archetto in tempo reale attraverso feedback tattile e acustico che non ha mai codificato consapevolmente.

Questa conoscenza incorporata, distribuita in muscoli, riflessi, abitudini motorie, è resistente alla digitalizzazione non perché sia mistica, ma perché non è rappresentabile simbolicamente. Non si può scrivere un programma per qualcosa che non si riesce a descrivere. È per questo che la robotica ha impiegato decenni — e ancora non ci è riuscita pienamente — a replicare la deambulazione bipede di un bambino di due anni.

◆ ◆ ◆

V. Gli scacchi come specchio del lavoro: similitudini e distinzioni fondamentali

Dove l’analogia regge

La traiettoria degli scacchi computazionali anticipa la traiettoria dell’AI nel lavoro in almeno tre modi. In primo luogo, entrambi hanno attraversato la stessa sequenza storica: regole esplicite → apprendimento supervisionato → emergenza dall’autoapprendimento. In secondo luogo, entrambi mostrano lo stesso pattern di superamento delle aspettative nei domini ristretti e fallimento nei confini: un motore scacchistico è infallibile entro le 64 case, ma non sa spiegare perché ha fatto quella mossa in un modo che un umano trovi davvero illuminante. Un LLM scrive relazioni eccellenti ma può “allucinare” fatti elementari.

In terzo luogo, entrambi sollevano la stessa questione etica: il confine tra amplificazione e sostituzione. Negli scacchi, il movimento dei centauri — squadre uomo+macchina che battevano sia i computer sia i grandmaster — ha mostrato per anni che la combinazione era superiore alle parti. La stessa dinamica emerge nel lavoro: il lavoratore che usa l’AI in modo intelligente supera sia chi non la usa sia la macchina da sola. Il che sposta il valore non sulla conoscenza grezza, ma sulla capacità di guidare e valutare l’output della macchina.

Dove l’analogia si spezza

Ma la differenza strutturale tra scacchi e lavoro reale è profonda quanto la similitudine di superficie. Gli scacchi non hanno stakes morali: una mossa sbagliata si paga con un pedone perso, non con una vita rovinata. Il mondo professionale e sociale è invece carico di conseguenze irreversibili, di asimmetrie di potere, di contestualità culturale che nessun sistema attuale sa navigare con la stessa competenza di un umano esperto.

Ancora: negli scacchi, il criterio di valutazione è unico e condiviso (il valore in centipawn della posizione). Nel lavoro, i criteri sono multipli, contraddittori, impliciti, e mutano col tempo. Un avvocato che vince una causa può aver perso la fiducia del cliente. Un manager che ottimizza i KPI trimestrali può distruggere la cultura aziendale. Questa complessità valutativa è strutturalmente fuori dalla portata di qualsiasi sistema che ottimizzi una funzione obiettivo singola.

DimensioneScacchiLavoro / vita
ObiettivoUnico (matto)Multiplo, implicito, mutevole
FeedbackImmediato, certoRitardato, ambiguo
Stakes moraliAssentiCentrali
Contesto culturaleIrrilevanteDeterminante
Adattamento in corsoNon necessario (regole fisse)Essenziale (regole cambiano)
Centauro possibile?Sì (dimostrato)Sì, ma molto più complesso
◆ ◆ ◆

VI. L’informazione causale di Erik Hoel: misurare il potere delle cause

Il problema di partenza

Erik Hoel, neuroscienziato alla Tufts University, si è posto una domanda semplice nella formulazione e profonda nelle implicazioni: a quale scala descrittiva un sistema esercita la massima influenza causale su se stesso?5 È meglio descrivere il cervello come insieme di neuroni che sparano, o come insieme di strutture cognitive (memoria, attenzione, volontà)? Quando diciamo che “la sete ha causato la bevuta”, stiamo usando una descrizione macroscopica. Ma la sete è riducibile a stati molecolari. Quella riduzione preserva il potere causale, o lo perde?

Per rispondere, Hoel ha sviluppato la nozione di Effective Information (EI), una misura quantitativa del potere causale di uno stato su quello successivo. Intuizione di base: un buon cause è uno stato che, se lo conosci, ti dice molto sul futuro. Un cattivo cause è uno stato che, anche se lo conosci, non ti dice quasi niente di più di quanto sapevi già.

La formula e i suoi termini

La formula è la seguente:

Effective Information — Hoel, 2013 EI = H( Xt+1 | do(Xt = uniform) ) − H( Xt+1 | do(Xt) ) H = entropia di Shannon  |  do(·) = operatore di intervento causale (Pearl)  |  uniform = distribuzione uniforme su tutti gli stati

Scomponiamo ogni termine con cura.

H è l’entropia di Shannon: misura quanta incertezza c’è su una variabile. Se un evento è certo, H = 0. Se tutti gli eventi sono equiprobabili, H è massima. In altri termini: H è la sorpresa media del sistema — quanto ti stupisci, in media, di ciò che accade.

do(·) è l’operatore di intervento introdotto da Judea Pearl.6 Non è una semplice condizione probabilistica. Mentre P(Y|X=x) chiede “dato che osservo X=x, cosa mi aspetto di Y?”, il do(X=x) chiede “se forzo X ad essere x, tagliando ogni altra influenza esterna, cosa succede a Y?”. È la differenza tra osservare che qualcuno porta l’ombrello (correlato con la pioggia) e fare in modo che qualcuno porti l’ombrello (che non causa la pioggia). Il do(·) è la formalizzazione matematica dell’intervento sperimentale.

Il primo termine — H(Xt+1 | do(Xt = uniform)) — misura quanta incertezza c’è sullo stato futuro quando si forza lo stato attuale a essere uniformemente casuale: si esplora l’intero spazio degli stati con ugual peso. È il “potenziale causale grezzo” del sistema: quanto diversi stati futuri il sistema può produrre, se messo in moto da qualunque punto di partenza.

Il secondo termine — H(Xt+1 | do(Xt)) — misura quanta incertezza rimane sullo stato futuro dato lo stato attuale specifico. Se la posizione attuale determina quasi completamente il prossimo stato, questo termine è basso. Se il futuro è imprevedibile anche conoscendo il presente, è alto.

La differenza EI misura quanto lo stato attuale riduce l’incertezza sul futuro rispetto al caos completo. È il potere causale dello stato: quanto “sapere dove sei” ti dice su “dove andrai”.

Analogia intuitiva
Immagina di puntare una torcia su una mappa. Il primo termine è quanto spazio esiste sulla mappa (quanto grande può essere il futuro). Il secondo è quanto buio rimane nella zona dove punta la tua torcia (quanto il presente lascia incerto il futuro). La EI è la differenza: quanto illuminare il tuo punto attuale riduce il buio complessivo. Uno stato causalmente ricco è come una torcia potentissima: illuminare il presente chiarisce quasi tutto il futuro. Uno stato causalmente povero è come una torcia che illumina solo se stessa.

Due modi di avere EI = 0

Un aspetto sottile della teoria che Hoel enfatizza è che EI zero può emergere da due cause strutturalmente opposte:

Degenerazione: molti stati diversi portano allo stesso stato futuro. La causa non distingue nulla, perché il futuro è determinato indipendentemente dalla causa. È il caso di un finale di scacchi dove qualunque sequenza di mosse porta alla patta per ripetizione: il futuro è certo, ma non dipende dal passato in modo informativo.

Rumore: uno stesso stato porta a stati futuri completamente casuali. La causa non determina nulla, perché il futuro è indipendente dal passato. È il caso di una posizione scacchistica altamente caotica dove anche l’analisi più profonda non riesce a distinguere mosse buone da mosse cattive: l’incertezza non si riduce nemmeno conoscendo lo stato attuale.

◆ ◆ ◆

VII. Applicare Hoel agli scacchi: misurare la tensione causale di una partita

La mappatura formale

La trasposizione del framework di Hoel agli scacchi è naturale. Lo stato Xt è la posizione sulla scacchiera al turno t, definita da pezzi, turno, diritti di arrocco, en passant. La funzione di transizione è l’insieme delle mosse legali. Lo spazio degli stati futuri Xt+1 è l’insieme delle posizioni raggiungibili con una mossa.

In questo contesto si possono definire due parametri derivati di notevole interesse:

Determinismo posizionale D(Xt) = 1 − H(mosse legali da Xt) / log2(bmax) Misura quanto la posizione “restringe” lo spazio delle mosse sensate. D=1 in una posizione con una sola mossa legale; D=0 in massima libertà.
Degenerazione causale tra due stati Δ(Xt → Xt+1) = EI(Xt) − EI(Xt+1) Misura quanta struttura causale viene persa nel passaggio da una posizione alla successiva. Δ positiva grande: la mossa ha “svuotato” la tensione posizionale. Δ negativa: la mossa ha accumulato tensione.

Comportamento atteso lungo la partita

Questi parametri si comportano in modo rivelatore nelle tre fasi di una partita. Nell’apertura, il determinismo D è basso: ci sono molte mosse ragionevoli, la struttura causale è latente. La degenerazione Δ è contenuta: ogni mossa impegna la posizione senza però risolverla. La tensione si accumula.

Nel mediogioco, D oscilla drammaticamente: sale a picchi in posizioni tatticamente forzate (dove esiste una sola mossa vincente), crolla nelle posizioni strategiche aperte. Δ raggiunge il suo massimo: ogni scambio, ogni semplificazione, ogni apertura di colonne dissolve struttura causale. È la fase di massima volatilità informativa della partita.

Nel finale, D converge verso 1 nelle posizioni tecniche: le sequenze sono obbligate, la teoria le ha catalogate. Δ si azzera: non c’è più struttura da perdere, o la struttura residua è già massimamente coerente. Paradossalmente, certi finali elementari — re e torre contro re — hanno EI molto alta: conoscere la posizione attuale determina quasi completamente la traiettoria futura.

Determinismo D(t) Degenerazione Δ(t)  EI effettiva

Fig. 2 — Andamento schematico dei tre parametri lungo 60 mosse di una partita tipo. I picchi di degenerazione nel mediogioco corrispondono a mosse di semplificazione; i cali di D nell’apertura riflettono la ricchezza del ventaglio di scelte.

L’emergenza causale e il “livello giusto” di descrizione

L’idea più profonda di Hoel è che certi livelli macroscopici di descrizione hanno più potere causale di quelli microscopici. Applicata agli scacchi, questa idea acquista una forma molto concreta: una posizione con alta EI è una posizione dove i concetti macroscopici — “vantaggio di spazio”, “re scoperto”, “colonna aperta” — hanno vera forza causale. Predicono il futuro meglio dell’enumerazione delle singole mosse legali. Una posizione con bassa EI è caotica: il futuro dipende da dettagli microscopici che nessuna descrizione di alto livello riesce a catturare.

Questo è esattamente ciò che i grandi giocatori intendono quando distinguono “posizioni che si giocano da sole” da “posizioni che devi calcolare fino in fondo”. Il parametro di Hoel darebbe una misura quantitativa a questa intuizione qualitativa. E permetterebbe di rispondere a domande empiriche: AlphaZero gioca con EI media sistematicamente più alta di Stockfish? La mia ipotesi — coerente con l’osservazione che AlphaZero tende a mantenere tensione posizionale più a lungo — è di sì.

“La causalità emergente non è un’illusione: è il livello in cui il sistema esercita il massimo controllo su se stesso. Ignorarlo non è rigoroso; è perdere informazione.” — Erik Hoel, The Causal Emergence Hypothesis, Patterns, 2020
◆ ◆ ◆

VIII. Sintesi: cosa ci insegnano gli scacchi sull’intelligenza

La storia della computazione scacchistica è una parabola sull’intelligenza. Ci ha mostrato che è possibile costruire sistemi che eccellono in modo sovrumano in domini perfettamente formalizzati — e che questa eccellenza non si trasferisce automaticamente fuori da quei domini. Ci ha mostrato che l’apprendimento emergente dall’esperienza (AlphaZero) produce qualcosa qualitativamente diverso dall’applicazione di regole esplicite (Deep Blue) — più creativo, meno interpretabile, più simile a ciò che intendiamo per comprensione. E ci ha mostrato che la tensione tra strategia macroscopica e calcolo microscopico — che Hoel formalizza con la sua EI — è una struttura cognitiva fondamentale, non specifica degli scacchi.

Il Paradosso di Moravec ci ricorda che la gerarchia tradizionale dell’intelligenza — logica in cima, senso-motorio in basso — è culturalmente arbitraria e computazionalmente capovolta. Ciò che ci sembra elementare è biologicamente sofisticatissimo. Ciò che ci sembra astratto è evolutivamente recente e computazionalmente accessibile. L’intelligenza artificiale che batte Kasparov è la stessa che fatica a camminare su un marciapiede sconnesso.

Infine, la teoria di Hoel offre un linguaggio preciso per una domanda antica: quando una causa è davvero una causa? Quando lo stato attuale di un sistema determina il suo futuro in modo informativo, non ridondante né caotico, quella è una struttura causale reale — che vale la pena descrivere al suo livello proprio, sia esso neuronale, psicologico, scacchistico, o economico. L’intelligenza — naturale o artificiale — è forse proprio la capacità di trovare quel livello.

◆ ◆ ◆

Fonti e riferimenti

  1. Silver, D. et al. (2018). A general reinforcement learning algorithm that masters chess, shogi, and Go through self-play. Science, 362(6419), 1140–1144.
  2. Moravec, H. (1988). Mind Children: The Future of Robot and Human Intelligence. Harvard University Press.
  3. Herculano-Houzel, S. (2010). Coordinated scaling of cortical and cerebellar numbers of neurons. Frontiers in Neuroanatomy, 4, 12.
  4. Polanyi, M. (1966). The Tacit Dimension. Doubleday.
  5. Hoel, E. (2013). Quantifying causal emergence shows that macro can beat micro. PNAS, 110(49), 19790–19795. — Hoel, E. (2020). The Causal Emergence Hypothesis. Patterns, 1(6).
  6. Pearl, J. (2009). Causality: Models, Reasoning, and Inference. Cambridge University Press (2nd ed.).
  7. Shannon, C. (1950). Programming a Computer for Playing Chess. Philosophical Magazine, 41(314), 256–275.
  8. Campbell, M., Hoane, A., Hsu, F. (2002). Deep Blue. Artificial Intelligence, 134(1–2), 57–83.
  9. McIlroy-Young, R. et al. (2020). Aligning Superhuman AI with Human Behavior: Chess as a Model System. KDD 2020.
  10. Kasparov, G. & Greengard, M. (2018). Game Changer: AlphaZero’s Groundbreaking Chess Strategies. New in Chess.

Approfondimento matematico

Tij è la matrice di transizione i cui termini sono costituiti dalle probabilità di transizione dallo stato i-esimo allo stato j-esimo.

Vedere anche

Alvise Giubelli – HumAI.it©