cat transformer-attention.md
N°044Macchine che imparanoPseudocodice
attention(Q, K, V)
Il transformer e i fondamenti dell'AI che parla
Nel 2017 un gruppo di ricercatori pubblicò «Attention Is All You Need», introducendo il transformer: l'architettura di rete neurale che sta alla base dei grandi modelli linguistici moderni. Questo pezzo racconta l'idea tecnica da cui è nata l'intelligenza artificiale generativa che oggi scrive testi e tiene conversazioni.
- Anno
- 2017
- Era
- 2010-2019
- Linguaggio
- Pseudocodice
- Reperto
- 1 architettura
Il problema di capire una frase
Per costruire macchine che capiscano e generino il linguaggio umano, c'è un ostacolo fondamentale: il significato delle parole dipende dal contesto, spesso da parole lontane nella frase. Nella frase «la chiave era sul tavolo, l'ho presa per aprire la porta», capire a cosa si riferisce «l'ho presa» richiede di collegarla a «chiave», diverse parole prima. Il linguaggio è una rete di relazioni a distanza, non una sequenza di parole isolate.
I sistemi di intelligenza artificiale precedenti al 2017 affrontavano il testo perlopiù leggendolo in ordine, una parola dopo l'altra, cercando di mantenere una memoria di ciò che avevano letto. Questo approccio aveva limiti seri: faticava a collegare parole molto distanti tra loro, e procedendo in sequenza era lento e difficile da scalare su grandi quantità di testo. Tradurre, riassumere, comprendere testi lunghi restava arduo. Mancava un modo efficiente per far sì che ogni parola potesse considerare direttamente tutte le altre.
Nel 2017 un gruppo di ricercatori, molti dei quali a Google, pubblicò un articolo scientifico destinato a diventare uno dei più influenti della storia recente dell'informatica. Il titolo era quasi una provocazione: «Attention Is All You Need», l'attenzione è tutto ciò che serve. In quel titolo c'era il nome della soluzione, e di una nuova architettura: il transformer.
L'attenzione come meccanismo
L'idea centrale del transformer è un meccanismo chiamato attenzione, in inglese attention. In termini semplici, l'attenzione permette al sistema, mentre elabora ogni parola, di guardare contemporaneamente tutte le altre parole del testo e di decidere quali siano più rilevanti per dare senso a quella in esame. Tornando all'esempio, elaborando «presa», il meccanismo di attenzione può pesare fortemente il legame con «chiave», riconoscendo che è lì il riferimento importante.
Questa capacità di mettere in relazione ogni parola con ogni altra, direttamente e simultaneamente, fu la svolta. Invece di leggere faticosamente in sequenza tenendo a mente il passato, il transformer considera l'intero testo in parallelo, pesando le connessioni tra tutte le sue parti. Questo non solo cattura molto meglio le relazioni a distanza che danno senso al linguaggio, ma è anche enormemente più efficiente da calcolare su hardware moderno, perché molte operazioni possono avvenire contemporaneamente invece che una dopo l'altra.
Fu proprio questa efficienza, unita alla potenza, a cambiare tutto. Il transformer poteva essere addestrato su quantità di testo prima impensabili, sfruttando appieno la potenza di calcolo disponibile. Si era trovata un'architettura che imparava il linguaggio in modo più profondo e che, allo stesso tempo, poteva crescere di scala. La porta verso modelli sempre più grandi e capaci era spalancata.
Dalla teoria ai modelli che parlano
Il transformer si rivelò la fondazione su cui costruire i grandi modelli linguistici, i sistemi di intelligenza artificiale addestrati su enormi quantità di testo che oggi conosciamo. Negli anni successivi al 2017, sfruttando questa architettura e aumentandone progressivamente la scala — più dati, più capacità di calcolo, più parametri — nacque una nuova generazione di modelli capaci di scrivere, tradurre, riassumere, rispondere a domande e sostenere conversazioni con una fluidità che ha sorpreso il mondo.
Questi modelli imparano in modo affascinante e per certi versi sconcertante: analizzando quantità sterminate di testo, apprendono a prevedere quali parole seguano altre parole, e in questo processo finiscono per catturare schemi profondi del linguaggio e, in qualche misura ancora dibattuta, della conoscenza in esso contenuta. Non seguono regole scritte da programmatori, ma sviluppano le proprie rappresentazioni interne, opache anche ai loro creatori, esattamente come accadeva, su scala minore, con l'AlphaGo che questo archivio racconta in un altro reperto.
È importante essere onesti sulla natura di questi sistemi, evitando sia il facile entusiasmo sia il rifiuto sprezzante. Sono strumenti statistici di straordinaria potenza, che producono testo plausibile prevedendo continuazioni probabili; non sono coscienti, non comprendono nel senso umano del termine, e possono sbagliare con grande sicurezza. Ma la loro utilità e il loro impatto sono reali e profondi, e stanno ridisegnando il rapporto tra le persone e l'informazione. Lo strumento con cui stai interagendo per leggere e costruire queste stesse pagine appartiene a questa famiglia.
Perché custodirlo
Il transformer merita una teca perché è l'architettura che ha reso possibile l'esplosione dell'intelligenza artificiale generativa, una delle trasformazioni tecnologiche più rapide e dibattute della nostra epoca. Pochi articoli scientifici hanno avuto un impatto così immediato e così vasto: in pochi anni, l'idea introdotta in quel paper del 2017 è uscita dai laboratori per finire nelle mani di centinaia di milioni di persone, cambiando il modo in cui scriviamo, cerchiamo, lavoriamo e impariamo.
C'è una continuità storica che questo reperto, collocato verso la fine dell'archivio, mette in luce. L'intelligenza artificiale di oggi non è nata dal nulla: poggia su tutto ciò che la precede in questo museo. Sui fondamenti teorici di Turing, che definì cosa una macchina può calcolare. Sui transistor che forniscono la potenza di calcolo. Sui linguaggi e le astrazioni che permettono di programmare. Sull'idea di macchine che imparano dai dati, vista con AlphaGo. Il transformer è l'ultimo anello, per ora, di una lunghissima catena.
Custodire `attention(Q, K, V)` significa registrare il momento in cui l'informatica ha compiuto un altro salto nel suo rapporto con il linguaggio e il pensiero, con tutte le promesse e le inquietudini che questo comporta. È il reperto più recente e forse il più aperto: la sua storia è ancora in corso, le sue conseguenze ancora da capire. Il museo del codice arriva fin qui, alle soglie del presente, e ci consegna le domande con cui dovremo convivere su cosa significhi pensare, creare e capire in un mondo abitato anche da macchine che usano il linguaggio.
Punti chiave
- Capire il linguaggio richiede di collegare parole anche distanti tra loro: il significato dipende dal contesto.
- I sistemi prima del 2017 leggevano il testo in sequenza, faticando con le relazioni a distanza e con la scala.
- Nel 2017 il paper «Attention Is All You Need» introdusse il transformer e il meccanismo di attenzione.
- L'attenzione permette a ogni parola di considerare direttamente tutte le altre e pesarne la rilevanza, in parallelo.
- Efficiente e potente, il transformer è la base dei grandi modelli linguistici moderni che scrivono e conversano.
- È l'ultimo anello di una catena che poggia su Turing, i transistor, i linguaggi e le macchine che imparano.