Il transformer e i suoi limiti strutturali
Nel giugno 2017 un gruppo di ricercatori di Google pubblicò su arXiv il lavoro intitolato “Attention Is All You Need”, introducendo il transformer. All’epoca la maggior parte dei sistemi di elaborazione del linguaggio naturale si basava su reti ricorrenti (RNN) che elaboravano le sequenze passo‑a‑passo, risultando poco efficienti sulle GPU a causa della natura seriale del calcolo.
Il transformer rimpiazzò la ricorrenza con un meccanismo di attenzione che confronta ogni token con tutti gli altri tramite una moltiplicazione di matrici, rendendo possibile la parallelizzazione. Nove anni dopo, quel blocco rimane al cuore di quasi tutti i modelli linguistici commerciali, ma la sua onnipresenza evidenzia anche i punti deboli.
Il costo della quadraticità
L’attenzione densa costruisce una matrice di punteggi di dimensione n × n, dove n è la lunghezza della sequenza. Raddoppiare il contesto quadruplica il lavoro computazionale e la memoria necessaria. In fase di pre‑fill i tempi crescono in modo non lineare con la dimensione del prompt, mentre in decodifica la cache delle chiavi e dei valori diventa il vincolo dominante sulla memoria dell’acceleratore, ben prima dei pesi del modello.
Ottimizzazioni come FlashAttention hanno ridotto i costi di accesso in memoria, ma non hanno modificato l’ordine asintotico: il termine quadratico resta un quadrato.
Le conseguenze economiche sono evidenti. L’Agenzia internazionale per l’energia stima che i consumi dei data center passeranno da circa 485 TWh nel 2025 a circa 950 TWh nel 2030, con i carichi di intelligenza artificiale in crescita ben più rapida della media. Il paradosso è che le innovazioni recenti – modelli di ragionamento con catene di pensiero estese, agenti che scambiano output – producono contesti lunghissimi, proprio dove il transformer è più debole.
Strategie per ridurre la complessità dell’attenzione
La via più diretta consiste nel cambiare il modo in cui l’attenzione seleziona le coppie di token da confrontare. Sono state proposte diverse tecniche:
- Pattern fissi: finestre scorrevoli o maschere predefinite.
- Attenzione a stato latente: riduzione dinamica della matrice.
- Sparsità appresa: il modello impara a focalizzarsi solo sui token rilevanti.
Il risparmio computazionale è spesso pagato in termini di qualità, ma le ricerche più recenti cercano di minimizzare tale compromesso.
Subquadratic: sparsità appresa in pre‑addestramento
Subquadratic, startup di Miami uscita dallo stealth il 5 maggio 2026 con ventinove milioni di dollari di seed, afferma di aver risolto il compromesso mediante un meccanismo in cui la sparsità è appresa durante il pre‑addestramento; l’attenzione esatta viene calcolata solo sui token rilevanti per la sequenza corrente.
I risultati dichiarati sono impressionanti: una finestra di dodici milioni di token, 81,8 % di accuratezza su SWE‑Bench Verified e un pre‑fill più di cinquanta volte più rapido di FlashAttention al milione di token. Tuttavia, buona parte della comunità richiede verifiche indipendenti prima di accettare la tesi che il collo di bottiglia quadratico sia stato realmente superato.
Manifest AI e il power retention
Manifest AI ha adottato una via radicale, sostituendo i layer di attenzione con i layer di power retention. Si tratta di un meccanismo ricorrente il cui stato ha dimensione costante e viene aggiornato token per token tramite potenze simmetriche dell’input, consentendo di rappresentare dipendenze di ordine superiore senza una cache che cresce con il contesto.
Il costo per token non dipende più dalla lunghezza della sequenza. L’azienda ha inoltre dimostrato una conversione pratica: riaddestrando Qwen3‑14B‑Base in un modello privo di attenzione, Brumby‑14B‑Base, ha impiegato sessanta ore su trentadue schede H100 a un costo di circa quattromila dollari, contro le centinaia di migliaia richieste per un pre‑addestramento da zero. Lo stesso approccio ha prodotto PowerCoder‑3B da StarCoder2‑3B, e i kernel CUDA sono stati rilasciati come open source.
Liquid AI: architetture ibride per il deployment edge
Liquid AI, spin‑out del MIT, affronta il problema dal lato del deployment. Le sue famiglie di Liquid Foundation Models combinano pochi blocchi di attenzione con blocchi convoluzionali a gate derivati da ricerche sulle reti a tempo continuo, rendendole adatte a processori che non occupano un rack intero.
Questi modelli non competono con i benchmark generalisti, ma mirano a ridurre la latenza a poche decine di millisecondi, a funzionare senza connessione, a gestire memoria di centinaia di megabyte e a mantenere i dati sul dispositivo. Nel aprile 2026 Mercedes‑Benz ha annunciato una collaborazione pluriennale per integrarli nei veicoli con MBUX di terza e quarta generazione in Nord America.
Modelli di diffusione per la generazione autoregressiva
Un altro filone attacca la generazione autoregressiva stessa. In un modello tradizionale, produrre un token alla volta richiede di rileggere l’intero set di pesi a ogni passo, facendo diventare la banda di memoria il collo di bottiglia mentre le unità di calcolo rimangono inattive.
I modelli a diffusione, invece, partono da una sequenza mascherata e la raffinano in parallelo su molte posizioni simultaneamente, trasformando un problema limitato dalla memoria in uno limitato dal calcolo – la risorsa per cui le GPU sono state progettate.
Mercury 2 di Inception: token massivi su hardware Blackwell
Inception, nata dal lavoro di Stefano Ermon a Stanford, ha lanciato a febbraio 2026 Mercury 2. Il modello dichiara più di mille token al secondo su hardware Blackwell e una finestra di 128 mila token. In un’architettura a agenti, dove la latenza si accumula a ogni ciclo, un fattore dieci di miglioramento sul tempo di risposta non è più una semplice ottimizzazione, ma apre la possibilità di costruire sistemi molto più reattivi.
Pathway e il Dragon Hatchling: una visione teorica
Pathway propone l’architettura Dragon Hatchling, basata su una rete a invarianza di scala di particelle neuronali che interagiscono
