Introduzione all’acquisizione
Il 28 settembre AMD ha annunciato l’acquisto di World Labs, una startup specializzata in world model capaci di ricostruire ambienti 3D a partire da poche fotografie. La transazione, interamente in azioni, è valutata circa 8,2 miliardi di dollari e si prevede il closing entro la fine del 2026. Fei‑Fei Li, cofondatrice di World Labs, diventa executive vice‑president e chief scientist, riferendo direttamente a Lisa Su, mentre i cofondatori Justin Johnson e Ben Mildenhall guidano il team di ricerca.
AMD giustifica l’acquisto con una motivazione prevalentemente tecnica: con l’espansione dell’intelligenza artificiale verso ragionamento, robotica, simulazione e physical AI, i carichi di calcolo si stanno diversificando. Possedere il modello alla base di tali carichi permette di anticipare le esigenze di architettura per le future GPU.
Il modello Atlas: un world model multimodale
Presentato il 1 settembre, Atlas è un modello addestrato da zero che opera nativamente su testo, immagini, video, pose della telecamera e mappe di profondità. World Labs lo descrive come un transformer a diffusione autoregressivo e multimodale: genera un elemento alla volta, analogamente a un modello linguistico che prevede il token successivo, ma ogni elemento è un’immagine o una mappa di profondità prodotta mediante rimozione progressiva del rumore.
Il fulcro dell’architettura è il contesto spaziale, una memoria in cui ogni immagine in ingresso è ancorata a una posizione precisa nello spazio tridimensionale. Il modello genera nuove viste mantenendo coerenza con tutto ciò che ha già osservato, consentendo la ricostruzione di una stanza da sole due o tre foto scattate con un telefono.
Le prestazioni dichiarate sono ambiziose: Atlas può generare fino a un minuto di video a 1440 p con controllo della telecamera al pixel. Nei test con valutatori umani è stato preferito nel 94 % dei confronti con Seedance 2.5, nell’81 % rispetto a Gemini Omni Flash e nel 75 % contro MiniMax H3 per aderenza al movimento richiesto.
Precisione nella ricostruzione 3D
Nella tradizionale sfida di computer vision di ricostruire scene 3D da poche viste, Atlas registra un errore medio inferiore ai migliori modelli open source specializzati. L’output può essere una nuvola di punti o un insieme di Gaussian splat: milioni di piccole ellissi colorate che si renderizzano in tempo reale sul dispositivo, tecnologia già usata nel prodotto commerciale Marble, il primo prodotto di World Labs.
Integrazione di SceniX e la catena real‑to‑sim‑to‑real
A luglio 2023 World Labs ha incorporato SceniX, società che trasforma compiti robotici reali in simulazioni. Il motore real‑to‑sim‑to‑real registra un compito fisico, lo ricostruisce come mondo interattivo conservando aspetto, geometria e dinamica (rigidi, articolati o deformabili come i cavi), e lo moltiplica in migliaia di varianti modificando illuminazione e disposizione degli oggetti.
Le politiche di controllo addestrate con zero dati raccolti nel mondo reale sono state trasferite direttamente su piattaforme diverse, tra cui bracci ALOHA, xArm, Flexiv e il robot bimanuale RB‑Y1. In test, le politiche hanno funzionato per un’ora consecutiva senza interventi umani su compiti quali inserimento di cavi elastici o prelievo di pennarelli da un mucchio disordinato.
Ogni checkpoint è stato valutato su 2 000 prove simulate contro 100 prove reali; la simulazione ha preservato la classifica relativa delle politiche. Sebbene i risultati siano ancora privi di verifica indipendente, indicano uno spostamento dell’addestramento dei robot dalle ore su hardware fisico a ore su GPU nei data center, carico che AMD è pronta a servire.
Implicazioni per l’hardware AMD
La presenza di Atlas in casa offre ad AMD la possibilità di individuare i colli di bottiglia prima di fissare l’architettura della prossima GPU. Atlas eredita dai modelli linguistici le tecniche di serving, come la cache delle chiavi e dei valori e il serving disaggregato, e dai modelli di diffusione le ottimizzazioni di accelerazione, tra cui la distillazione per ridurre i passaggi di denoising.
Il carico è ibrido: parte limitata dalla banda di memoria (generazione di testo) e parte dal calcolo (generazione video). Le prestazioni crescono con la potenza di addestramento, fornendo a AMD un benchmark interno per ottimizzare le future GPU Instinct.
Software: il ruolo di ROCm
Storicamente il punto debole di AMD è il software. ROCm, lo stack open source che traduce il lavoro dei modelli sulle GPU Instinct, ha ridotto il divario rispetto a CUDA di Nvidia soprattutto sui modelli linguistici, ma rimane meno maturo per carichi multimodali e di simulazione. Un laboratorio interno che addestra da zero modelli ibridi su Instinct funge da stress‑test permanente e da riferimento per le ottimizzazioni di kernel, le quali possono finire nelle librerie che utilizzeranno i clienti.
Questo approccio ricorda la strategia di Nvidia, che ha costruito il proprio vantaggio facendo girare in casa i modelli da accelerare, creando poi un ecosistema di software ottimizzato.
Confronto tecnico con lo stack di Nvidia
- Modelli e dati: Atlas supera i benchmark di Seedance 2.5, Gemini Omni Flash e MiniMax H3 in termini di aderenza al movimento di camera.
- Prestazioni GPU: le ottimizzazioni ROCm per Atlas dovranno colmare il divario attuale su carichi multimodali, dove CUDA mantiene ancora un vantaggio.
- Software e ecosistema: Nvidia offre un ecosistema più consolidato per training e inferenza multimodale, ma AMD punta a differenziarsi con la specializzazione di World Labs su spazio fisico e simulazione.
Strategia edge: Ryzen AI Embedded X100
A luglio 2024 AMD ha lanciato i Ryzen AI Embedded X100, processori per robotica e automazione industriale. Le specifiche includono fino a 16 core Zen 5, una GPU integrata con fino a 40 unità di calcolo, acceleratore neurale XDNA 2, memoria unificata e un throughput complessivo di 126 TOPS. Il ciclo di vita è garantito per dieci anni.
I moduli Kria AI si affiancano a logica programmabile FPGA per il controllo deterministico. La piattaforma di sviluppo per la robotica, con nodi di percezione per ROS 2 e supporto ROCm, arriverà in accesso anticipato nel quarto trimestre 2026.
