AMD e Cerebras: una nuova era per l’inferenza AI con Helios e Wafer-Scale Engine
AMD e Cerebras annunciano una partnership per una soluzione disaggregata che migliora l'inferenza AI, combinando Helios e Wafer-Scale Engine.
In Breve
- Qual è l'obiettivo della partnership tra AMD e Cerebras?
- L'obiettivo è sviluppare una soluzione disaggregata per l'inferenza AI che combina Helios e Wafer-Scale Engine.
- Quando sarà disponibile la nuova soluzione?
- La soluzione sarà disponibile tramite Cerebras Cloud nella seconda metà del 2026.
- Quali sono i vantaggi della nuova architettura?
- La nuova architettura promette un incremento fino a cinque volte dei token per secondo per watt rispetto a configurazioni precedenti.
AMD e Cerebras Systems hanno recentemente annunciato una partnership tecnica che promette di rivoluzionare il campo dell’inferenza nell’intelligenza artificiale. Questa collaborazione combina il rackscale Helios di AMD con il Wafer-Scale Engine (WSE) di Cerebras, creando una soluzione disaggregata che sarà disponibile tramite Cerebras Cloud nella seconda metà del 2026.
Secondo i test interni condotti dalle due aziende, la nuova architettura potrebbe portare a un incremento fino a cinque volte dei token per secondo per watt (TPS/W) rispetto a una configurazione WSE standalone. Questo miglioramento è stato misurato utilizzando l’open-source Kimi 2.6 1T, un modello di machine learning che utilizza un trilione di parametri totali.
La struttura proposta sposta la fase di prefill e l’elaborazione dei prompt sul rack Helios, compensando le minori efficienze del WSE in queste fasi, mentre il WSE si concentra sul decode e sulla generazione dei token. Il confronto è stato effettuato su Kimi 2.6, un modello mixture-of-experts che utilizza circa 32 miliardi di parametri attivi per token e un peso complessivo in INT4 di circa 500 GB. Un singolo wafer Cerebras contiene 44 GB, il che significa che un’implementazione esclusivamente basata su WSE richiederebbe oltre una dozzina di wafer. Al contrario, un rack Helios può ospitare il modello molte volte, rendendo questo miglioramento particolarmente significativo per modelli che non possono risiedere interamente su pochi wafer WSE.
Nonostante i risultati promettenti, è necessario condurre ulteriori test comparativi, specialmente rispetto alle offerte rackscale di altri fornitori. Attualmente, i termini finanziari dell’accordo tra AMD e Cerebras non sono stati resi noti, ma il movimento arriva in un momento in cui Nvidia ha recentemente concordato una licenza non esclusiva per la tecnologia di SRAM decode di Groq, valutata 20 miliardi di dollari.
L’annuncio di questa partnership giunge in un contesto di crescente attenzione da parte degli investitori e del mercato sul finanziamento circolare nel settore dell’intelligenza artificiale. Nel frattempo, Cerebras, che è stata quotata a maggio, ha registrato oscillazioni significative del titolo, mentre AMD continua a mantenere rialzi rilevanti del valore azionario dall’inizio dell’anno.
