GB Capital Abbonati
Equity X-Ray22 minGratisGBC Research

Equity X-Ray: In-Depth Research #32

La puntata di 20 miliardi di dollari sul chip che non dovrebbe funzionare

Equity X-Ray: In-Depth Research #32 — Golden Bear Capital research

Cerebras ha infranto una delle regole più antiche del chipmaking, costruito il processore più grande mai venduto, e convinse OpenAI a commettere più di $20 miliardi. Il test più duro inizia ora: fornire la capacità, difendere il vantaggio di velocità, e mantenere abbastanza del reddito dopo che i centri di dati sono pagati.


Informativa sulla posizione: Al momento della scrittura, GB Capital detiene una posizione di swing a breve termine in CBRS. Non siamo in attesa CBRS nel portafoglio a lungo termine.


TradingView chart
Creato con TradingView

Un wafer di silicio finito sembra troppo delicato per portare un business del valore di decine di miliardi di dollari. È sottile, riflettente e modellato con circuiti così piccoli che la superficie sembra quasi vuota fino a quando la luce lo cattura. Ogni chipmaker mainstream prende quel wafer rotondo e lo taglia in centinaia di chip separati.

Cerebras mantiene un grande quadrato di esso intatto.

Il risultato è il Wafer-Scale Engine, un processore abbastanza grande da essere tenuto in due mani e abbastanza strano da violare la logica di produzione che ha plasmato l'industria dei semiconduttori per mezzo secolo. La sua attuale famiglia WSE-3 contiene quattro trilioni di transistor, circa 900.000 core AI attivi e 44 gigabyte di SRAM distribuiti su 46.225 millimetri quadrati di silicio. Il nuovo CS-4 mette tre processori WSE-3 Turbo più veloci in un unico sistema a rack.

Quella scala fa per una fotografia eccellente. Il caso di investimento inizia da qualche parte meno visibile: i dati di distanza devono viaggiare.

Ogni volta che un grande modello di lingua scrive un altro token, il processore ha bisogno di dati dalla memoria. I sistemi convenzionali sono diventati estremamente buoni a spostare quei numeri tra GPU, memoria ad alta banda, interruttori e rack. Cerebras trascorse un decennio rimuovendo molti di questi viaggi. Ha posizionato il tessuto di elaborazione, memoria e comunicazione attraverso un pezzo continuo di silicio, poi ha costruito un'intera macchina intorno a esso.


Un QUICK NOTA PRIMA DI CONTINUARE

Di solito ci riserviamo Equity X-Rays come questo per gli abbonati pagati.

Questa è la prima volta che ne apriamo uno in pieno.

Vogliamo che tu veda il lavoro dietro la nostra ricerca: la lettura, i numeri, le prove concorrenti e le ore passate a testare una tesi prima di pubblicarlo.

Questo articolo segna anche l'inizio di un progetto molto più grande per noi.

Golden Bear Capital riunisce ora la nostra newsletter, TradeDeck, una sola chiamata con il nostro team, corsi di swing trading e crescita di investimento, e un canale YouTube gratuito dove racconteremo storie aziendali con la stessa profondità, ma attraverso video più visivi e cinematici.

Il sito non è ancora completamente finito. Aggiungiamo i contenuti e gli aggiornamenti rimanenti nelle prossime settimane, e ti terremo aggiornato come ogni nuova parte va in diretta.

Stiamo mettendo tutto quello che abbiamo nella costruzione. Se questa ricerca guadagna la vostra fiducia, date un'occhiata gb.capitalE se conosci qualcuno che lo apprezzerebbe, condividere questo articolo significa molto per noi.


OpenAI si è impegnata ora ad acquistare 750 megawatt di capacità di inferenza Cerebras nell'ambito di un accordo pluriennale che Cerebras valorizza oltre 20 miliardi di dollari. La capacità è prevista per arrivare in fasi fino al 2028. Nel mese di agosto, OpenAI ha mostrato perché si preoccupa: GPT-5.6 Sol in esecuzione nella sua limitata anteprima Ultrafast generato fino a 750 token di uscita al secondo, fino a quattordici volte la velocità di elaborazione standard, secondo OpenAI. Una settimana dopo, Cerebras ha introdotto CS-4 e ha sostenuto un altro passo avanti nella velocità e nel throughput.

Il contratto convalida la domanda. Non risolve l'argomento degli investimenti.

Cerebras deve produrre sistemi, potenza sicura, adattare i data center, supportare i modelli in evoluzione e soddisfare le date di consegna misurate in centinaia di megawatt. NVIDIA rimane la piattaforma predefinita per l'elaborazione accelerata, sostenuta da software, networking, ingegneri e infrastrutture accumulate in molti anni. Chip specializzati da AWS, Google, Groq e altri continuano a migliorare. La società ha riferito $180,1 milioni di GAAP ricavi nel secondo trimestre del 2026 e ha tenuto 8,6 miliardi di dollari di liquidità, ma ha anche speso $548,9 milioni di proprietà e attrezzature durante il primo semestre e ha prodotto un $450,5 milioni di perdita netta trimestrale GAAP, gonfio da IPO-correlato compenso azionario.

La tesi può essere indicata in una frase:

“Cerebras può diventare un prezioso specialista in in inferenza AI ad alta velocità se il suo vantaggio rimane abbastanza grande per giustificare una seconda architettura di calcolo, e se l'azienda può distribuire quell'architettura a scala senza consentire intensità di capitale, concentrazione del cliente o prezzi in calo per consumare l'economia.”

Quella frase contiene sia l'opportunità che la trappola.



La tassa di distanza in AI

Un grande modello di lingua è una raccolta di numeri appresi chiamati pesi. La formazione cambia i pesi. L'inferenza li usa per rispondere a una richiesta. Cerebras vende sistemi per entrambi i lavori, ma il contratto OpenAI e l'attuale storia del mercato pubblico sono centrati sull'inferenza.

Il modo più semplice per capire l'inferenza è dividerlo in due fasi.

Durante il periodo *precarica*, il sistema legge il prompt e il suo contesto. Le parole vengono convertite in token, elaborate in gran parte in parallelo e rappresentate in una struttura di memoria funzionante chiamata cache KV. Un lungo documento legale, un grande codebase o una lunga conversazione possono rendere la prefill pesante. Il calcolo parallelo denso e la capacità di memoria abbondante conta qui.

Durante il periodo *decode*, il modello genera la risposta un token alla volta. Ogni token dipende dalla sequenza che è venuta prima di esso. Questa dipendenza seriale significa che l'hardware non può produrre token 500 prima che abbia prodotto token 499. Legge ripetutamente i dati del modello, esegue il successivo calcolo ed emette il risultato.

Le GPU moderne sono macchine aritmetiche straordinarie. Il problema è che il decodifica può lasciare la capacità aritmetica in attesa di memoria. I pesi del modello possono sedersi in memoria ad alta larghezza di banda accanto al pacchetto GPU, e grandi modelli possono essere divisi in più GPU. I dati attraversano i confini dei pacchetti e le interconnessioni. Ogni collegamento è veloce in isolamento, ma il movimento ripetuto crea una tassa.

Batching aiuta. Un fornitore può servire molte richieste insieme e riutilizzare gli stessi pesi attraverso di loro, aumentando la produttività totale e riducendo i costi per token. Questo approccio ottimizza il data center. Una persona che guarda un agente scrive codice si preoccupa di una misura diversa: quanto tempo un lavoro prende dal prompt al risultato utile. I token massimi tra tutti gli utenti e i token massimi per un utente sono obiettivi diversi.

Figura 1: Un wafer, due architetture. I sistemi convenzionali dividono la computazione attraverso i chip confezionati e li collegano attraverso la memoria e gli strati di rete. Cerebras mantiene una grande rete di calcolo e la sua SRAM locale su un dispositivo su scala wafer. Il diagramma spiega la topologia, non prestazioni equivalenti.

Cerebras attacca la tassa di distanza con tre scelte di design collegate.

In primo luogo, ogni piccolo nucleo ha SRAM locale. SRAM è veloce perché evita diverse operazioni richieste da tecnologie di memoria più dense. Cerebras distribuisce che la memoria accanto al calcolo invece di concentrarla in pile di memoria separate. Attraverso WSE-3, quelle piccole piscine locali aggiungono fino a 44GB e, secondo l'azienda, 21.6 petabyte al secondo della larghezza di banda di memoria aggregata. WSE-3 Turbo raddoppia la cifra per-wafer a 43,2 petabyte al secondo.

In secondo luogo, i core comunicano attraverso una rete on-wafer. I dati possono passare ai nuclei vicini senza lasciare il silicio, entrando in un link di pacchetto, attraversando una scheda e passando attraverso un interruttore. Il software Cerebras mappa le operazioni e i dati in questa rete fisica.

In terzo luogo, l'architettura utilizza molti piccoli core programmabili indipendentemente. Il lavoro inizia quando i dati arrivano, e il sistema può saltare alcune operazioni su valori zero. Il design si adatta ai carichi di lavoro in cui la località, il calcolo scarso e la materia di movimento prevedibile.

Un documento indipendente del 2024 dai ricercatori dell'Università della California del Sud ha valutato una precedente generazione di WSE e ha scoperto che il suo sottosistema di memoria di 20 PB/s ha sollevato il confine a cui i carichi di lavoro testati sono diventati limitato alla memoria. Questa prova supporta il meccanismo architettonico. Non dimostra ogni confronto di marketing fatto per i prodotti successivi. Benchmarks rimangono sensibili al modello, precisione, dimensione del lotto, lunghezza di ingresso, lunghezza di uscita, impostazioni di qualità, versione software e configurazione hardware. Un tokens-per-secondo titolo senza quei dettagli è un trailer, non il film.

👉 Basta cliccare sul banner sopra per richiedere il tuo sconto esclusivo ora!

Il problema di produzione che ha ucciso i sogni precedenti di wafer

Fare un processore enorme crea un problema statistico immediato.

Le fabbriche di chip stampano modelli di circuito ripetuti attraverso un wafer di 300mm. La polvere, le imperfezioni materiali e gli errori di litografia creano difetti in luoghi casuali. Se il wafer è diviso in piccoli stampi, i produttori provano ogni morire e scartano i cattivi. Un solo difetto rovina una piccola regione piuttosto che l'intero wafer.

Aumentare l'area morire e aumenta la probabilità di incontrare un difetto. Un chip monolitico convenzionale che si avvicina alla scala wafer non avrebbe quasi nessuna possibilità di emergere perfettamente intatta. Questo è il motivo per cui i primi progetti su scala wafer hanno lottato e perché il limite di reticolo, l'area massima esposta in una fase di litografia, è diventato un confine così durevole.

Cerebras non ha eliminato i difetti. Ha ridotto la quantità di silicio utile ogni difetto può distruggere.

Il WSE contiene più core fisici e link rispetto alle esigenze del prodotto. Dopo la fabbricazione, Cerebras testa il wafer, mappe regioni fallite, disabilita i componenti danneggiati e configura il tessuto di comunicazione per aggirarli. La carta di rendimento 2026 della società dice che WSE-3 contiene circa 970.000 core totali e attiva circa 900.000. Un difetto che atterra dentro un piccolo nucleo rimuove una frazione molto piccola della macchina. I percorsi di ricambio conservano una rete logica collegata.

Questo metodo è un'estensione di una pratica familiare semiconduttore. CPU, GPU e dispositivi di memoria già spediscono con unità ridondanti o sezioni disabilitate. Cerebras ha reso la ridondanza fine e il routing contro il guasto al prodotto centrale perché un processore su scala wafer non può dipendere dalla perfezione fisica.

Figura 2: La regione difettosa rimane fisicamente danneggiata. Il test di post-fabbricazione lo identifica, le risorse di riserva assorbono la perdita, e la rete dirige il traffico attraverso i collegamenti di lavoro. Il modello è illustrativo e non rappresenta una mappa di difetto WSE reale.

Un altro problema si trova al confine tra i campi della litografia. I chip normali rimangono all'interno di un'area di esposizione. Un processore su scala wafer copre molti di loro. Cerebras utilizza il cablaggio inter-die per collegare quelle regioni attraverso le linee in cui il wafer sarebbe normalmente tagliato. Questo permette al wafer di comportarsi come un unico processore logico.

Risolvere la resa lascia ancora l'imballaggio, la consegna di energia e il raffreddamento. La descrizione di Computer History Museum del precedente CS-2 fa chiaramente il punto: il wafer si trova all'interno di un "blocco motore" che fornisce circa 20 kilowatt, collega la superficie al mondo esterno e trasporta il calore via attraverso l'hardware raffreddato ad acqua. WSE-3 e CS-4 ampliano il lavoro dei sistemi. In CS-4, Cerebras dice che la conversione di potenza in movimento da circa 50 millimetri a circa 0,5 millimetri dal processore riduce la perdita di livello di bordo e consente frequenze operative più elevate.

Il wafer è l'icona. Il prodotto è la macchina che lo circonda.


Memoria veloce ha un prezzo

SRAM dà la larghezza di banda eccezionale Cerebras, ma memorizza meno bit per unità di silicio rispetto a DRAM o HBM. Riempire un wafer con SRAM acquista velocità a scapito della densità di memoria. Il 44GB su WSE-3 è grande per SRAM on-chip e piccolo rispetto alla capacità HBM in piscina disponibile in un rack di GPU.

Ciò è importante perché i modelli di frontiera sono molto più grandi di 44GB. I cerebra non possono mettere ogni peso di un modello multi-ondato-milioni-parametro nella SRAM di un wafer contemporaneamente. Si divide il modello attraverso i sistemi o utilizza l'architettura di memoria esterna e lo streaming di peso, a seconda del carico di lavoro. I dati intermedi si muovono ancora tra le macchine. I viaggi sono meno o diversamente organizzati; non scompaiono.

Questo è anche il motivo per cui i confronti diretti del core-count mislead. Novecentomila nuclei Cerebras non sono novecentomila nuclei NVIDIA CUDA. I loro set di istruzioni, percorsi di dati, relazioni di memoria e lavoro destinato differiscono. La divisione di un numero di un altro produce un rapporto con poco significato operativo.

Il confronto onesto inizia con un lavoro. Fissare il modello, la lunghezza del contesto, la lunghezza di uscita, la dimensione del lotto, l'obiettivo di precisione e il livello di servizio. Quindi misurare il tempo a prima token, token di uscita al secondo per utente, throughput aggregato, costo, energia e tasso di fallimento. Un fornitore che ottimizza un assistente live di codifica può accettare una frontiera diversa da un'elaborazione milioni di riassunti di sfondo a buon mercato.


Abbiamo costruito questa piattaforma per livellare il nostro swing e trading momentum.

Ottenere l'accesso anticipato e sbloccare le funzioni di abbonato completo oggi.


Prefill e decodifica stanno diventando mercati separati

L'industria sta cominciando a mettere prefill e decodificare su diverse piscine di hardware. Si chiama inferenza disaggregata.

L'idea assomiglia a un ristorante con la preparazione separata e stazioni di servizio. Prefill legge e organizza l'ordine. Decodifica targhe ogni corso in sequenza. Quando entrambi i lavori condividono la stessa attrezzatura, un grande nuovo prompt può interferire con la generazione di token in corso. La separazione consente a ogni piscina di specializzarsi e riduce la contention.

Figura 3: Prefill elabora il prompt in parallelo e costruisce la cache KV. Decode produce la risposta sequenziale e ripetutamente legge i dati del modello. L'inferenza disgregata assegna ogni fase all'hardware che corrisponde al suo collo di bottiglia.

Cerebras si è appoggiato in questa divisione invece di rivendicare la rinuncia deve sostituire ogni acceleratore.

AWS prevede di abbinare Trainium con i sistemi Cerebras: Trainium gestisce prefill compute-heavy, mentre WSE gestisce la decodifica della larghezza di banda-pesante. Le aziende si aspettano che il progetto congiunto di fornire cinque volte più elevata capacità di token nella stessa impronta, una pretesa previsionale che ha ancora bisogno di prove di produzione. Il servizio è previsto attraverso Amazon Bedrock nel primo trimestre del 2027.

AMD e Cerebras hanno annunciato un accordo simile a luglio. I sistemi di rack-scale AMD Helios sono destinati a fornire prefill ad alta produttività, mentre WSE fornisce decodifica a bassa latenza. Cerebras si aspetta la prima versione attraverso il suo cloud nella seconda metà del 2026 e ha detto che la combinazione potrebbe alzare i token al secondo per watt per ben cinque volte.

Queste partnership rivelano più di una tabella di riferimento. Possano Cerebras all'interno di sistemi che utilizzano il silicio concorrente. Ciò riduce l’onere di sostituire l’intera infrastruttura del cliente. Inoltre concede che WSE ha un punto dolce più stretto di una piattaforma GPU generale.

Narrow può essere un business eccellente quando il carico di lavoro è grande, costoso e abbastanza doloroso.


Perché la velocità diventa più preziosa quando l'intelligenza inizia a lavorare

Un chatbot produce una risposta. Un agente produce una catena di azioni.

Chiedi ad un agente di codifica AI di riparare un pulsante rotto. Legge il repository, propone un cambiamento, modifica i file, esegue un test, studia il fallimento e prova di nuovo. Alcuni di quei tempi appartengono a strumenti, reti e database. Alcuni appartengono al modello che genera token. L'inferenza più veloce riduce solo la parte del modello della catena.

Questa limitazione mantiene l'analisi onesta. Un modello 10x più veloce non fa una lenta API esterna 10x più veloce. Non può trasformare un approccio sbagliato in uno corretto. Può, tuttavia, creare spazio per più tentativi, più verifica e una conversazione più stretta con l'uomo prima che la pazienza si esaurisca.

La cognizione offre un caso utile. Il suo modello di codifica SWE-1.6 viene eseguito fino a 950 token al secondo su un livello veloce alimentato da Cerebras, secondo le aziende, e i suoi strumenti SWE-grep utilizzano Cerebras per una rapida ricerca codebase. La cognizione ha riferito circa una differenza di velocità di cinque volte contro il suo livello libero alimentato dalla GPU. La decisione importante del prodotto non era quella di spostare ogni parte dell'agente su WSE. Ha usato l'inferenza veloce dove il ritardo ha danneggiato l'esperienza.

OpenAI fornisce una validazione più ampia. Il 13 agosto 2026, in anteprima GPT-5.6 Sol Ultrafast su Cerebras fino a 750 token di uscita al secondo. OpenAI ha descritto la risposta degli incidenti e la ricerca come esempi in cui il modello più breve attende consentire alle squadre di testare più ipotesi mentre le prove stanno cambiando. L'anteprima era limitata, quindi l'adozione, i prezzi, l'utilizzo e la qualità in scala rimangono domande aperte.

Gli investitori di unità economica dovrebbero guardare è utile lavoro completato per unità di tempo e di costo. Tokens al secondo importa quando si muove quel risultato. Se i clienti pagano un premio, rimanere più a lungo, eseguire più lavoro o ottenere risultati migliori a causa della velocità, Cerebras ha la potenza dei prezzi. Se ammirano la demo e tracciano carichi di lavoro di routine altrove, il vantaggio rimane tecnico piuttosto che economico.


Da azienda chip a operatore infrastrutturale

Cerebras iniziò con l'hardware. I clienti potrebbero acquistare sistemi CS per le proprie strutture, con supporto e software collegati. I ricavi hardware sono riconosciuti quando si controllano i trasferimenti di prodotti, quindi i risultati trimestrali possono oscillare con alcune grandi consegne.

Il cloud business cambia la forma dell'azienda. Cerebras possiede o controlla i sistemi implementati, assicura la capacità di data-center e vende l'accesso attraverso prenotazioni dedicate o il consumo on-demand. Le entrate possono diventare più ricorrenti, ma Cerebras porta più del peso dell'infrastruttura: leasing, fit-out, potere, utilizzo e rischio operativo.

Il secondo trimestre ha mostrato quella transizione in movimento. Il fatturato dell'hardware è sceso a 54,1 milioni di dollari da 70,3 milioni di dollari all'anno precedente. I ricavi di Cloud e altri servizi sono saliti a 16,0 milioni di dollari, con un incremento del 281%. Cloud rappresentava circa il 70% dei ricavi GAAP per il trimestre.

Quel cambiamento di mescolanza è strategicamente attraente perché i ricavi di servizio ricorrenti possono mescolare come l'utilizzo cresce. È finanziariamente impegnativo perché le macchine e gli edifici arrivano prima di tutte le entrate del servizio. La capacità ha lasciato bruciare i liquidi in contanti. La capacità promessa ma consegnata in ritardo può innescare sanzioni, periodi di servizio abbreviati o diritti di risoluzione.

Nel mese di settembre, Cerebras ha annunciato un data center 165MW a Mikkeli, in Finlandia, sotto ordini di servizio sette anni con Compute Nordic Finlandia. La costruzione della prima fase 50MW era già in corso. Il sito fa parte di un piano più ampio per raggiungere 200MW di capacità europea entro la fine del 2027. Questi annunci sono la prova di infrastrutture contratte, non la prova che la capacità è energizzata, accettata dai clienti o producendo margini target.

L'azienda ora affronta due orologi. Lo sviluppo dei semiconduttori si muove nelle generazioni di prodotti. I centri dati si muovono attraverso terra, griglia, costruzione, messa in servizio e accettazione. Le entrate arrivano solo quando entrambi gli orologi si incontrano.


Cosa OpenAI ha comprato

Il titolo dice “più di 20 miliardi di dollari.”

Il contratto dice capacità consegnate nel tempo.

Nell'ambito dell'accordo Master Relationship firmato nel dicembre 2025, Cerebras deve rendere disponibili 250MW entro la fine del 2026, altri 250MW entro la fine del 2027 e una finale di 250MW entro la fine del 2028. Ogni tranche corre per tre o quattro anni e può essere estesa da OpenAI, soggetto ai termini comunicati. OpenAI è contrattualmente impegnata ad acquistare la base 750MW come viene consegnato. Ha anche opzioni per un altro 1.25GW entro il 2030, prendendo la capacità potenziale a 2GW.

Figura 4: L'impegno di base va a 750 MW fino al 2028. Il prestito di 1 miliardo di dollari finanzia la costruzione, mentre garantisce collegamenti di giubbotto parte del potenziale azionario di OpenAI per il finanziamento, il valore di mercato e le pietre miliari di consegna. Capacità opzionale potrebbe prendere il rapporto con 2GW entro il 2030.

OpenAI ha avanzato un prestito di capitale di lavoro garantito di circa 1 miliardo di dollari nel gennaio 2026. Porta un tasso di interesse del 6%, con interesse potenzialmente rinunciato quando il rimborso avviene attraverso capacità di qualificazione, hardware, servizi o trasferimenti di attività. Il prestito matura entro il 31 dicembre 2032. Alcuni fallimenti nell'ambito dell'accordo possono dare ad OpenAI un maggior controllo sui fondi di prestito o accelerare il rimborso.

OpenAI ha anche ricevuto un mandato di acquisto fino a 33.445.026 azioni di classe N ad un prezzo di esercizio nominale. La prima tranche investita quando Cerebras ha ricevuto il prestito. Altre porzioni dipendono da capitalizzazione di mercato e pietre miliari di capacità. Completo gilet richiede OpenAI per esercitare abbastanza capacità facoltativa per raggiungere 2GW.

Il rapporto quindi collega quattro ruoli. OpenAI è un cliente, prestatore, potenziale azionista e collaboratore tecnico. Tale allineamento può aiutare Cerebras a finanziare e ottimizzare la sua costruzione. Può anche spostare il potere di negoziazione verso un cliente e creare diluizione per gli azionisti esistenti.

Il riconoscimento delle entrate aggiunge un altro strato. Cerebras ha registrato 56,8 milioni di dollari di ricavi nell'ambito dell'accordo OpenAI durante il secondo trimestre, al netto di 2,5 milioni di dollari nell'ammortamento del mandato. Alcuni costi del data-center sono rimborsati e presentati come entrate passanti con margine minimo. Un valore contrattuale, un saldo RPO, ricavi e contanti ricevuti sono quattro numeri diversi.

Al 30 giugno, Cerebras ha riferito 25,4 miliardi di dollari in obblighi di prestazione rimanenti. Circa il 22% dovrebbe essere riconosciuto nei primi 24 mesi che terminano il giugno 2028, 43% nei mesi da 25 a 48 e il resto più tardi, anche se la tempistica di distribuzione può muoversi. Il RPO offre una visibilità insolita per una giovane azienda hardware. Esso misura anche i lavori ancora dovuti.



Leggere il trimestre senza essere intrappolati dalle regolazioni

Cerebras ha riportato due versioni del suo secondo trimestre.

I ricavi totali del GAAP ammontavano a 180,1 milioni di dollari, in aumento del 74% rispetto all'anno. Gestione “core ricavi” è stato $209,9 milioni, in aumento del 103%. Il margine lordo del GAAP era del 14,2%; il margine lordo del nucleo era del 40,6%. Il margine operativo GAAP era negativo del 265%; il margine operativo centrale era negativo del 16%. La perdita netta GAAP ha raggiunto $450,5 milioni; la perdita netta principale è stata di $6,9 milioni.

Figura 5: Le misure fondamentali di Cerebras eliminano le entrate e i costi passanti, aggiungono l’ammortamento non-cash del cliente, e escludono la compensazione delle scorte e gli elementi correlati all’IPO selezionati. Le figure principali aiutano a rivelare la direzione operativa ma non sostituiscono GAAP.

Il divario deve essere compreso piuttosto che accettato o respinto.

Circa 273,6 milioni di dollari di compenso azionario è stato riconosciuto nel trimestre dopo che l'IPO ha soddisfatto la condizione di liquidità sui premi dei dipendenti più anziani. Tale spesa non è disponibile nel periodo, ma rappresenta la proprietà trasferita ai dipendenti e quindi conta agli azionisti. Cerebras ha anche registrato l'ammortamento del cliente come una riduzione dei ricavi e dei costi passanti sostenuti che la gestione sostiene oscurare l'economia della sua tecnologia e servizi.

I risultati principali mostrano che il business operativo è molto più vicino al break-even di quanto suggerisce la perdita GAAP. GAAP mostra il costo dell'equità e degli incentivi per i clienti utilizzati per costruire tale business. Un investitore ha bisogno di entrambe le viste.

Il bilancio è insolitamente forte per un'azienda in questa fase. Cerebras ha completato il suo IPO a maggio a $185 per azione, ha venduto 34,5 milioni di azioni e ha ricevuto circa $6,2 miliardi di proventi netti. Inclusi i contanti, i contanti ristretti e gli investimenti a breve termine, la liquidità ammontava a 8,6 miliardi di dollari il 30 giugno. Una struttura di credito girevole da 850 milioni di dollari ha aggiunto la capacità di prestito.

I soldi hanno un lavoro. Nei primi sei mesi del 2026, Cerebras trascorse 548,9 milioni di dollari in beni e attrezzature, principalmente sistemi per i suoi servizi cloud. Le attività operative hanno utilizzato $47.5 milioni. Firmato ma non ancora iniziato data-center leasing ha portato un altro $2,3 miliardi di pagamenti minimi indiscritti futuri, oltre $690,3 milioni di impegni di locazione esistenti divulgati a fine trimestre.

La gestione ha aumentato l'intero anno 2026 core ricavi guida a 880–890 milioni di dollari, margine lordo core al 41–43% e margine operativo core al 19% negativo al 17% negativo. Ha anche detto che ha intenzione di più di tripla entrate nel 2027. Quei numeri sono indicazioni, non si ottengono risultati.

Un dettaglio operativo merita attenzione. Cerebras ha affittato sistemi posteriori che aveva venduto perché la domanda ha superato la sua capacità cloud di proprietà. Tale decisione ha aiutato a servire i clienti, ma il margine di pressione. La gestione prevede che il margine lordo di base raggiunga il 38-40% nel Q3 prima di migliorare come infrastruttura di proprietà aziendale viene online. Questo crea un test pulito: se la capacità di proprietà sostituisce l'offerta di rent-back costoso e l'utilizzo rimane forte, i margini cloud dovrebbero recuperare. Se il recupero scivola, il mercato dovrà chiedere se i prezzi, l'utilizzo o i costi di costruzione sono più deboli del previsto.


La concentrazione è l'acceleratore e il rischio

Due clienti hanno rappresentato il 66% del fatturato del secondo trimestre. MBZUAI rappresentava solo il 34%. I ricavi OpenAI nell'ambito dell'MRA ammontavano a 56,8 milioni di dollari, circa un altro 32% del totale. G42 e MBZUAI sono parti correlate, e l'azienda si aspetta che OpenAI rappresenti una consistente parte dei ricavi previsti.

Grandi clienti rendono possibile una costruzione ambiziosa. Essi forniscono impegni, finanziamenti, credibilità e carichi di lavoro abbastanza grandi da giustificare infrastrutture specializzate. Possono anche rimodellare l'economia di un fornitore.

OpenAI ha diritti legati ai livelli di consegna e di servizio. AWS ha ricevuto un mandato per un massimo di 2.696,678 azioni di classe N a $100 per azione, con la maggior parte dei gilet legati alle soglie di pagamento. Il suo accordo commerciale comprende l'esclusività, gli impegni tariffari e le protezioni minime di capacità produttiva. Questi termini aiutano a garantire la domanda, limitando una certa libertà su offerta e prezzi.

La concentrazione dovrebbe cadere come nuovi clienti crescono, ma gli investitori dovrebbero richiedere prove. Il conte ha annunciato i loghi con cautela. Misurare il mix di entrate, la capacità distribuita e la durata del contratto. Un iperscaler che riduce un ordine può importare più di una dozzina di clienti pilota in arrivo.



NVIDIA è un sistema, non un rettangolo su uno scorrevole di confronto

Cerebras è spesso incastrato come un killer NVIDIA perché l'immagine è semplice: un enorme wafer contro un rack di GPU. Il mercato è meno cinematografico.

NVIDIA vende processori, networking, librerie di software, runtime di inferenza, strumenti di modello, orchestrazione e supporto aziendale. CUDA, TensorRT, Triton, NIM, NeMo, operatori GPU e il resto dello stack siedono all'interno dei flussi di lavoro dei clienti. Gli ingegneri li conoscono. Le nuvole le vendono. I centri dati sono collegati intorno a loro. Un concorrente deve offrire abbastanza valore da pagare per l'integrazione, la riqualifica, la complessità operativa e il rischio di aggiungere un altro fornitore.

Le GPU servono anche una vasta gamma di lavori. Prefill pesante, formazione, contesti lunghi, modelli multimodali, elaborazione scientifica e carichi di lavoro che cambiano spesso possono favorire flessibilità e grandi piscine di HBM. NVIDIA migliora sia hardware che software ad una cadenza veloce. Può attaccare decodifica attraverso una migliore memoria, batching, tecniche speculative, quantizzazione e componenti specializzati.

Cerebras non ha bisogno di sostituire NVIDIA attraverso il data center. La sua apertura pratica è di possedere una fase preziosa di un sistema più grande. Le partnership AWS e AMD rendono esplicita questa strategia. Un cliente può mantenere una piattaforma di prefill familiare e inviare decodifica a WSE quando la velocità conta.

Figura 6: Cerebras può avere successo come specialista di alto valore senza sostituire GPU. L'investimento si attiva su quattro variabili osservabili: megawatt dispiegati, margine nuvoloso, mix cliente e token utili per watt.

Altri specialisti aggiungono pressione. Google e AWS progettano i propri acceleratori. Groq ha costruito un'architettura di inferenza SRAM-heavy e una tecnologia autorizzata a NVIDIA. SambaNova e nuovi sistemi di flusso di dati mirano a problemi adiacenti. L'architettura del modello può cambiare più velocemente del design del chip. Le tecniche che riducono il numero di gettoni generati, comprimere pesi o modificare l’accesso alla memoria possono cambiare il valore dei punti di forza di Cerebras.

Il moat deve vivere in produzione: qualità del compilatore, supporto del modello, uptime, velocità di distribuzione, costo totale e risultati dei clienti sostenuti. I brevetti sono importanti. Un capo di dieci anni ha importanza. Né ferma un cliente di scegliere un'alternativa abbastanza buona già integrata nel suo stack.


Il fondatore e il modello dietro l'azienda

Andrew Feldman aveva già costruito una società di hardware data-center prima di Cerebras. SeaMicro ha progettato microserver densi e a basso consumo energetico e un tessuto ad alta larghezza di banda. AMD l'ha acquisita nel 2012 per circa 334 milioni di dollari. Feldman fondò poi Cerebras con Gary Lauterbach, Michael James, Sean Lie e Jean-Philippe Fricker.

La connessione è visibile. SeaMicro ha trattato la comunicazione tra molti processori come un problema di progettazione di prima classe. Cerebras ha spinto lo stesso istinto su un wafer: il calcolo conta, ma i percorsi tra le unità di calcolo spesso decidono le prestazioni del sistema.

Il record normativo comprende anche un fatto che appartiene a un profilo di investitore. Nel 2007, Feldman si dichiara colpevole di aver aggirato i controlli contabili interni a Riverstone Networks, un precedente datore di lavoro, e ha ricevuto una prova e una multa. L'evento si è verificato anni prima di Cerebras e non stabilisce cattiva condotta presso l'attuale società. Resta rilevante quando gli azionisti pubblici valutano la governance e la fiducia.

La sfida della leadership attuale è meno di dimostrare l’audacia tecnica. I sistemi WSE sono spediti dal 2020, hanno raggiunto i clienti e sono entrati nel Computer History Museum. La sfida sta operando una società pubblica di capitale pesante il cui contratto più grande può premiare o punire l'esecuzione a scala senza precedenti.

Mettere il mercato sul pilota automatico, sperimentare la migliore piattaforma con TC2000

Valutazione: usare pietre miliari prima dei decimali

Cerebras è difficile da valutare con un modello di guadagno convenzionale.

Ha guadagni negativi GAAP, negativo flusso di cassa libero, un rapido passaggio da hardware a servizi cloud, garanzie collegati al cliente e un backlog dominato da capacità che non è ancora stata consegnata.

Un multiplo dal prezzo alla vendita sembra semplice e può nascondere la domanda centrale. Un dollaro di ricavi passa-pass-through a basso margine non è uguale a un dollaro di ricavi cloud ad alta utilizzazione. Un dollaro riconosciuto dalla capacità dell'azienda può avere economia diversa da un dollaro servito attraverso sistemi di back-back in affitto. La crescita senza il ponte di margine può distruggere il valore anche quando il grafico delle entrate sembra spettacolare.

Preferiamo un quadro di pietre miliari.

1. Capacità consegnata. Traccia megawatt live, accettazione del cliente e livelli di servizio contro il programma annuale OpenAI 250MW. “Sotto contratto” e “in produzione” appartengono a colonne separate.

2. Margine nube core. La gestione si aspetta un miglioramento dopo il Q3 come sistemi di proprietà sostituire la capacità affittata. La direzione e la velocità di quel recupero riveleranno più di un quarto di ricavi di titolo.

3. Combinazione clienti. OpenAI può rimanere l'ancoraggio mentre AWS, AMD-linked distribuzioni, clienti sovrani e workload aziendali espandersi. Un rapporto di concentrazione in calo causato da nuovi ricavi rafforzerebbe il business.

4. Efficienza del capitale. Confronta i ricavi incrementali e il profitto lordo con gli acquisti di beni e attrezzature, gli impegni di locazione e l'utilizzo in contanti. Più entrate per megawatt distribuito e più gettoni per watt sono utili solo quando producono migliori ritorni sul capitale richiesto.

5. rilevanza del prodotto. Guarda i modelli di frontiera supportati, la fidelizzazione del cliente, la qualità di benchmark indipendente e la quota di carichi di lavoro utilizzando inferenza disaggregata. Le spedizioni CS-4 che iniziano nel Q3 2026 sono una prova anticipata del prossimo ciclo di prodotti.

6. Diluizione. Tracciare OpenAI e AWS garantisce il giubbotto, i premi dei dipendenti e il rilascio di azioni bloccate. La compensazione delle azioni può essere non-cash e ridurre ancora il reclamo di ogni azionista esistente sul business.

Queste pietre miliari permettono alla valutazione di aggiornare con le prove. Un target di prezzo dettagliato 2030 costruito su presunti megawatt, utilizzo, prezzi, margini e multipli può guardare preciso mentre riposa su cinque variabili instabili.


Cosa cambierebbe la nostra mente

La tesi si indebolisce se tre cose avvengono insieme: il divario di velocità per-utente si restringe materialmente sui carichi di lavoro di produzione abbinati, il margine lordo del cloud del nucleo non riesce a recuperare come la capacità di proprietà arriva, e la concentrazione del cliente rimane vicino ai livelli attuali nonostante la più ampia pipeline di partnership.

La tesi rafforza se Cerebras consegna l'impegno di capacità 2026, converte i crediti CS-4 in risultati di produzione indipendenti, migliora il margine cloud core dopo Q3 e mostra ricavi significativi da clienti diversi da OpenAI, G42 e MBZUAI.

I catalizzatori a breve termine includono prove di spedizione CS-4, distribuzione della soluzione disaggregata AMD, progressi verso la disponibilità AWS Bedrock nel Q1 2027, la prima capacità europea di entrare in servizio, i risultati dei margini Q3 e qualsiasi divulgazione dei megawatt OpenAI consegnati.

Il rischio più grande si trova in una sequenza mondano: sito, potenza, attrezzature, raffreddamento, rete, software, accettazione del cliente. Un wafer può funzionare perfettamente mentre la distribuzione intorno a esso manca un appuntamento.


La macchina alla fine del wafer

La fotografia del processore conta ancora. Si dimostra che un gruppo di ingegneri ha preso una regola di produzione e l'ha trattata come una variabile di progettazione. Essi accettarono difetti, li mapparono e si aggirarono intorno a loro. Mettono la memoria accanto alla computazione e trasformano un wafer in una macchina.

L’impegno di OpenAI muove la storia dall’architettura all’industria. Cerebras deve ora ripetere la sua realizzazione ingegneristica attraverso fabbriche e data center, quindi trasformare quella capacità in ricavi con margini che giustificano il capitale.

La prova successiva non si adatta in due mani. Apparirà in megawatt distribuiti, mix di clienti, uptime, profitto lordo e flusso di cassa.



Questa ricerca è solo a scopo informativo e non è consulenza finanziaria. Le cifre e le dichiarazioni previsionali si basano sulle informazioni disponibili a partire dal settembre 2026. Le richieste di prestazioni della società sono identificate come tali e devono essere valutate contro i benchmark di produzione corrispondenti e indipendenti.

Newsletter

Questo pezzo era gratuito. Il prossimo arriva domenica.

Dieci nomi con i livelli, la lettura del mercato, la chat con le posizioni in diretta. Con l'abbonamento leggi tutto; senza, ricevi la parte gratuita via email.

Ultimi pezzi
Wall Street Radar: Stocks to Watch Next Week · Volume 98Wall Street Radar · 07.09.2026Wall Street Radar: Stocks to Watch Next Week · Volume 97Wall Street Radar · 30.08.2026Wall Street Radar: Stocks to Watch Next Week · Volume 96Wall Street Radar · 23.08.2026GBC Raw Memo #04 · Tutti contano gigawatts. Il conto arriva in qualcos'altro.Raw Memo · 29.07.2026Wall Street Radar: Stocks to Watch Next Week · Volume 95Wall Street Radar · 26.07.2026 Tutto l'archivio →