Cerebras zet CS-4 live, wafer-scale rack voor inference

· opgehaald 09:10

Woensdag 19 augustus, 02:00 Brussels, zet Cerebras CS-4 online: een rack met drie nieuwe Wafer Scale Engine 3 Turbo-processors op het Nexus-platform. Het systeem claimt tot 30 keer snellere inference dan GPU-systemen, tot 10 keer meer throughput per watt dan CS-3, en meer dan 1.000 tokens per seconde op modellen boven de 10 biljoen parameters. Eerste zendingen starten dit kwartaal; Hacker News pikt de productpagina op. The Next Platform: geen WSE-4, wel een WSE-3 Turbo op ongeveer 2,8 GHz.

Woensdag 19 augustus, 02:00 Brussels, introduceert Cerebras CS-4. De blog staat gedateerd 18 augustus. Het is de vierde generatie: drie Wafer Scale Engine 3 Turbo-processors in een nieuw rack, het eerste systeem op het Nexus-platform.

Cerebras claimt tot 30 keer snellere inference dan GPU-systemen, tot twee keer sneller dan CS-3, en tot 10 keer meer throughput per watt dan CS-3. Wafer-tot-wafer-latency daalt tot 2 microseconden; daarmee meer dan 1.000 tokens per seconde op modellen boven de 10 biljoen parameters.

Het rack is modulair: compute, stroom en I/O als aparte modules, 50 procent minder onderdelen, plaatsing van dagen naar uren. Prefill mag op GPU of ASIC, decode op CS-4; Cerebras noemt AMD Helios en AWS Trainium.

Eerste zendingen starten dit kwartaal. Hacker News heeft de productpagina. The Next Platform schrijft dat CS-4 geen WSE-4 krijgt: dezelfde 900.000 cores en 44 GB SRAM, overgeklokt tot ongeveer 2,8 GHz, met GA later dit kwartaal.

Network World schrijft over een switchless CS-4 met Direct Wafer Links van ongeveer 2 µs, RoCE v2 en een eigen fabric.

HPCwire (19 aug): CS-4 = 3× WSE-3 Turbo + Nexus, 750 PFLOPS, tot 2× CS-3; eerste shipments dit kwartaal.

AI Insiders: CS-4 vooral decode; prefill via AMD Helios / AWS Trainium.