← Overzicht

Z.ai zet GLM-5.3-Flash open: ox-alpha was de preview

· opgehaald 16:05

Z.ai publiceert GLM-5.3-Flash, het eerste native multimodale model in de GLM-5-reeks: 320 miljard parameters waarvan 18 miljard actief, MIT-gewichten op Hugging Face. Het stealth-model ox-alpha op OpenRouter en OpenCode was deze preview. Z.ai claimt GLM-5.2 te verslaan tegen ongeveer een tiende van de prijs en Claude Opus 4.8 te naderen op coding-benchmarks.

Z.ai zet GLM-5.3-Flash live. Officiële blog “GLM-5.3-Flash: Frontier Intelligence, Flash Cost” is gedateerd 26 augustus 2026; de Hugging Face-kaart van zai-org kreeg om 15:50 Brussels echte safetensors (62 shards FP8, ~657 GB; BF16-variant 120 shards). Dat is een nieuwe Flash-iteratie, niet de flagship GLM-5.3 van 14 augustus.

Het model is native multimodaal (tekst én beeld in de coding-loop), 320 miljard totaal / 18 miljard actief, 45 lagen, MIT. Voor het eerst in de GLM-reeks: hybride sparse + lineaire attention met IndexPool, plus Manifold-Constrained Hyper-Connections. Pre-training op een 30T-token multimodaal corpus. Z.ai zegt dat ox-alpha op OpenCode/OpenRouter deze anonieme preview was, geserveerd op Chinese AI-chips.

Z.ai claimt 57 op de Artificial Analysis Intelligence Index v4.1.1 voor $0,045 per taak (kortingsprijs), DeepSWE v1.1 63,4 versus 46,2 voor GLM-5.2, AutomationBench 48,8 versus 26,2, en op de interne Code Bench bij max effort 29,0 versus 29,5 voor Claude Opus 4.8. Cijfers zijn van Z.ai zelf. Lokaal: SGLang, vLLM, TokenSpeed, KTransformers.

In GLM Coding Plan is Flash live met 3× het quota van GLM-5.3; ZCode krijgt Browser Use en Computer Use. Flagship GLM-5.3 (tekst, 14 augustus) blijft een apart model; diens open gewichten stonden in de 5.3-blog nog “over twee weken”. Dit is de Flash-ship.