← Overzicht

Qwen zet Qwen3.8-Flash-Next open, preview van Qwen4

· opgehaald 04:10

Alibaba’s Qwen-team zet de gewichten van Qwen3.8-Flash-Next live: een multimodaal MoE-model van 125 miljard parameters waarvan 6 miljard per token actief is, plus 51 miljard n-gram embeddings. Het is een vroege preview van de Qwen4-architectuur, met native 262.144 tokens context (tot 1 miljoen via YaRN) onder Qwen Community License 1.0. De gehoste productieversie Qwen3.8-Flash op Qwen Cloud volgt; de API was bij publicatie nog “coming soon”.

Het Qwen-team van Alibaba opent de gewichten van Qwen3.8-Flash-Next. In de officiële blog (gedateerd 26 augustus 2026) heet het “Today, we are sharing” en “weights are now available” op Hugging Face en ModelScope — geen countdown meer. De modelkaart is publiek, niet gated, met 131 safetensors (~360 GB). De HF-README werd om 14:29 Brussels bijgewerkt; de blog stond rond 14:52 Brussels op Hacker News.

Architectuur: 125 miljard parameters waarvan 6 miljard per token actief, plus 51 miljard n-gram embeddings (offloadbaar naar host-geheugen) en 4 miljard MTP. Hybride Gated DeltaNet plus Qwen Sparse Attention, Gated Residual, Muon-optimizer. Native context 262.144 tokens, via YaRN tot 1 miljoen. Multimodaal: tekst, beeld en video. Qwen claimt dat training ongeveer een negende kost van Qwen3.7-Plus, met betere coding- en kantoorscores (o.a. 58,7 op DeepSWE 1.1 en 62,5 op SWE-bench Pro, eigen metingen).

Licentie is Qwen Community License 1.0, geen Apache 2.0. Naamsvermelding is verplicht boven 100 miljoen MAU of 20 miljoen dollar maandelijkse omzet; MaaS- en AI-work-assistant-bedrijven hebben een aparte commerciële licentie nodig. Interne inzet zonder derden blijft daarvan uitgezonderd.

De gehoste productieversie heet Qwen3.8-Flash (1 miljoen tokens standaard, officiële tools) op Qwen Cloud. In de blog stond de API bij publicatie nog op “Coming soon”. Unsloth zette dezelfde dag GGUF’s klaar.