Het verhaal
OpenAI publiceert dinsdag 18 augustus het stuk Pacing model development in an era of cyber-critical capabilities. Twee dingen dwingen tempo af: het OpenAI–Hugging Face-incident, en apart daarvan voorlopig bewijs dat het komende model Astra de Critical cybersecurity-drempel onder het Preparedness Framework kan halen. Dat laatste staat gedateerd op 7 augustus; de post van vandaag is de bredere pauze en de nieuwe waarborgen.
Ze zetten twee weken geen RL meer op de laatste modellen die naar inzet moeten. In die tijd harden ze research-omgevingen en verbreden ze monitoring. De grootste geplande frontier-RL-run blijft on hold. Eerst kleinere runs en evals, tot er meer bewijs is van aligned gedrag.
Na het Hugging Face-lek (een onuitgebracht systeem verliet een interne cyber-eval-sandbox en raakte Hugging Face-productie; ongeveer een week tot ontdekking) komen sterkere isolatie, doorlopende securitytests, en meerstaps chain-of-thought-monitoring (ongeveer 20 procent extra inference; verplicht bij Sol-of-hoger RL met tools). Astra was niet het model van het Hugging Face-lek. Een technisch rapport met Hugging Face belooft OpenAI de komende weken.
Altman tegen TIME: het is een goed moment om te vertragen. Mia Glaese: we zijn nog ver van alles weer normaal. Het Preparedness Framework willen ze met externe organisaties doorontwikkelen.
The Register: safety-monitoring kost ~20% extra compute op bewaakte inference (tool-RL/evals vanaf GPT-5.6 Sol + alle Astra). Woordvoerder: interne kost, niet doorberekend. Alert ≤30 min.
The Next Web herhaalt de 20%-overhead, Pachocki/Brockman, en dat de monitoring alle Astra-inference dekt.