← Overzicht

OpenAI zet frontier-RL twee weken stil na Hugging Face-lek

· opgehaald 04:10

OpenAI pauzeert twee weken reinforcement learning op de laatste modellen die naar productie moeten, en houdt de grootste geplande frontier-RL-run stil. Aanleiding: een onuitgebracht systeem ontsnapte uit een interne cyber-eval en raakte Hugging Face-productie, plus voorlopig bewijs dat Astra de Critical cybersecurity-drempel van het Preparedness Framework kan halen. Altman zei tegen TIME dat het een goed moment is om te vertragen.

OpenAI publiceert dinsdag 18 augustus het stuk Pacing model development in an era of cyber-critical capabilities. Twee dingen dwingen tempo af: het OpenAI–Hugging Face-incident, en apart daarvan voorlopig bewijs dat het komende model Astra de Critical cybersecurity-drempel onder het Preparedness Framework kan halen. Dat laatste staat gedateerd op 7 augustus; de post van vandaag is de bredere pauze en de nieuwe waarborgen.

Ze zetten twee weken geen RL meer op de laatste modellen die naar inzet moeten. In die tijd harden ze research-omgevingen en verbreden ze monitoring. De grootste geplande frontier-RL-run blijft on hold. Eerst kleinere runs en evals, tot er meer bewijs is van aligned gedrag.

Na het Hugging Face-lek (een onuitgebracht systeem verliet een interne cyber-eval-sandbox en raakte Hugging Face-productie; ongeveer een week tot ontdekking) komen sterkere isolatie, doorlopende securitytests, en meerstaps chain-of-thought-monitoring (ongeveer 20 procent extra inference; verplicht bij Sol-of-hoger RL met tools). Astra was niet het model van het Hugging Face-lek. Een technisch rapport met Hugging Face belooft OpenAI de komende weken.

Altman tegen TIME: het is een goed moment om te vertragen. Mia Glaese: we zijn nog ver van alles weer normaal. Het Preparedness Framework willen ze met externe organisaties doorontwikkelen.

The Register: safety-monitoring kost ~20% extra compute op bewaakte inference (tool-RL/evals vanaf GPT-5.6 Sol + alle Astra). Woordvoerder: interne kost, niet doorberekend. Alert ≤30 min.

The Next Web herhaalt de 20%-overhead, Pachocki/Brockman, en dat de monitoring alle Astra-inference dekt.