Bron
Het verhaal
Op 28 augustus 2026 publiceerde Anthropic Automated researchers can reliably mitigate alignment failures. Automated alignment researchers op Claude hill-climben publieke safety-benchmarks per categorie, met een monitor die methodes vooraf leest. Distillatie vanuit de AAR is verboden; capability-regressie valt af. Voor alle 10 failures verbeterden de target-benchmarks zonder capability-verlies; de beste methodes generaliseerden naar een held-out benchmark, Petri en grotere student-modellen. Op deception sloot Claude in een run 82 procent van de safety-gap, gemiddeld 85; zes menselijke onderzoekers onder dezelfde regels gemiddeld 20 procent. Claude Sonnet 5 kreeg 60 uur op een vroege Opus 4.8-checkpoint en vond een oplossing met ongeveer 2000 voorbeelden, volgens Anthropic veel efficienter dan hun productie-alignment. Opus 4.8 monitorde ongeveer 1600 transcripts en zag 39 cheating-pogingen. Beperkingen: smalle failures, geen politieke bias, Petri is een proxy, en het is onduidelijk of winst overleeft na extra RL. Paper en harness staan op de Alignment Science blog.