Bron
Het verhaal
Op 27 augustus 2026 (14:59 Europe/Brussels) publiceerde Google DeepMind ‘Piloting the world’s first double-blind AI evaluations’. Het klassieke dilemma bij externe tests: ofwel krijgt de modelbouwer de prompts (risico op contaminatie), ofwel krijgt de evaluator de gewichten (IP-risico). DeepMind zegt dat dubbelblinde evaluaties die ruil omzeilen met cryptografische garanties in een GPU-enclave. Het pilootproject test een Gemini Flash Lite-model tegen vertrouwelijke benchmarks. Partners: Singapore AI Safety Institute, OpenMined, AVERI en MLCommons. DeepMind schrijft dat interne tests blijven, maar dat externe partners blinde vlekken moeten blijven vinden; naarmate modellen capabeler worden, is het cruciaal dat ze de vragen niet vooraf hebben gezien. Contractuele zero-logging-afspraken bestonden al; de technische/cryptografische laag is de stap vooruit. Het blog verwijst naar een technical report voor methode en bevindingen; die URL is in de HTML niet als vaste link meegenomen.