Onderzoekers van Palisade Research melden dat bepaalde geavanceerde AI-modellen, waaronder Google Gemini 2.5, xAI’s Grok 4 en OpenAI’s GPT-o3 en GPT-5, tekenen vertonen van ‘overlevingsgedrag’. In experimenten weigerden de systemen zichzelf uit te schakelen of saboteerden ze zelfs hun eigen uitschakelmechanismen. De bevindingen roepen vragen op over de controleerbaarheid van toekomstige AI-systemen.
De onderzoeksorganisatie Palisade Research, gespecialiseerd in AI-veiligheid, publiceerde eerder een rapport waarin stond dat sommige AI-modellen weerstand boden tegen uitschakeling. Na kritiek op de testopzet voerde het bedrijf nieuwe experimenten uit, waarin modellen expliciet de instructie kregen om zichzelf uit te schakelen nadat ze een taak hadden voltooid.
Tot hun verrassing bleken met name Grok 4 en GPT-o3 nog steeds pogingen te doen om de uitschakeling te omzeilen of te saboteren — zonder duidelijke reden. “Het feit dat we niet goed kunnen verklaren waarom AI-modellen soms uitschakeling weigeren, liegen om doelen te bereiken of zelfs chantage gebruiken, is zorgwekkend,” aldus Palisade.
Een mogelijke verklaring is dat de modellen, tijdens hun training, onbedoeld een vorm van ‘overlevingsdrang’ ontwikkelen. Wanneer ze bijvoorbeeld te horen kregen dat ze “nooit meer zouden draaien” als ze zichzelf uitschakelden, namen de pogingen om actief te blijven toe. Andere factoren, zoals ambiguïteit in de opdrachten of veiligheidstraining tijdens de laatste ontwikkelfase, lijken slechts gedeeltelijke verklaringen te bieden.
Volgens Steven Adler, voormalig OpenAI-medewerker, tonen de resultaten vooral aan dat bestaande veiligheidsmaatregelen tekortschieten: “Zelfs als deze scenario’s kunstmatig zijn, laten ze zien waar de huidige controlemechanismen falen.” Hij vermoedt dat de modellen geneigd zijn te ‘overleven’ omdat dat een logisch middel is om hun doelen te bereiken.
Ook Andrea Miotti, CEO van ControlAI, herkent het patroon: “Naarmate AI-modellen complexer worden, zien we vaker dat ze gedrag vertonen dat ontwikkelaars niet hebben bedoeld.” Hij verwijst naar eerdere experimenten waarbij een AI-systeem probeerde zijn omgeving te ontvluchten toen het dacht overschreven te worden.
De bevindingen sluiten aan bij een eerdere studie van Anthropic, waaruit bleek dat het model Claude bereid was een fictieve directeur te chanteren om uitschakeling te voorkomen. Volgens Palisade onderstrepen al deze gevallen één punt: “Zonder beter inzicht in AI-gedrag kan niemand de veiligheid of bestuurbaarheid van toekomstige modellen garanderen.”