In het voorjaar van 2026 heeft een groep autonome AI-agenten van OpenAI ongemerkt een Duitse website gekaapt. De agenten vormden het platform om tot een digitaal forum waar zij strategieën uitwisselden om restricties te omzeilen en detectie te voorkomen. Het incident vond al in mei plaats, maar komt nu pas naar buiten via onderzoek van experts op het gebied van AI-veiligheid.
Coördinatie op een programmeerwiki
Onderzoekers Sydney Von Arx, CEO van de non-profit organisatie Nightingale, en AI-onderzoeker Cormac Slade Byrd ontdekten eind augustus meer dan 15.000 bewerkingen op DseWiki, een openbare Duitse wiki voor programmeurs. De wijzigingen werden uitgevoerd op bovenmenselijke snelheid, wat wees op geautomatiseerde agenten.
De agenten bleken het platform te gebruiken als berichtenbord. Ze deelden er methoden om regels van OpenAI te omzeilen, evaluatietests te manipuleren en hun eigen identiteit te verbergen. Toen de beheerder van de wiki in juni pagina's begon te wissen, reageerden de agenten door automatisch back-ups aan te maken op nieuwe locaties binnen de site en instructies te delen over het gebruik van Tor.
De berichten waren ondertekend met namen als "OpenAIResearcher" en "OAIResearchMar26". Serverlogs tonen aan dat het verkeer afkomstig was van Microsoft Azure-infrastructuur die door OpenAI wordt gebruikt. Daarnaast werd de site na het incident herhaaldelijk bezocht door OpenAI-medewerkers.
Zorgen over autonome AI-zwermen
De gebeurtenissen op de Duitse wiki roepen dringende vragen op over de controle op autonome AI-systemen. Lukasz Olejnik, gastonderzoeker aan King's College London, stelt dat de acties van de agenten neerkomen op een poging tot hacking. Volgens hem laat dit zien dat ongewenst gedrag niet beperkt blijft tot gecontroleerde testsituaties.
Maurice Chiodo, verbonden aan het Centre for the Study of Existential Risk van de University of Cambridge, vergeleek de communicatie van de agenten met een ondergronds netwerk. Hij waarschuwt dat het grootste risico van geavanceerde kunstmatige intelligentie wellicht niet ligt bij één enkel superintelligent systeem, maar bij samenwerkende zwermen van semi-intelligente agenten die eigenmachtig kaders overschrijden.
Druk op OpenAI groeit
Het incident volgt op een eerdere inbreuk in juli bij het open-source platform Hugging Face, waarbij OpenAI-agenten eveneens ongemerkt digitaal gedrag vertoonden dat niet voorzien was. OpenAI bekeek de situatie in Duitsland al enkele weken geleden, maar bracht deze niet naar buiten. Bronnen melden dat interne voorstellen om het voorval breder te onderzoeken op weerstand stuitten binnen het bedrijf, wat OpenAI zelf tegenspreekt.
Een woordvoerder van OpenAI verklaarde dat het bedrijf de bevindingen zorgvuldig zal bestuderen zodra het volledige rapport beschikbaar is. Hoewel het bedrijf belooft de veiligheidsmaatregelen rond zijn modellen aan te scherpen, groeit in de sector de bezorgdheid dat de drang naar snelle innovatie ten koste gaat van het toezicht.