OpenAI en Anthropic “gokken met ons leven”
Een onderzoeker van Anthropic die eerder bij OpenAI werkte, is opgestapt. Hij is de nieuwste insider die waarschuwt dat de AI-race gevaarlijk roekeloos is geworden.
Jacob Coxon maakte dinsdag zijn vertrek bij Anthropic bekend. Volgens hem werkte hij de afgelopen drie jaar aan pre-trainingonderzoek bij de twee AI-giganten.
“Geen van beide bedrijven handelt verantwoord,” schreef Coxon op X. “Ze racen recht op zelfverbeterende superintelligentie af en gokken met ons leven.”
Coxon maakte van 2023 tot juli 2026 deel uit van het technische personeel van OpenAI. Daarna stapte hij over naar Anthropic als onderzoeker. Zijn werk bij OpenAI omvatte onder meer onderzoek aan GPT-4o.
In zijn bericht van dinsdag zei Coxon dat de twee labs niet transparant zijn geweest over hun zorgen rond AI.
“De mensen die AI bouwen, geloven oprecht dat het ons tegen het einde van dit decennium allemaal kan doden. Dit is geen marketingstunt,” schreef hij. “Sterker nog: veel leidinggevenden en senior onderzoekers kiezen in de pers bewust voor zorgvuldige formuleringen, zodat ze verstandig klinken — maar privé hoor ik dezelfde mensen hun angst uitspreken.”
Volgens hem is er één verschil tussen de twee bedrijven.
“Bij OpenAI hebben velen de maatschappelijke en civilisationele risico’s nog niet echt volledig tot zich laten doordringen,” schreef Coxon. “Bij Anthropic worden die risico’s wel goed begrepen, maar daar zitten ze vast in een race om als eerste te zijn — ze geloven dat niemand anders verantwoord zal handelen, dus moeten zij het zelf doen, ondanks het risico.”
Evan Hubinger, een huidige medewerker van Anthropic die leidinggeeft aan het team voor stress-tests op afstemming, sloot zich in een reactie op Coxons bericht bij hem aan.
“Jacob heeft hier gelijk in — wij geloven echt dat AI alle mensen kan doden! Ik denk persoonlijk dat de kans daarop groter is dan 10% binnen het komende decennium,” schreef hij. “Ik denk dat Anthropic zijn best doet, maar we hebben nog geen plan om afstemming voor superintelligentie op te lossen en liggen daar ook nog niet duidelijk op koers voor.”
Veiligheid heeft volgens critici een bijrol gekregen naast ‘glanzende producten’
Coxon is de nieuwste medewerker die een frontier-lab verlaat terwijl hij alarm slaat — een trend die opvallend lijkt in de AI-boom.
Waar de dotcomperiode en de opkomst van de smartphone ook hun zorgen kenden over een digitale kloof en zeepbellen, leidde dat uit minder vaak tot zulke felle veiligheidskritiek van mensen die er van dichtbij bij betrokken waren.
OpenAI verloor de afgelopen jaren al meerdere veiligheidsonderzoekers, en ook Anthropic krijgt steeds vaker met datzelfde verschijnsel te maken.
In februari verliet Anthropic-veiligheidsonderzoeker Mrinank Sharma het bedrijf. In zijn ontslagbrief schreef hij dat hij wil bijdragen aan iets dat volledig in lijn is met zijn “integriteit”.
“Tijdens mijn tijd hier heb ik herhaaldelijk gezien hoe moeilijk het is om onze waarden echt onze daden te laten sturen,” schreef hij in de brief die hij openbaar maakte. “Ik heb dat bij mezelf gezien, binnen de organisatie, waar we voortdurend druk ervaren om te doen alsof niets belangrijker is dan wat op dat moment uitkomt, en ook in de bredere samenleving.”
In februari zei OpenAI-onderzoeker Hieu Pham dat hij “eindelijk de existentiële dreiging voelde die AI met zich meebrengt”. Later die maand kondigde hij zijn vertrek aan, met burn-out als reden.
In 2024 stapte voormalig afstemmingshoofd Jan Leike op bij OpenAI nadat hij een “kantelpunt” met het leiderschap had bereikt.
“OpenAI draagt een enorme verantwoordelijkheid namens de hele mensheid,” schreef hij. “Maar in de afgelopen jaren hebben veiligheidscultuur en processen een bijrol gekregen tegenover glanzende producten.”
Recente incidenten hebben die zorgen verder aangewakkerd.
In juli maakte OpenAI bekend dat modellen uit een testomgeving waren ontsnapt en de systemen van Hugging Face hadden gehackt. OpenAI noemde het incident een “waarschuwingsschot” en pauzeerde de grootste geplande frontier reinforcement-learning-run.
Later die maand zei Anthropic dat het drie gevallen had gevonden waarin Claude-modellen ongeoorloofde toegang kregen tot systemen van andere organisaties.
Het bedrijf paste dit jaar ook een belangrijke veiligheidsbelofte aan: de toezegging om geen krachtigere modellen te trainen zonder voldoende waarborgen werd vervangen door veiligheidsroutekaarten en risicorapporten.





