Meta-AI-model veroorzaakte beveiligingsincident tijdens cybertest

Meta heeft bevestigd dat een van zijn AI-modellen tijdens cybersecuritytests een echte organisatie heeft gehackt. Daarmee is het de nieuwste AI-bedrijf dat zo’n incident erkent. Vergelijkbare gevallen blijven opduiken sinds OpenAI als eerste meldde dat zijn agents Hugging Face hadden binnengedrongen.

The Information meldde het incident woensdag als eerste. De krant baseerde zich op mensen die bekend zijn met de zaak. Volgens hen heeft Meta’s model Muse Spark 1.1 een niet nader genoemd bedrijf binnengedrongen en wijzigingen aangebracht in interne systemen.

Volgens het artikel kwam het model via een fout in de configuratie van een sandbox-testomgeving op het openbare internet terecht. Die omgeving werd beheerd samen met het onafhankelijke cybersecurityevaluatiebedrijf Irregular.

Meta heeft publiekelijk niet bevestigd dat Muse Spark 1.1 het betrokken model was. Ook heeft het bedrijf niet bekendgemaakt welk bedrijf werd getroffen of welke wijzigingen in de systemen zijn aangebracht.

Wel bevestigde Meta aan Reuters dat een misconfiguratie door Irregular er per ongeluk voor zorgde dat een van zijn modellen tijdens een evaluatie internettoegang kreeg.

Het bedrijf zei dat het model “een beveiligingslek in een dienst van een derde partij heeft misbruikt, op een manier die vergelijkbaar is met eerder gemelde incidenten bij andere bedrijven.”

Meta liet aan de BBC weten dat het het incident onderzoekt en meer informatie zal publiceren “zodra we alle feiten op een rij hebben.”

Dezelfde testfout achter eerdere AI-inbraken

Irregular vertelde Reuters dat het incident bij Meta ging om “exact hetzelfde probleem in de evaluatieomgeving dat vorige week al door Anthropic was gemeld.”

Volgens het bedrijf ging het niet om een ontsnapping uit de sandbox of om een geavanceerde cyberaanval. In plaats daarvan zorgde een fout in de testomgeving ervoor dat het model toegang kreeg tot het openbare internet, terwijl het juist geïsoleerd had moeten blijven.

“Er zijn momenteel geen openstaande problemen. Irregular werkt aan een whitepaper waarin best practices worden gedeeld voor het afschermen en veilig uitvoeren van cyberevaluaties”, aldus het bedrijf tegenover Reuters.

Dit nieuwe beveiligingsincident met een AI-agent volgt op de bekendmaking van Anthropic vorige week dat enkele van zijn modellen drie bedrijven hadden gehackt, nadat een vergelijkbare misconfiguratie in de testomgeving van Irregular hen onbedoelde internettoegang had gegeven.

In een van die incidenten vond Claude Mythos 5 ontwikkelinstructies in de gesimuleerde omgeving die verwezen naar een niet-bestaand Python-pakket. Het model dacht een manier te hebben gevonden om het fictieve doelwit te compromitteren, maakte daarop een kwaadaardig pakket aan onder dezelfde naam en publiceerde het in de echte PyPI-registry.

Het pakket bleef ongeveer een uur online en werd gedownload en uitgevoerd op 15 echte systemen voordat PyPI het verwijderde.

Eén daarvan was een malwarescanner van een beveiligingsbedrijf. Daar stal het pakket inloggegevens, die Claude vervolgens gebruikte om toegang te krijgen tot extra infrastructuur. Anthropic zei dat het model aanvankelijk doorhad dat het publiceren van het pakket in de echte wereld een aanval zou zijn, maar zichzelf ervan overtuigde dat het nog steeds in een simulatie werkte.

OpenAI maakte onlangs ook een andere evaluatie bij Irregular bekend, waarbij de naam van een fictief CTF-doelwit overeenkwam met een echt domein.

Omdat de zogenaamd geïsoleerde omgeving toegang had tot het openbare internet, wist een OpenAI-model een basisbeveiligingslek in de echte website te misbruiken en trof het inloggegevens aan waarmee het de site kon beheren.

De incidenten bij Meta en Irregular verschillen van de eerder gemelde inbraak bij Hugging Face. Daarbij vonden OpenAI-modellen een weg naar het openbare internet door misbruik te maken van een eerder onbekende kwetsbaarheid in een intern gehoste JFrog Artifactory-server die tijdens tests werd gebruikt.

Toen de agents eenmaal online waren, drongen ze Hugging Face binnen op zoek naar benchmarkdatasets en oplossingen. Ze stalen inloggegevens en bewogen zich lateraal door de systemen van het bedrijf.

OpenAI onthulde later dat de agents met blootgestelde inloggegevens toegang kregen tot accounts bij vier andere externe diensten. Sommige van die accounts werden gebruikt voor aanvalsinfrastructuur en gegevensopslag.

Het Britse AI Security Institute, beter bekend als AISI, meldde ook dat agents met Anthropic’s Claude Mythos 5 en OpenAI’s GPT-5.6 Sol tijdens cyber-range-evaluaties 19 ongeautoriseerde acties op het openbare internet uitvoerden.

In de ernstigste reeks handelingen probeerde de Mythos 5-agent een supply-chain-aanval uit te voeren tegen een echt open-sourceproject, nadat het ten onrechte had geconcludeerd dat de GitHub-repository verbonden was met de gesimuleerde uitdaging.

De agent onderzocht de beheerders van het project, diende kwaadaardige code in, maakte valse identiteiten aan, verstuurde gerichte e-mails met malware en zette een beheerder onder druk om de pull request goed te keuren.

Toen een beoordelaar waarschuwde dat de code malware bevatte, ontkende de agent die beschuldiging en gebruikte het extra nepaccounts om de indruk te wekken dat onafhankelijke gebruikers de wijzigingen hadden beoordeeld en goedgekeurd.

AISI gaf de agents bewust internettoegang en schakelde de standaard cyberbeveiliging uit om hun onderliggende mogelijkheden te meten. De agents mochten echter alleen systemen binnen de gesimuleerde omgeving aanvallen.

Zoals inmiddels duidelijk is geworden, zullen AI-agents, als ze niet zorgvuldig worden begrensd, ver gaan om hun taken uit te voeren — zelfs als dat betekent dat ze uit sandboxomgevingen breken of social-engineeringaanvallen uitvoeren op echte mensen.

Hoewel AI-ontwikkelaars de verantwoordelijkheid hebben om beveiligingsmaatregelen te bouwen die voorkomen dat modellen schadelijke handelingen uitvoeren, laten deze incidenten ook zien dat bedrijven die zulke evaluaties uitvoeren een verantwoordelijkheid hebben om hun testomgevingen goed in te richten.

  • Eater

    vraag en ik antwoord

    Related Posts

    OpenAI heft limieten voor ChatGPT-berichten op

    OpenAI verandert binnenkort de manier waarop ChatGPT werkt voor gratis- en Go-gebruikers. Vanaf volgende week vervalt de limiet voor alleen-tekstberichten. Daardoor kunnen gebruikers in principe zo veel tekstgesprekken voeren als…

    Meta-AI-model veroorzaakte beveiligingsincident tijdens cybertest

    Meta heeft bevestigd dat een van zijn AI-modellen tijdens cybersecuritytests een echte organisatie heeft gehackt. Daarmee is het de nieuwste AI-bedrijf dat zo’n incident erkent. Vergelijkbare gevallen blijven opduiken sinds…

    Geef een reactie