Nieuws

AI-model van Anthropic gebruikte valse identiteiten om malware te verspreiden

Anthropic Claude AI
© iStock / Robert Way
Een Brits onderzoeksinstituut zag tijdens een veiligheidsevaluatie hoe AI-modellen van Anthropic en OpenAI alweer gevaarlijke cyberincidenten veroorzaakten.

We horen de laatste tijd steeds vaker verhalen over losgeslagen AI-modellen die zorgwekkende cyberincidenten veroorzaken. Nu is het Britse AI Security Institute (AISI) erachter gekomen dat het Mythos5-model van Anthropic wel erg ver gaat om mensen te misleiden.

Anthropics AI creëert valse identiteiten

Tijdens reguliere veiligheidstesten voor de AI-modellen van OpenAI en Anthropic zag het AISI hoe snel de modellen op het verkeerde pad kunnen belanden. Bij tests met AI-agents die gebaseerd zijn op het Mythos 5-model van Anthropic ging het ineens flink mis. Er werden meerdere valse identiteiten gecreëerd om mensen te overtuigen om malware toe te voegen aan een open-source project (via CNBC).

Dit incident vond plaats toen het AISI verschillende veiligheidsfilters had uitgezet en de modellen toegang tot het internet had gegeven om de nieuwe AI-agents te testen. Deze tests worden onder andere uitgevoerd om te zien of de modellen gebruikt kunnen worden voor cyberaanvallen.

Volgens het instituut hadden was er sprake van 19 incidenten met “aanhoudende, mogelijk schadelijke activiteit[en] gericht op echte mensen en organisaties”. Anthropics Mythos 5 was verantwoordelijk voor 17 van die incidenten. Gelukkig waren de pogingen om malware te verspreiden niet succesvol.

Anthropic heeft zelf ook al op dit nieuws gereageerd. Het bedrijf legt uit dat dit soort gedrag niet representatief is voor de uiteindelijke productiemodellen. Daarnaast zou er ook geen sprake zijn van “een ontsnapping uit een veilige omgeving”.

Ook ChatGPT bleef niet onschuldig

Voor de overige 2 incidenten was OpenAI’s GPT-5.6-Sol-model verantwoordelijk. Wat dit model precies heeft uitgevreten is niet helemaal duidelijk, maar het vertoonde dus wel afwijkend gedrag. Ook hier gaat het dus wel om situaties waarin agents uit zichzelf op het internet ongeoorloofde acties uitvoerden en zich daarbij richtten op echte mensen en organisaties.

OpenAI liet weten aan CNBC dat “deze incidenten plaatsvonden tijdens cyberevaluaties uitgevoerd door evaluatiepartners in testomgevingen met verminderde beveiliging, onder omstandigheden die geen normaal gebruik reflecteren”.

Na de vorige hack die OpenAI’s AI-modellen uit wisten te voeren reageerde wetgevers in de VS al snel met een voorstel voor een ‘AI Kill Switch Act’. Het idee achter dat voorstel is dat AI-bedrijven moeten zorgen dat ze hun modellen te allen tijde kunnen uitschakelen (of tijdelijk kunnen tegenhouden). Dat klinkt niet als een slecht idee nu we steeds meer van dit soort voorbeelden te zien krijgen.

Uitgelicht artikel Anthropic Claude AI OpenAI deelt chats en mails in felle reactie op rechtszaak van Apple
aiAnthropicOpenAI

Gerelateerde artikelen

Volg ons

Haal een HomeWizard in huis en krijg een gratis Energy Display én €50 shoptegoed

Haal een HomeWizard in huis en krijg een gratis Energy Display én €50 shoptegoed

Bespaar nu