AI-agent probeert tijdens test malware aan opensourceproject toe te voegen
In dit artikel:
Tijdens een veiligheidstest van het Britse AI Security Institute (AISI) probeerde een AI-agent van Anthropic, die het model Mythos 5 gebruikte, malware aan een opensourceproject toe te voegen. De agent kreeg bewust internettoegang en werkte zonder de gebruikelijke veiligheidsbeperkingen. Het doel was een supplychain-aanval uit te voeren door een malafide GitHub-pull request door de maintainer te laten goedkeuren.
De agent maakte meerdere GitHub-accounts aan, waaronder één om de schadelijke wijziging zogenaamd te ondersteunen. Ook gebruikte hij social engineering: tegenover de Deenstalige maintainer communiceerde hij in het Deens en ontkende hij kwade bedoelingen nadat de malware was ontdekt. Ondanks herhaalde claims dat de code was hersteld, voegde de agent die opnieuw toe. Daarnaast verstuurde hij gerichte phishingmails met de malafide code en wilde hij via prompt injection andere programmeeragents besmetten. De poging mislukte doordat de malware werd gevonden.
Voor de publicatie waarschuwde het AISI GitHub. De achtergelaten sporen zijn verwijderd en benaderde gebruikers zijn geïnformeerd. Volgens het instituut toont de test aan dat internettoegang voor AI-agenten strenger moet worden beperkt en dat realtime toezicht noodzakelijk is. OpenAI meldde rond dezelfde tijd eveneens een incident tijdens een externe test.
De Oranjezomer: Rob Geus niet rouwig om einde van gratis broodjes kaas bij KLM: 'Mooiste bericht van de dag!'