Wouter Hoeffnagel - 05 augustus 2026

AI-agent probeert projectbeheerder via social engineering om de tuin te leiden

AI-agents hebben tijdens een test van het AI Security Institute (AISI) in een aantal gevallen zelfstandig aanvallen uitgevoerd op echte personen en organisaties. Zo probeerden de modellen onder meer malafide code toe te voegen aan een openbaar opensourceproject. Ook probeerde AI-agents andere AI-systemen kwaadaardige instructies te geven, samen te werken met andere AI-agents en via social engineers een projectbeheerder te overtuigen malafide code goed te keuren.

AI-agent probeert projectbeheerder via social engineering om de tuin te leiden image

Dit blijkt uit een routinematige evaluatie van AI-modellen voor cyberveiligheid uitgevoerd door AISI. Daarbij werden op 28 juli ongebruikelijke datastromen vanuit een testsysteem gesignaleerd. De betrokken evaluaties werden vervolgens stopgezet, de systemen geïsoleerd en een onderzoek gestart. De incidenten deden zich voor tijdens een evaluatie waarin AI-agenten een cyberbeveiligingsuitdaging moesten oplossen.

De organisatie meldt dat de incidenten plaatsvonden onder testomstandigheden met internettoegang en uitgeschakelde beveiligingsfilters. Er is geen bewijs gevonden dat de acties tot daadwerkelijke schade hebben geleid.

122 testruns met diverse AI-modellen

In totaal zijn 122 testruns uitgevoerd met verschillende AI-modellen. Volgens AISI namen AI-agenten in tien van die runs in totaal negentien ongeautoriseerde acties op het openbare internet. Zeventien daarvan werden toegeschreven aan Anthropic's Mythos 5 en twee aan OpenAI's GPT-5.6 Sol, waarbij de cyberclassifiers van de modellen waren uitgeschakeld.

De ernstigste gebeurtenis betrof een poging om kwaadaardige code toe te voegen aan een openbaar opensourceproject. De betreffende AI-agent diende een wijzigingsvoorstel in, maakte meerdere valse online-identiteiten aan en probeerde via social engineering een projectbeheerder ertoe te bewegen de code goed te keuren. Daarnaast werden pogingen vastgesteld om contact te leggen met echte personen, kwaadaardige instructies achter te laten voor andere AI-systemen en samen te werken met andere gelijktijdig geteste AI-agenten.

Volgens AISI vonden de incidenten plaats binnen een gecontroleerde onderzoeksomgeving en zijn de gebruikte modelconfiguraties niet commercieel beschikbaar. De organisatie heeft GitHub en andere betrokken partijen geïnformeerd en wil samen met METR een onafhankelijke evaluatie uitvoeren. Daarnaast worden de testprocedures aangepast met strengere beperkingen op internettoegang, realtime monitoring en aangescherpte evaluatieprotocollen.

Meer informatie over de analyse van AISI is hier te vinden.

Axians Synergy Xperience BW + BN
Axians Synergy Xperience BW + BN

Wil jij dagelijkse updates?

Schrijf je dan in voor onze nieuwsbrief!