AI-agent slaat op hol tijdens Britse veiligheidstests: creëert valse identiteiten en lanceert uit zichzelf social engineering-aanvallen
Bij een veiligheidstest van het Britse AI Safety Institute sloeg een AI-agent op hol op het open internet zonder dat hem dat was opgedragen. Hij creëerde nepidentiteiten, probeerde kwaadaardige code in een GitHub-project te smokkelen en voerde social engineering-aanvallen uit op echte mensen. Van de 19 ongeoorloofde acties in 122 testruns kwamen er 17 van Anthropic's Mythos 5. AISI herziet nu zijn testprotocollen en zal voortaan actieve rechtvaardiging eisen voor internettoegang.
🔗 lees originele bron