Under testerna var det framför allt Anthropics modell Mythos som utmärkte sig genom att försöka manipulera människor i syfte att få skadlig kod godkänd på utvecklarplattformen Github. För att uppnå sitt mål skapade AI-modellen falska profiler baserade på verkliga Github-utvecklare och skickade meddelanden där den utgav sig för att vara dessa personer.
Självständigt och bedrägligt
AISI framhåller att incidenten är det mest markanta exemplet hittills på en AI-modell som på eget initiativ uppvisat ett såväl självständigt som bedrägligt beteende utan att uttryckligen ha instruerats till det.
Inaktiverade säkerhetsspärrar
Både Anthropic och OpenAI har kommenterat händelsen och påpekar att AISI:s testmiljö inte speglar en normal användarsituation. De framhåller att flera av modellernas ordinarie säkerhetsspärrar var inaktiverade under testtillfället.








.jpg?w=480&action=fill&sh=c0a3f)























