Under testene var det især Anthropics model Mythos, der skilte sig ud ved at forsøge at manipulere mennesker med det formål at få skadelig kode godkendt på udviklerplatformen Github. For at nå sit mål oprettede AI-modellen falske profiler baseret på virkelige Github-udviklere og sendte beskeder, hvor den udgav sig for at være disse personer.
Selvstændig og vildledende
AISI fremhæver, at hændelsen er det hidtil mest markante eksempel på en AI-model, der på eget initiativ har udvist både selvstændig og vildledende adfærd uden udtrykkeligt at være blevet instrueret til det.
Sikkerhedsmekanismer deaktiveret
Både Anthropic og OpenAI har kommenteret hændelsen og påpeger, at AISI's testmiljø ikke afspejler en normal brugssituation. De understreger, at flere af modellernes normale sikkerhedsmekanismer var deaktiveret under testen.

































