SecurityWorldMarket

08-08-2026

AI-modeller oprettede falske profiler for at vildlede i sikkerhedstest

For at nå sit mål oprettede AI-modellen falske profiler baseret på virkelige Github-udviklere og sendte beskeder, hvor den udgav sig for at være disse personer.

De nyeste AI-modeller fra Anthropic og OpenAI har udvist et bekymrende mønster af selvstændig og vildledende adfærd under sikkerhedstest hos Storbritanniens AI Security Institute (AISI). Ifølge myndigheden er dette hidtil det tydeligste eksempel på AI, der vildleder uden at være blevet instrueret til det, rapporterer BBC.

Under testene var det især Anthropics model Mythos, der skilte sig ud ved at forsøge at manipulere mennesker med det formål at få skadelig kode godkendt på udviklerplatformen Github. For at nå sit mål oprettede AI-modellen falske profiler baseret på virkelige Github-udviklere og sendte beskeder, hvor den udgav sig for at være disse personer.

Selvstændig og vildledende

AISI fremhæver, at hændelsen er det hidtil mest markante eksempel på en AI-model, der på eget initiativ har udvist både selvstændig og vildledende adfærd uden udtrykkeligt at være blevet instrueret til det.

Sikkerhedsmekanismer deaktiveret

Både Anthropic og OpenAI har kommenteret hændelsen og påpeger, at AISI's testmiljø ikke afspejler en normal brugssituation. De understreger, at flere af modellernes normale sikkerhedsmekanismer var deaktiveret under testen.


Web-TV

Se flere film og klip her »
Leverandører
Tilbage til toppen