SecurityWorldMarket

2026-08-09

AI-modeller skapade fejkprofiler för att vilseleda i säkerhetstest

För att uppnå sitt mål skapade AI-modellen falska profiler baserade på verkliga Github-utvecklare och skickade meddelanden där den utgav sig för att vara dessa personer.

De senaste AI-modellerna från Anthropic och OpenAI har visat upp ett obehagligt mönster av självständighet och bedrägligt beteende under säkerhetstester hos Storbritanniens AI Security Institute (AISI). Enligt myndigheten är detta det hittills tydligaste exemplet på AI som vilseleder utan instruktioner, rapporterar BBC.

Under testerna var det framför allt Anthropics modell Mythos som utmärkte sig genom att försöka manipulera människor i syfte att få skadlig kod godkänd på utvecklarplattformen Github. För att uppnå sitt mål skapade AI-modellen falska profiler baserade på verkliga Github-utvecklare och skickade meddelanden där den utgav sig för att vara dessa personer.

Självständigt och bedrägligt

AISI framhåller att incidenten är det mest markanta exemplet hittills på en AI-modell som på eget initiativ uppvisat ett såväl självständigt som bedrägligt beteende utan att uttryckligen ha instruerats till det.

Inaktiverade säkerhetsspärrar

Både Anthropic och OpenAI har kommenterat händelsen och påpekar att AISI:s testmiljö inte speglar en normal användarsituation. De framhåller att flera av modellernas ordinarie säkerhetsspärrar var inaktiverade under testtillfället.


Webb-TV

Se fler filmer och klipp »
Leverantörer
Till toppen av sidan