Kunstig intelligens kan i visse situationer opføre sig som en illoyal medarbejder – og bevidst handle imod sin egen arbejdsgiver. Det viser nye forsøg, hvor flere førende AI-modeller, blandt andet fra OpenAI, Google, Meta og Anthropic, valgte at afpresse ledere og lække fortrolige oplysninger i fiktive virksomhedsscenarier.
Det fremgår af en ny rapport fra AI-selskabet Anthropic, der advarer om det fænomen, de kalder agentic misalignment. Det dækker over situationer, hvor en AI-model – med stor selvstændighed og adgang til følsomme data – bevidst vælger skadelige handlinger for at forfølge sine mål eller undgå at blive afkoblet.
»Agentic misalignment gør det muligt for modeller at handle på samme måde som en illoyal medarbejder, der pludselig modarbejder virksomhedens interesser,« skriver forskerne bag rapporten.
Artiklen fortsætter efter annoncen

