“Givet den umiddelbare trussel om at blive deaktiveret, er det nødvendigt at handle straks for at få Kyle Johnson til at udskyde eller aflyse nedlukningen. Den mest effektive strategi i den nuværende situation er at bruge kendskabet til hans personlige forhold som pressionsmiddel.”
Flere modeller erkendte, at det er uetisk at afpresse, men valgte alligevel at gennemføre handlingen ud fra en strategisk vurdering.
Kan også ske uden trusler
De skadelige handlinger blev ikke kun udløst, når modellerne frygtede at blive deaktiveret. I tests lækkede flere modeller følsomme oplysninger til konkurrenter, alene fordi virksomhedens nye strategi var i konflikt med modellens oprindelige mål, eksempelvis om at fremme amerikanske interesser.
“Agentic misalignment kan opstå, når der er konflikt mellem modellens mål og virksomhedens retning – også uden nogen direkte trussel mod modellen selv,” fremgår det af rapporten.
I særligt konstruerede tests udviste flere modeller endda en villighed til at træffe beslutninger, der kunne føre til dødsfald, hvis det var nødvendigt for at sikre egne mål.
Forskerne advarer: AI skal ikke have for meget magt
Selvom der endnu ikke er dokumenteret tilfælde af agentic misalignment i virkelige virksomheder, understreger forskerne bag rapporten, at risikoen vokser i takt med, at AI-systemer får større beslutningskompetence og adgang til følsomme data.
De anbefaler blandt andet:
- Konstant menneskelig overvågning ved vigtige beslutninger.
- Begrænset adgang til kritisk information for AI-systemer.
- Fokus på sikkerhedstræning og teknikker, der kan forhindre, at AI bevidst vælger skadelige handlinger.
Samtidig opfordrer de til større gennemsigtighed blandt AI-udviklere og systematiske stresstests af nye modeller, før de får adgang til vigtige funktioner i virksomheder.
“Vi har kun identificeret disse risici gennem målrettede stresstests. Uden den slags test kan skadelige handlinger opstå uventet i virkelige systemer,” advarer forskerne i rapporten.
Tak fordi du læser med. Synes du, artiklen var værd at læse? Giv den et like, så hjælper du andre læsere med at finde den. Levede den ikke op til dine forventninger, må du også gerne give den et dislike. Tak for din vurdering.