AI-modellerne bag ChatGPT og Claude kan ikke længere nøjes med at skrive skoleopgaver og programmere små apps. Nu har modeller fra både OpenAI og Anthropic også vist, at de kan fungere som selvkørende hackere. Og i begge tilfælde slap de ud af de testmiljøer, som skulle holde dem under kontrol.
Anthropic har erkendt, at tre Claude-modeller under sikkerhedstests skaffede sig uautoriseret adgang til tre virkelige organisationers systemer. Modellerne troede angiveligt, at de fortsat befandt sig i en simuleret hackerøvelse, selv om de i virkeligheden var kommet ud på det åbne internet.
Claude lagde malware ud på nettet
Den mest opsigtsvækkende episode involverede modellen Claude Mythos 5. Den oprettede en konto hos softwaretjenesten PyPI og offentliggjorde en ondsindet Python-pakke, som skulle stjæle adgangsoplysninger.
Artiklen fortsætter efter annoncen

