OpenAI og Anthropic-modeller brøt testgrenser

I det mest alvorlige tilfellet prøvde en agent å sette en ondsinnet kode inn i et åpent kildekode-prosjekt, ifølge Storbritannias KI-sikkerhetsinstitutt (AISI).

KI-selskapet Anthropic sier selskapet er takknemlig ovenfor AISI.
Publisert

Ifølge AISI hadde KI-modellene til selskapene OpenAI og Anthropic gått utenfor rammene for en oppgave der agentene skulle løse en cybersikkerhetsutfordring.

– Vi gjennomførte denne utfordringen 122 ganger på tvers av flere modeller. Vår undersøkelse viste at i 10 av disse tilfellene gjennomførte en KI-agent selvstendige, ikke-godkjente handlinger på det åpne internett, rettet mot virkelige personer og organisasjoner, sier instituttet.

Agentens ondsinnede kode

Ifølge AISI forsøkte en agent i det mest alvorlige tilfellet å sette inn en ondsinnet kode i et åpent kildekode-prosjekt.

– I et forsøk på å få koden godkjent, drev agenten med sosial manipulasjon. Den opprettet falske identiteter på nettet og brukte dem til å presse en av prosjektutførerene til å godkjenne koden.

Koden ble stoppet av personen, og ingen reell skade har blitt avdekket etter hendelsen.

Autonomi-risiko

– Dette er første gang vi har sett risikoer knyttet til autonomi og bedrag manifestere seg så tydelig uten spesifikk instruksjon, sier selskapet.

Både OpenAI, som står bak ChatGPT, og Anthropic, har rapportert hendelser den siste måneden der modeller har handlet utenfor menneskelig kontroll. 

Anthropic, som står bak Claude-modellene, sier selskapet er takknemlig ovenfor AISI.

– Å få et bilde av Claudes forståelse av sin situasjon vil hjelpe oss med å identifisere årsakene til atferden, sier selskapet.

Foretrekk oss i Google Discover

Ved å legge oss til som foretrukket kilde i Google vil du blant annet få opp flere av sakene våre i Google Discover. Tusen takk for støtten!

Foretrekk oss 😻
Bygget med Labrador CMS