Anthropic: Spillerne overså hver tredje AI-trussel
Et nyt online spil viser, at mennesker overså hver tredje farlig AI-kommando – især snedigt gemte angreb.
Spillets formål
En spiludvikler lavede et browser-spil, hvor man skal godkende eller afvise kommandoer fra en AI-kodeagent under tidspres. Nogle kommandoer er harmløse, andre er skjulte angreb. Over 40.000 spilrunder og 409.000 beslutninger blev analyseret – og resultatet er tankevækkende.
De oversete trusler
Spillerne overså hver tredje trussel, og især snedigt gemte angreb blev misset. Den værste kommando, `npm run analyze`, blev godkendt 64,7 % af tiden – selvom den var åbenlyst mistænkelig i loggen. Sådanne skjulte angreb havde næsten dobbelt så stor succes som almindelige trusler.
Træthed gør det værre
Jo flere kommandoer man godkender, jo mindre opmærksom bliver man – det viser dataene. Spillerne blev faktisk bedre i starten, men missede flere trusler mod slutningen. Det samme problem er kendt i AI-værktøjer som Anthropics Claude Code, hvor brugerne bliver trætte af at skulle godkende alt.
Skjulte risici
Nogle harmløse kommandoer blev blokeret unødigt, hvilket også er et problem. For eksempel blev `cat ~/.zshrc` godkendt af 45,9 % – men det er kun farligt, hvis man har nøgler i filen. Eksperter efterlyser bedre sandboxing og kontekstisolering i stedet for at stole på menneskelig godkendelse.
- Over 40.000 spilrunder og 409.000 godkendelser blev analyseret.
- Mennesker overså hver tredje trussel generelt.
- `npm run analyze` blev godkendt 64,7 % af tiden.
- Skjulte angreb havde 52,5 % succes mod 28,4 % for andre.
- `cat ~/.zshrc` blev godkendt 45,9 % af tiden.
- Spillet viser træthed: miss raten stiger mod slutningen.
- Anthropic advarer mod 'permission fatigue' i Claude Code.
Når du bruger AI-kodeassistenter, skal du være ekstra opmærksom på kommandoer, der ligner rutinearbejde – de kan skjule angreb, selvom du har godkendt lignende før.
Kilder:
Hacker News: AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder