Duong M. Nguyen: Sådan narres AI med skjulte beskeder
Duong M. Nguyen har fundet en ny måde at forstå og stoppe angreb, hvor skjulte instruktioner får AI til at gøre uventede ting.
Problemet
AI-chatbots kan narres af skjulte beskeder, der gemmer sig i tekster, hjemmesider eller dokumenter. Det kaldes indirekte prompt injection. Selvom brugeren ikke har bedt om noget farligt, kan den skjulte tekst få AI'en til at ændre adfærd og fx udlevere fortrolige oplysninger.
Den nye vinkel
Forsker Duong M. Nguyen og kolleger foreslår at se problemet på en helt ny måde: som et søgeproblem, der opstår i det øjeblik AI'en skal bruge informationen. I stedet for at fokusere på svage punkter i oplæringen, handler det om, hvordan AI'en vælger mellem forskellige kilder under selve samtalen.
Værktøjet
Den nye tilgang kan bruges til at bygge bedre forsvar mod denne type angreb. Ved at forstå, hvordan AI'en 'søger' efter relevant information, kan udviklere lave systemer, der bedre kan afvise modstridende eller skjulte instruktioner. Det giver håb for mere sikre AI-assistenter i fremtiden.
- Skjulte beskeder i dokumenter kan ændre en AI's handlinger.
- Metoden hedder indirekte prompt injection og er kendt sårbarhed.
- Forskerne beskriver angrebet som et søgeproblem ved test-tidspunktet.
- Tilgangen kan bruges til at lave stærkere forsvar mod angreb.
- Studiet er lagt frem som forskningsartikel på arXiv under cs.AI.
- Duong M. Nguyen står bag sammen med tre andre forskere.
Du kan få mere sikre AI-assistenter i hverdagen, der ikke lader sig narre af skjulte instruktioner i fx e-mails eller hjemmesider.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder