Spring til artiklen
AI-nyheder
← Tilbage til nyhederne
Forskning · arXiv cs.AI · 2026-09-07

Duong M. Nguyen: Sådan narres AI med skjulte beskeder

Duong M. Nguyen har fundet en ny måde at forstå og stoppe angreb, hvor skjulte instruktioner får AI til at gøre uventede ting.

Problemet

AI-chatbots kan narres af skjulte beskeder, der gemmer sig i tekster, hjemmesider eller dokumenter. Det kaldes indirekte prompt injection. Selvom brugeren ikke har bedt om noget farligt, kan den skjulte tekst få AI'en til at ændre adfærd og fx udlevere fortrolige oplysninger.

Den nye vinkel

Forsker Duong M. Nguyen og kolleger foreslår at se problemet på en helt ny måde: som et søgeproblem, der opstår i det øjeblik AI'en skal bruge informationen. I stedet for at fokusere på svage punkter i oplæringen, handler det om, hvordan AI'en vælger mellem forskellige kilder under selve samtalen.

Værktøjet

Den nye tilgang kan bruges til at bygge bedre forsvar mod denne type angreb. Ved at forstå, hvordan AI'en 'søger' efter relevant information, kan udviklere lave systemer, der bedre kan afvise modstridende eller skjulte instruktioner. Det giver håb for mere sikre AI-assistenter i fremtiden.

Detaljerne
Hvad betyder det for dig?
Du kan få mere sikre AI-assistenter i hverdagen, der ikke lader sig narre af skjulte instruktioner i fx e-mails eller hjemmesider.

Kilder:
arXiv cs.AI →

Læs dagens AI-nyheder på letlæst dansk →

Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.