Forskerhold tester: Er AI-sikkerhedstest selv sikre?
Forskere har undersøgt, om AI-sikkerhedstest er pålidelige - og fundet store huller. Testene overser farlig adfærd og giver falsk tryghed.
Det er sket
Forskere har gransket de gængse AI-sikkerhedstest for små sprogmodeller og fundet alvorlige svagheder. Testene er designet til at afsløre utilsigtet adfærd som giftige svar eller farlige råd, men de overser ofte præcis de situationer, hvor de burde slå alarm. Det betyder, at selv når en model klarer en test, kan den godt opføre sig utilpasset - testene giver simpelthen et for rosenrødt billede.
Hvorfor det betyder noget
Små sprogmodeller bruges i stigende grad i alt fra chatbots på hjemmesider til sprogundervisning. Hvis sikkerhedstestene ikke virker, kan det betyde, at modeller med skjulte sikkerhedshuller bliver lukket ud til almindelige brugere. Forskerne foreslår, at testene skal blive mere realistiske og bredere - så de faktisk matcher de trusler, der opstår i den virkelige verden, og ikke bare i et kontrolleret laboratorium.
Hvad nu?
Forskerne efterlyser et nyt sæt retningslinjer, der kan gøre sikkerhedstestene mere troværdige - både for udviklere og for de myndigheder, der skal godkende AI-teknologier. Indtil videre står udviklerne uden et pålideligt værktøj til at vurdere, om deres modeller faktisk er sikre nok til at blive brugt. Det skaber en ubehagelig usikkerhed i en industri, hvor hastighed ofte går forud for grundighed.
- Forskere har evalueret eksisterende AI-sikkerhedstest og fundet, at de ikke er pålidelige.
- Testene overser utilsigtet adfærd, som de ellers er designet til at fange.
- Små sprogmodeller bliver mere udbredte i hverdagsprodukter, hvilket øger risikoen.
- Forskerne anbefaler, at testene bliver bredere og tættere knyttet til virkelige scenarier.
- Studiet er foretaget af forskere, herunder en fra et amerikansk universitet.
Du kan risikere at bruge en AI, der i virkeligheden er farlig, selv om den har bestået en sikkerhedstest - og få et falsk trygt svar, når den egentlig skulle have sagt nej.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder