Mark Russinovich viser vejen til at narre AI-nedbrydere
Microsofts tekniske direktør foreslår at narre angribere med falske modeller, så de ikke fjerner AI'ens indbyggede sikkerhed.
Problemet
Frimodige AI-modeller kan downloades af alle, men også ændres af ondsindede personer, der fjerner de indbyggede sikkerhedsforanstaltninger. Det betyder, at ellers harmløse chatbots kan manipuleres til at give farlige svar – for eksempel om våben eller gift. Forskere har længe forsøgt at gøre modellerne mere modstandsdygtige, men det er svært.
Løsningen
Mark Russinovich fra Microsoft har udtænkt en snedig metode: Han foreslår at gemme falske versioner af modellen, der lader som om de er sårbare, men som i virkeligheden beholder sikkerheden. Angribere, der forsøger at fjerne beskyttelsen, ender med at spilde tid og kræfter på en kopi, der ikke kan misbruges. Det kalder han 'defensiv bedrag'.
Hvad nu?
Metoden skal testes i praksis, og det er endnu uklart, om den kan holde mod vedholdende angribere. Men den giver en ny tilgang: I stedet for kun at bygge højere mure kan vi også lægge fælder for dem, der vil bryde ind. Det kan blive en vigtig brik i at gøre åbne AI-modeller sikrere for alle.
- Open-weight modeller kan hentes frit, men også ændres af hackere.
- Angreb fjerner sikkerhedsforanstaltninger og gør modellen farlig.
- Russinovich foreslår at skjule falske modeller for at narre angribere.
- Falske modeller lader som om de er sårbare, men er stadig sikre.
- Metoden spilder angriberes tid og forhindrer misbrug.
- Forslaget er stadig på ide-stadiet og skal afprøves.
Du undgår at et frit downloadet AI-værktøj bliver manipuleret til at give farlige råd, fordi forskerne nu har et nyt våben mod dem, der piller sikkerheden af.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder