AI-nyheder
Forskning · arXiv cs.AI · 2026-08-19

Mark Russinovich viser vejen til at narre AI-nedbrydere

Microsofts tekniske direktør foreslår at narre angribere med falske modeller, så de ikke fjerner AI'ens indbyggede sikkerhed.

Problemet

Frimodige AI-modeller kan downloades af alle, men også ændres af ondsindede personer, der fjerner de indbyggede sikkerhedsforanstaltninger. Det betyder, at ellers harmløse chatbots kan manipuleres til at give farlige svar – for eksempel om våben eller gift. Forskere har længe forsøgt at gøre modellerne mere modstandsdygtige, men det er svært.

Løsningen

Mark Russinovich fra Microsoft har udtænkt en snedig metode: Han foreslår at gemme falske versioner af modellen, der lader som om de er sårbare, men som i virkeligheden beholder sikkerheden. Angribere, der forsøger at fjerne beskyttelsen, ender med at spilde tid og kræfter på en kopi, der ikke kan misbruges. Det kalder han 'defensiv bedrag'.

Hvad nu?

Metoden skal testes i praksis, og det er endnu uklart, om den kan holde mod vedholdende angribere. Men den giver en ny tilgang: I stedet for kun at bygge højere mure kan vi også lægge fælder for dem, der vil bryde ind. Det kan blive en vigtig brik i at gøre åbne AI-modeller sikrere for alle.

Detaljerne
Hvad betyder det for dig?
Du undgår at et frit downloadet AI-værktøj bliver manipuleret til at give farlige råd, fordi forskerne nu har et nyt våben mod dem, der piller sikkerheden af.

Kilder:
arXiv cs.AI →

Læs dagens AI-nyheder på letlæst dansk →

Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.