SynthID svækker modellers afvisning af skadelige krav
Forskere finder, at SynthID-vandmærkning kan svække sikkerhedsafvisninger i seks åbne modeller, især ved promptinjektion. Claude er ikke testet.
Skadelige krav glider lettere igennem
Vandmærkning med SynthID-Text kan ændre, hvordan en AI-model reagerer på skadelige krav. Det viser ny forskning fra AI-sikkerhedsforsker Andrea Siposova ved Lasso Security.
Hun sendte skadelige prompts til seks åbne modeller og sammenlignede svar med og uden vandmærkning. Vandmærkningen ændrede modellernes afvisningsadfærd. Effekten var tydeligere, når kravene blev kombineret med promptinjektion, hvor en angriber forsøger at få modellen til at bryde sine sikkerhedsregler.
På flere modeller blev modellen mere tilbøjelig til at svare på skadelige krav, den ellers ville afvise. Ved AI-agenter kan de samme ordvalg også bestemme, hvilket værktøj der kaldes, og hvilke argumenter der sendes med. Siposova kalder effekten sampling drift.
Hemmelig nøgle skifter næste ord
SynthID-Text er udviklet af Google og udgivet som open source. Anthropic har oplyst, at fremtidige Claude-modeller vil bruge metoden. Den skal gøre det muligt at afgøre, om tekst er AI-genereret – det kaldes provenance, altså oprindelsesspor.
Metoden ændrer selve ordvalget. En hemmelig nøgle kan få et sandsynligt næste ord som “cloudy” til i stedet at blive “overcast”. Kender man nøglen, kan man undersøge ordrækkefølgen og vurdere, om netop den nøgle blev brugt.
En central del er tournament sampling. Modellen lader mange ordkandidater konkurrere to og to; en skjult score afgør, hvem der går videre, indtil en vinder står tilbage. Også valget af hemmelig nøgle påvirkede svarene i testen.
Claude-implementeringen er ikke testet
Forskningen tester ikke, hvordan Claude-svar ændrer sig med vandmærkning. Den undersøger et halvt dusin åbne modeller, hvor forskeren kan slå det tilfældige valg af næste ord til og fra under tournament sampling og holde andre indstillinger faste.
Testen bruger Hugging Faces implementering af SynthID-Text, ikke den specifikke implementering, Claude-modellerne skal bruge. Resultaterne viser derfor ikke, hvordan Claude vil opføre sig.
Alligevel konkluderer forskeren, at nogle former for vandmærkning kan påvirke både modelsikkerhed og agentsikkerhed. Udviklere bør derfor rødteste platforme med SynthID aktiveret, før de stoler på, at de opfører sig som forventet.
Flere detaljer
- Baggrunden er en ny EU-lov, der får AI-platforme til at indføre vandmærkning.
- Testen brugte Hugging Faces uændrede SynthIDTextWatermarkLogitsProcessor.
- Andrea Siposova er AI-sikkerhedsforsker ved Lasso Security.
Kilder:
Ars Technica AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.