Spring til artiklen
nyhederModellanceringer
← Tilbage til nyhederne
Forskning · Ars Technica AI · 17.09.2026 · 2 min. læsning

SynthID svækker modellers afvisning af skadelige krav

Forskere finder, at SynthID-vandmærkning kan svække sikkerhedsafvisninger i seks åbne modeller, især ved promptinjektion. Claude er ikke testet.

Skadelige krav glider lettere igennem

Vandmærkning med SynthID-Text kan ændre, hvordan en AI-model reagerer på skadelige krav. Det viser ny forskning fra AI-sikkerhedsforsker Andrea Siposova ved Lasso Security.

Hun sendte skadelige prompts til seks åbne modeller og sammenlignede svar med og uden vandmærkning. Vandmærkningen ændrede modellernes afvisningsadfærd. Effekten var tydeligere, når kravene blev kombineret med promptinjektion, hvor en angriber forsøger at få modellen til at bryde sine sikkerhedsregler.

På flere modeller blev modellen mere tilbøjelig til at svare på skadelige krav, den ellers ville afvise. Ved AI-agenter kan de samme ordvalg også bestemme, hvilket værktøj der kaldes, og hvilke argumenter der sendes med. Siposova kalder effekten sampling drift.

Hemmelig nøgle skifter næste ord

SynthID-Text er udviklet af Google og udgivet som open source. Anthropic har oplyst, at fremtidige Claude-modeller vil bruge metoden. Den skal gøre det muligt at afgøre, om tekst er AI-genereret – det kaldes provenance, altså oprindelsesspor.

Metoden ændrer selve ordvalget. En hemmelig nøgle kan få et sandsynligt næste ord som “cloudy” til i stedet at blive “overcast”. Kender man nøglen, kan man undersøge ordrækkefølgen og vurdere, om netop den nøgle blev brugt.

En central del er tournament sampling. Modellen lader mange ordkandidater konkurrere to og to; en skjult score afgør, hvem der går videre, indtil en vinder står tilbage. Også valget af hemmelig nøgle påvirkede svarene i testen.

Claude-implementeringen er ikke testet

Forskningen tester ikke, hvordan Claude-svar ændrer sig med vandmærkning. Den undersøger et halvt dusin åbne modeller, hvor forskeren kan slå det tilfældige valg af næste ord til og fra under tournament sampling og holde andre indstillinger faste.

Testen bruger Hugging Faces implementering af SynthID-Text, ikke den specifikke implementering, Claude-modellerne skal bruge. Resultaterne viser derfor ikke, hvordan Claude vil opføre sig.

Alligevel konkluderer forskeren, at nogle former for vandmærkning kan påvirke både modelsikkerhed og agentsikkerhed. Udviklere bør derfor rødteste platforme med SynthID aktiveret, før de stoler på, at de opfører sig som forventet.

Flere detaljer
Derfor er det interessantFundet peger på, at udviklere bør rødteste modeller og agenter med SynthID aktiveret, før vandmærkning rulles ud, fordi både afvisninger og værktøjskald kan ændre sig.

Kilder:
Ars Technica AI →

Læs dagens AI-nyheder på letlæst dansk →

Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.