LongGuard løser AI-vagtes svigt ved lange beskeder
Forskere har fundet ud af, hvorfor AI-sikkerhedsvagtefejler ved lange beskeder – og lavet en gratis løsning uden ekstra træning.
Problemet
AI-chatbots som ChatGPT har indbyggede vagter, der skal blokere farlige svar. Men når en besked bliver meget lang, begynder vagterne at fejle – de overser pludselig trusler og skadelige forespørgsler. Forskere bag det nye værktøj LongGuard har nu fundet den mekaniske årsag: Jo længere tekst, desto mere fortaber vagtens opmærksomhed sig i irrelevant fyld.
Løsningen
LongGuard er en metode, der kræver ingen ekstra træning – den kobles bare på eksisterende systemer. I testen hævede den vagternes evne til at fange farlige beskeder med hele 87 % ved meget lange tekster. Det sker ved at klemme teksten sammen, så vagten fokuserer på de vigtige dele i stedet for at drukne i detaljer.
Hvad nu?
Værktøjet er open source og kan implementeres med det samme i både chatbots og andre AI-tjenester, mener forskerne. Det betyder, at udviklere ikke skal vente på dyre opdateringer – de kan selv beskytte deres brugere med det samme. Næste skridt er at teste LongGuard i endnu flere sammenhænge og få det indbygget i standardløsninger.
- LongGuard er en løsning, der kræver ingen ekstra træning af AI-modellerne.
- Problemet opstår, fordi vagternes opmærksomhed fortyndes i lange tekstsekvenser.
- Metoden klemmer teksten sammen, så vagten kun ser de vigtigste dele.
- Værktøjet er open source og gratis at bruge for udviklere.
- Forskerne testede LongGuard på flere forskellige vagtmodeller med samme gode resultat.
Du får en tryggere chatbot, der ikke pludselig overser farlige svar, selv når du skriver lange beskeder – og det sker uden ventetid på opdateringer.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder