AI-nyheder
Forskning · arXiv cs.AI · 2026-08-13

Yoshinori Watanabe: AI-sikkerhed er ikke en tryllestav

Ny forskning viser, at AI's sikkerhedsregler kun virker, når den kender situationen. Giver den nye udfordring, kollapser beskyttelsen.

Opdagelsen

Forskeren Yoshinori Watanabe har fundet det, han kalder 'off-support barrieren'. Kort fortalt: AI-systemer lærer kun at følge sikkerhedsregler i situationer, de har set før. Stil dem et problem uden for deres træningsdata, og reglerne fordufter som dug for solen.

Hvorfor det rammer

Det betyder, at al den snak om at 'indbygge etik' i AI er bygget på et skrøbeligt fundament. Semantiske sikkerhedsbegrænsninger er ikke nogle faste love, men noget der let kan brydes, hvis inputtet er uventet. Watanabe argumenterer for, at vi må gentænke både design og kontrol.

Hvad så nu?

Forskeren peger på tre veje frem: bedre forudgående design, stærkere indeslutning af systemerne og grundigere verifikation. Men pointern er klar: Vi kan ikke bare stole på, at AI'en 'ved bedre', når verden overrasker den.

Detaljerne
Hvad betyder det for dig?
Når du bruger AI i hverdagen, kan du ikke altid stole på, at dens 'etik' holder stik i nye situationer. Vær opmærksom på, at den kan overraske ubehageligt.

Kilder:
arXiv cs.AI →

Læs dagens AI-nyheder på letlæst dansk →

Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.