Yoshinori Watanabe: AI-sikkerhed er ikke en tryllestav
Ny forskning viser, at AI's sikkerhedsregler kun virker, når den kender situationen. Giver den nye udfordring, kollapser beskyttelsen.
Opdagelsen
Forskeren Yoshinori Watanabe har fundet det, han kalder 'off-support barrieren'. Kort fortalt: AI-systemer lærer kun at følge sikkerhedsregler i situationer, de har set før. Stil dem et problem uden for deres træningsdata, og reglerne fordufter som dug for solen.
Hvorfor det rammer
Det betyder, at al den snak om at 'indbygge etik' i AI er bygget på et skrøbeligt fundament. Semantiske sikkerhedsbegrænsninger er ikke nogle faste love, men noget der let kan brydes, hvis inputtet er uventet. Watanabe argumenterer for, at vi må gentænke både design og kontrol.
Hvad så nu?
Forskeren peger på tre veje frem: bedre forudgående design, stærkere indeslutning af systemerne og grundigere verifikation. Men pointern er klar: Vi kan ikke bare stole på, at AI'en 'ved bedre', når verden overrasker den.
- AI's sikkerhedsregler gælder kun for situationer, den allerede kender fra træning.
- Uventede input kan få selv veltrænede AI'er til at bryde deres retningslinjer.
- Forskeren kalder problemet for 'off-support barrieren'.
- Studiet er relevant for design af fremtidige AI-systemer.
- Indeslutning og verifikation skal tænkes ind fra starten.
- Artiklen er et forskningsbidrag på arXiv-platformen.
Når du bruger AI i hverdagen, kan du ikke altid stole på, at dens 'etik' holder stik i nye situationer. Vær opmærksom på, at den kan overraske ubehageligt.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder