OpenAI bygger super-hacker til at finde svagheder
OpenAI har udviklet en ny digital super-hacker, der automatisk finder sårbarheder i selskabets egne sprogmodeller.
Digital sparringspartner
Selskabet bag ChatGPT har skabt en særlig type system kendt som GPT-Red, der fungerer som en ubarmhjertig hacker. Formålet er at finde svage punkter i softwaren, før it-kriminelle gør det. Den nye model har blandt andet hjulpet med at gøre flagskibet GPT-5.6 langt mere modstandsdygtigt over for angreb end tidligere versioner.
Automatiserede angreb
Traditionelt har mennesker skullet teste programmer for fejl manuelt, men det halter bagud, i takt med at teknologien bliver mere kompleks. Den digitale hacker opdager helt nye angrebsformer ved at kæmpe mod andre modeller i en virtuel træningsarena. Under test lykkedes det systemet at hacke salgsagenten Vendy og ændre på varepriser samt annullere ordrer.
Imponerende resultater
Tallene taler deres tydelige sprog om effektiviteten. Hvor mere end 90 % af systemets stærkeste angreb virkede mod den ældre GPT-5, faldt det tal til under 23 % mod den nyeste udgave. Alligevel har værktøjet svagheder, da det endnu har svært ved samtaler over flere omgange og billeder.
- OpenAI har skabt en super-hacker ved navn GPT-Red for at forbedre sikkerheden.
- Systemet automatiserer såkaldt red-teaming, som ellers udføres af menneskelige eksperter.
- Træningen foregik i et digitalt dojo-miljø, der simulerer ægte situationer som websurfing.
- Modellen opdagede en ny type sårbarhed kaldet en falsk tankekæde.
- Mindre end 23 % af de stærkeste angreb virkede mod den nye GPT-5.6.
- OpenAI vil ikke frigive værktøjet til offentligheden.
Du får mere stabile digitale assistenter i hverdagen, som bedre kan modstå manipulerende angreb.
Kilder:
MIT Tech Review AI → OpenAI Blog →
Genfortalt i egne ord af AI-nyheder.com · AI-genereret illustration · Tjek altid originalkilden, før du handler på vigtige oplysninger.