Google lancerer hemmelig AI-test for at undgå snyd
Google DeepMind tester for første gang en AI-model med dobbelt-blind evaluering, så hverken Google eller testfolk kan se hinandens data.
Det er sket
Google DeepMind har sammen med Singapore AI Safety Institute og flere partnere lavet verdens første dobbelt-blind test af en AI-model. Modellen hedder Gemini Flash Lite og er testet i et krypteret system, hvor hverken Google eller de eksterne evaluatorer kan se hinandens data – så ingen kan snyde på forhånd.
Hvorfor det nytter
Normalt er der et problem med såkaldt benchmark-forurening, hvor AI-modeller har set testspørgsmålene før eksamen og derfor scorer kunstigt højt. Men med denne metode kan man være sikker på, at resultaterne faktisk afspejler modellens ægte evner – ikke bare hukommelse. Det er et stort skridt mod mere troværdige AI-evalueringer.
Hvad det betyder
Den nye metode kan betyde, at fremtidige AI-modeller bliver vurderet mere retfærdigt. Det er vigtigt for forskere, virksomheder og myndigheder, der skal stole på, at en AI er så god som testen viser. Hvis modeller ikke kan snyde, bliver det også sværere at skjule svagheder.
- Google DeepMind afprøver verdens første dobbelt-blind evaluering af en AI-model.
- Testen holder eksterne evalueringer i en krypteret kasse, så modeller ikke kan se spørgsmålene.
- Partnere inkluderer Singapore AI Safety Institute, OpenMined, AVERI og MLCommons.
- Modellen Gemini Flash Lite er testet i et fortroligt miljø uden risiko for forurening.
- Metoden beskytter både modelvægte og testdata mod at blive set af den anden part.
Du kan nu stole mere på AI-testresultater, fordi Google og evaluatorer ikke længere kan påvirke hinandens data. Det giver mere pålidelige vurderinger af, hvad AI faktisk kan.
Kilder:
Google DeepMind →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder