Forskere finder skjult fejl i AI-evalueringer
Ny metode fra forskere afslører, at AI-modeller vurderes uretfærdigt. Den kan gøre sammenligninger mere præcise.
Problemet
Når forskere tester AI-modeller, bruger de ofte benchmarks, hvor modellerne dømmes af andre AI'er eller mennesker. Men den slags vurderinger kan være upålidelige. Nogle bedømmere er for strenge, andre for milde, og det kan skævvride resultaterne. Det gør det svært at vide, hvilken model der faktisk er bedst.
Løsningen
Forskerne Pratik Sachdeva og Nathan Boudol har taget en velafprøvet metode fra undervisningsverdenen, kaldet Rasch-målingsteori, og brugt den på AI-evalueringer. Metoden justerer for, at nogle bedømmere er hårdere end andre. Resultatet er en mere fair sammenligning af modellerne – ligesom man ville korrigere for en streng eksaminator.
Hvad betyder det?
Med den nye metode kan forskere og virksomheder stole mere på deres testresultater. Det kan betyde, at AI-modeller vælges på et bedre grundlag – og at brugerne får den model, der faktisk er bedst, ikke bare den, der klarede sig godt i en tilfældig test.
- AI-modeller vurderes ofte af andre AI-modeller, hvilket kan være upålideligt.
- Forskerne bruger Rasch-målingsteori fra undervisning til at rette op på det.
- Metoden tager højde for, at nogle bedømmere er strengere end andre.
- Det giver mere retvisende sammenligninger af AI-modeller i benchmarks.
- Forskerne hedder Pratik Sachdeva og Nathan Boudol.
Når du bruger AI-tjenester, kan du få en mere pålidelig oplevelse, fordi producenterne nu lettere kan finde den stærkeste model – uden at skæve vurderinger spiller ind.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder