AI-testresultater er forældede på ét år
Forskere slår fast: De prangende scoretal fra sprogmodeller holder sjældent et år. Sammenligninger er ubrugelige over tid.
Problemstillingen
AI-modeller præsenteres ofte med præcise testresultater, som om de var evige sandheder. Men forskere bag artiklen viser, at disse tal er forældede viden, der mister værdi i løbet af måneder. Sprogmodeller udskifter hinanden så hurtigt, at dagens mester er morgendagens fortid.
Hvorfor holder de ikke?
Når en ny model kommer, ændres datasæt og testmetoder ofte. Gamle testresultater kan derfor ikke bruges til at sammenligne med nye modeller. Forskerne kalder scoringssystemet for 'fordærveligt' – som mad, der bliver dårlig. Et resultat fra i fjor siger intet om nutidens AI-formåen.
Konsekvenser
Det betyder, at virksomheder og forbrugere ikke kan stole blindt på benchmarks, når de vælger AI-værktøjer. Den model, der scorede højest for seks måneder siden, kan være overhalet af flere nyere. Beslutninger baseret på gamle tal risikerer at være forældede, før de er truffet.
- Forskningen er offentliggjort på arXiv og i en konference.
- Artiklen hedder 'Evaluation Scores Are Perishable Knowledge Claims'.
- Resultater fra AI-test mister deres relevans i løbet af måneder.
- Nye modeller ændrer testbetingelserne, så gamle tal bliver ugyldige.
- Sammenligning af AI-modeller over tid er derfor upålidelig.
Næste gang du ser et prangende testresultat fra en AI-model, så tjek datoen – er tallet mere end et år gammelt, er det ikke længere til at stole på.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.