AI-tests lover meget, men holder ikke
Forskere afslører, at AI-modellers testresultater ikke kan bruges til at forudsige, hvordan de klarer sig i virkeligheden.
Problemet med tests
Når en AI klarer sig godt i en benchmark-test, tror vi, den også er god til andre opgaver. Men ifølge ny forskning holder den antagelse ofte ikke. Testresultaterne 'komponerer' ikke – de siger ikke noget om, hvordan AI'en opfører sig uden for testsituationen.
Hvad forskerne fandt
Forskeren Brett Reynolds har undersøgt fænomenet 'projectibility' – altså om testresultater kan overføres til andre sammenhænge. Konklusionen er, at de fleste benchmarks er for specifikke. En AI, der er god til matematik, er ikke nødvendigvis god til at skrive eller ræsonnere.
Hvad nu?
Forskerne efterlyser nye måder at evaluere AI på, som bedre afspejler virkelighedens kompleksitet. Indtil da bør vi være skeptiske over for store testresultater. De siger måske mere om testen end om AI'ens egentlige kunnen.
- Forskningen viser, at AI-testresultater ofte ikke kan overføres til andre opgaver.
- Begrebet 'projectibility' handler om, hvorvidt testresultater gælder i nye sammenhænge.
- En AI kan være god til én specifik test, men dårlig til andre lignende opgaver.
- Forskeren kritiserer, at benchmarks er for snævre og ikke afspejler virkeligheden.
- Der er behov for nye evalueringsmetoder, der tester AI i mere komplekse situationer.
Du kan ikke stole blindt på, at en AI, der scorer højt i en test, også vil fungere godt i din hverdag – testresultaterne siger ofte mere om testen end om AI'en.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.