Parupudi: AI-ranglister afslører konfigurations-skjulte fejl
Forsker V.S. Raghu Parupudi viser, at AI-benchmarks er skrøbelige over for opsætning, hvilket kan snyde ranglister.
Det nye fund
Forskeren bag den nye undersøgelse, V.S. Raghu Parupudi, har fundet, at selv små ændringer i opsætningen af AI-test kan vende op og ned på resultaterne. Det betyder, at de ranglister, der sammenligner forskellige AI-modeller, ikke er så pålidelige, som de ser ud. Et spørgsmål, der ellers ser neutralt ud, kan nemlig være et 'konfigurations-skrøbeligt' punkt, der påvirker hele testen.
Hvorfor det sker
Når AI-modeller testes, bruger forskerne en 'harness' - en slags ramme, der styrer, hvordan spørgsmålene bliver stillet. Parupudi viser, at der ingen neutral harness findes; hver eneste opsætning har sine egne skjulte indstillinger, der kan give fordele til nogle modeller og ulemper til andre. Det kan forklare, hvorfor samme model scorer vidt forskelligt i forskellige tests.
Kritikken og perspektivet
Undersøgelsen er en advarsel til både udviklere og brugere om ikke at stole blindt på benchmark-tal. Parupudi opfordrer til, at man undersøger hver enkelt testopgave grundigt, før man drager konklusioner. For almindelige mennesker betyder det, at AI-værktøjer, der ser ud til at være bedst på papiret, måske ikke er det i praksis.
- V.S. Raghu Parupudi står bag den nye forskning om AI-testpålidelighed.
- Ranglister over AI-modeller kan ændres dramatisk ved små opsætningsændringer.
- Konfigurations-skrøbelige testpunkter kan favorisere bestemte modeller.
- Der findes ingen 'neutral' testramme, ifølge Parupudi.
- Resultaterne er offentliggjort på arXiv under cs.AI.
- Forskningen bygger på systematisk gennemgang af eksisterende benchmarks.
Når du vælger et AI-værktøj, kan du ikke stole på ranglisterne - de taler måske mest om opsætningen, ikke om kvaliteten.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder