GPT-4.1: Ny metrik afslører ustabile agenter

IBM-forskere måler, hvor ofte en agent klarer samme opgave i alle fem forsøg, og foreslår kandidat-retningslinjer, der skal mindske variationen.
77 procent i snit, 53 hver gang
En agent er et AI-system, der selv tager flere skridt: kalder værktøjer, læser noter og skriver svar. På benchmarken AppWorld klarede en ReAct-agent med GPT-4.1 opgaven i 77,4 % af kørslerne, når den blev gentaget fem gange.
Det er gennemsnittet, Mean@5. Men kun 53,0 % af opgaverne blev løst i alle fem forsøg – en forskel på 24,4 point.
IBM-forskerne kalder hullet for consistency gap. Næsten en fjerdedel af opgaverne lykkes altså nogle gange og mislykkes andre gange, uden at opgaven ændrer sig.
- Mean@5: andel beståede kørsler i fem gennemløb, ReAct-agent med GPT-4.1 på AppWorld
- 77,4 %
- Pass^5: andel opgaver løst i alle fem gennemløb
- 53,0 %
- Consistency gap: forskellen mellem Mean@5 og Pass^5
- 24,4 point
Hvorfor agenten skifter mening
Hver beslutning i en AI-model kommer ud af en sandsynlighedsfordeling over det næste ord. Er fordelingen skarp, ligger næsten al vægten på ét ord, og valget bliver det samme igen og igen.
Er den flad, ligger flere ord næsten lige. Så kan små udsving – fra GPU-beregninger eller fra batching af forespørgsler – vende rækkefølgen. En kørsel kæder snesevis af beslutninger sammen, så risikoen vokser for, at mindst én vender.
Agenten kørte ved temperature 0.0, altså med mindst mulig tilfældighed. Det hjælper ikke, fordi temperaturen styrer, hvordan fordelingen bliver til et ord – ikke fordelingen selv.
Diagnose: hvilke skridt vipper
Til at finde de usikre beslutninger har forskerne bygget Consistency Analyzer. Den tager én optaget kørsel og sender hvert beslutningsskridt gennem modellen igen med fem nye svar pr. skridt som standard.
Det koster ét ekstra modelkald pr. beslutning, kørt offline. Analyzeren gentager ikke opgaven og rører hverken værktøjer eller omgivelser. Ud kommer en konsistensscore pr. skridt i et scorecard.
Metoden er black-box: den bruger ikke logits – modellens rå sandsynligheder – eller anden adgang til modellens indre, kun den kørsel man allerede har.
Kandidat til en ny retningslinje
Hvert markeret skridt bliver til en kandidat til en consistency guideline, ikke en færdig regel. Forslaget skrives i samme format som ALTK-Evolve, et system der omdanner en agents tidligere kørsler til genbrugelige retningslinjer og fører dem ind igen under kørslen.
I artiklen viser forskerne et eksempel, som GPT-4.1 selv har skrevet ud fra en AppWorld-opgave om at tælle aktiviteter på en huskeliste i SimpleNote. Retningslinjen handler om at tælle afkrydsningsfelter i noteteksten.
Færre udsving uden tabt nøjagtighed
Artiklens resultatafsnit hedder "Reducing the Gap Without Losing Accuracy". Ifølge forskerne mindsker retningslinjerne hullet mellem gennemsnit og gentagelse, uden at nøjagtigheden falder, og de gælder bredere end den enkelte kørsel.
Flere detaljer
- Pass^k kræver succes i alle forsøg, mens Pass@k kun kræver ét.
- Agenten kørte ved temperature 0.0, så variationen kommer ikke fra almindelig sampling.
- Consistency Analyzer er bygget ind i ALTK-Evolve, der blev præsenteret i et tidligere opslag.
Kilder:
Hugging Face →
Genfortalt i egne ord af AI-nyheder.com · AI-genereret illustration · Tjek altid originalkilden, før du handler på vigtige oplysninger.