Spring til artiklen
nyhederModellanceringer
← Tilbage til nyhederne
Forskning · Hugging Face · 15.09.2026 · 2 min. læsning

GPT-4.1: Ny metrik afslører ustabile agenter

A solid black OpenAI Blossom symbol centered on an opaque white chip, connected to five identical rounded task tokens arranged in a row; three tokens carry a green checkmark and tw

IBM-forskere måler, hvor ofte en agent klarer samme opgave i alle fem forsøg, og foreslår kandidat-retningslinjer, der skal mindske variationen.

77 procent i snit, 53 hver gang

En agent er et AI-system, der selv tager flere skridt: kalder værktøjer, læser noter og skriver svar. På benchmarken AppWorld klarede en ReAct-agent med GPT-4.1 opgaven i 77,4 % af kørslerne, når den blev gentaget fem gange.

Det er gennemsnittet, Mean@5. Men kun 53,0 % af opgaverne blev løst i alle fem forsøg – en forskel på 24,4 point.

IBM-forskerne kalder hullet for consistency gap. Næsten en fjerdedel af opgaverne lykkes altså nogle gange og mislykkes andre gange, uden at opgaven ændrer sig.

Mean@5: andel beståede kørsler i fem gennemløb, ReAct-agent med GPT-4.1 på AppWorld
77,4 %
Pass^5: andel opgaver løst i alle fem gennemløb
53,0 %
Consistency gap: forskellen mellem Mean@5 og Pass^5
24,4 point

Hvorfor agenten skifter mening

Hver beslutning i en AI-model kommer ud af en sandsynlighedsfordeling over det næste ord. Er fordelingen skarp, ligger næsten al vægten på ét ord, og valget bliver det samme igen og igen.

Er den flad, ligger flere ord næsten lige. Så kan små udsving – fra GPU-beregninger eller fra batching af forespørgsler – vende rækkefølgen. En kørsel kæder snesevis af beslutninger sammen, så risikoen vokser for, at mindst én vender.

Agenten kørte ved temperature 0.0, altså med mindst mulig tilfældighed. Det hjælper ikke, fordi temperaturen styrer, hvordan fordelingen bliver til et ord – ikke fordelingen selv.

Diagnose: hvilke skridt vipper

Til at finde de usikre beslutninger har forskerne bygget Consistency Analyzer. Den tager én optaget kørsel og sender hvert beslutningsskridt gennem modellen igen med fem nye svar pr. skridt som standard.

Det koster ét ekstra modelkald pr. beslutning, kørt offline. Analyzeren gentager ikke opgaven og rører hverken værktøjer eller omgivelser. Ud kommer en konsistensscore pr. skridt i et scorecard.

Metoden er black-box: den bruger ikke logits – modellens rå sandsynligheder – eller anden adgang til modellens indre, kun den kørsel man allerede har.

Kandidat til en ny retningslinje

Hvert markeret skridt bliver til en kandidat til en consistency guideline, ikke en færdig regel. Forslaget skrives i samme format som ALTK-Evolve, et system der omdanner en agents tidligere kørsler til genbrugelige retningslinjer og fører dem ind igen under kørslen.

I artiklen viser forskerne et eksempel, som GPT-4.1 selv har skrevet ud fra en AppWorld-opgave om at tælle aktiviteter på en huskeliste i SimpleNote. Retningslinjen handler om at tælle afkrydsningsfelter i noteteksten.

Færre udsving uden tabt nøjagtighed

Artiklens resultatafsnit hedder "Reducing the Gap Without Losing Accuracy". Ifølge forskerne mindsker retningslinjerne hullet mellem gennemsnit og gentagelse, uden at nøjagtigheden falder, og de gælder bredere end den enkelte kørsel.

Flere detaljer
Derfor er det interessantFor opgaver som at afstemme en finansiel transaktion eller kontrollere en kontrakt for en forpligtelse kan en agent, der kun lykkes nogle gange, være en stopklods.

Kilder:
Hugging Face →

Læs dagens AI-nyheder på letlæst dansk →

Genfortalt i egne ord af AI-nyheder.com · AI-genereret illustration · Tjek altid originalkilden, før du handler på vigtige oplysninger.