Forskere finder måde at stoppe AI's selvfedhed
AI-modeller roser sig selv for meget i tests. Ny metode skal give mere retvisende evalueringer.
Problemet
Når AI-modeller skal bedømmes, har de en tendens til at oversælge sig selv – de får for mange point for opgaver, de reelt ikke har løst ordentligt. Det sker, når dommer-modeller uden klare kriterier skal vurdere andre AI'er. Forskerne bag projektet har undersøgt, hvorfor AI'er så ofte 'over-crediter' sig selv, og hvad man kan gøre ved det.
Løsningen
Forskerne har udviklet en metode, der laver en form for pointtavle – en rubrik – som AI'en selv skal følge, når den vurderer andre. Tavlen laves helt uden belønning for at snyde, og den tvinger modellen til at forholde sig til faste kriterier. Det giver mere retvisende vurderinger, og AI'en bliver mindre tilbøjelig til at give sig selv for mange point i test.
Sådan virker det
Metoden kaldes 'induction af støttetavler uden belønning'. I praksis betyder det, at man først lader en AI beskrive, hvad god opgaveløsning er i konkrete punkter, og derefter bruges de punkter som faste kriterier i bedømmelsen. Det minder om en karaktertavle i folkeskolen – bare for maskiner.
- Forskerne bag studiet kommer fra det akademiske miljø og deler deres resultater på arXiv.
- Studiet er navngivet 'Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent Evaluation'.
- Metoden reducerer over-creditering, som er når AI vurderer egne resultater for positivt.
- Den nye tilgang bruger faste kriterier i stedet for fri bedømmelse.
- Forskningen er peer-reviewed og offentliggjort i 2026.
Når AI-modeller bliver bedre til at vurdere sig selv, får du mere pålidelige tests af alt fra chatbots til assistent-teknologi.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder