Yifan Wang åbner AI'ernes sorte boks
Forskere har fundet en måde at se, hvordan AI-modeller vurderer svar - og hvorfor de nogle gange tager fejl.
Det nye gennembrud
Et forskerhold ledet af Yifan Wang har udviklet en metode, der kan vise, hvilke dele af et AI-svar der får modellen til at kalde det godt eller skidt. Tidligere kiggede man kun på de såkaldte routing-vægte, som fortæller lidt om, hvilke eksperter i systemet der er aktive. Den nye teknik går et niveau dybere og viser hele svaret.
Hvordan virker det?
Metoden hedder Contribution Contrast og sammenligner, hvad hver enkelt del af et svar bidrager med, når modellen vurderer det. Det svarer til at få en karakterbog, hvor man kan se, om det var formuleringen, fakta eller længden, der tippede vurderingen. Det gør det langt lettere at gennemskue, hvorfor en AI giver et svar en høj eller lav score.
Hvad kan det bruges til?
For almindelige brugere betyder det, at AI-assistenter i fremtiden kan blive bedre til at forklare deres egne vurderinger. For udviklere åbner det for at træne modeller mere præcist og undgå skjulte fejl. Det kan også hjælpe med at opdage, når en model belønner et svar af de forkerte grunde - for eksempel fordi det lyder selvsikkert, selvom det er forkert.
- Forskerholdet ledes af Yifan Wang fra arXiv.
- Metoden kaldes Contribution Contrast og fokuserer på svar-niveau.
- Den går dybere end traditionelle routing-vægte.
- Værktøjet kan vise, hvilke dele af et svar der påvirker vurderingen.
- Det kan hjælpe med at forklare AI-modellers beslutninger.
- Metoden er relevant for Mixture-of-Experts-modeller.
Du kan i fremtiden få mere gennemsigtige AI-svar, hvor modellen selv viser, hvad der gjorde udslaget - og hvorfor den måske tager fejl.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder