Yujin Zhou tester AI-hallucinationer i jura
Forskere bag LexAgentHallu har lavet en ny benchmark, der måler, hvor ofte jura-AI opfinder egne love og domme.
Hvad er LexAgentHallu?
LexAgentHallu er en hierarkisk test, der stiller juridiske AI-agenter opgaver og måler, hvor ofte de finder på love eller domme. Den er designet til at afsløre de fejl, der er sværest at opdage, fordi de lyder troværdige. Formålet er at give et klart billede af, hvor sikkert et AI-system er til jura, før man tør bruge det i praksis.
Hvorfor er det nyt?
Tidligere benchmarks for jura-AI kiggede mest på, om svaret var rigtigt eller forkert. LexAgentHallu går et lag dybere og kortlægger, hvordan AI'en hallucinerer. Den viser, om den opfinder paragraffer, blander sager sammen eller henviser til domme, der ikke findes. Det er første gang, nogen profilerer fejlene så systematisk, og det gør det muligt at sammenligne AI-modeller på et helt nyt område.
Hvad kan vi bruge det til?
Advokater og andre jurister kan i fremtiden bruge testen, når de vælger AI-værktøj. I stedet for at stole på en generel beskrivelse af systemet kan de se, præcis hvilke typer fejl det laver. Det kan føre til strengere krav til AI i retssale og til, at udviklere forbedrer modellerne, så de holder op med at opfinde lovtekster.
- Benchmarken tester juridiske AI-agenters evne til at undgå at opfinde love og domme.
- Den er hierarkisk opbygget og profilerer forskellige typer af hallucinationer.
- Den er udviklet af Yujin Zhou og seks andre forskere.
- Testen skal gøre det nemmere at sammenligne, hvor pålidelige forskellige AI-modeller er i juridiske opgaver.
- Den kan bruges af advokater og udviklere til at stille skarpere krav til AI i retsvæsenet.
Hvis AI skal hjælpe med jura, skal den kunne stoles på. Denne test kan være med til at sikre, at fremtidens AI ikke finder på love og domme, så du ikke bliver vildledt.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder