Forskere finder ny måde at teste AI's svar på
Ny metode vurderer AI-chatbots uden faste spørgsmål – kan måle, om svarene er dækkende og troværdige.
Det nye trick
Forskere bag studiet har udviklet en metode, der kan vurdere kvaliteten af AI-chatbots, selv når brugerne stiller helt forskellige spørgsmål. I stedet for at sammenligne med faste facitlister kigger den på, hvor godt svaret dækker det, der spørges om, og om påstandene kan tjekkes.
Hvorfor det rager dig
Når du bruger en AI-chatbot til fx at finde svar om sygdom eller jura, er det svært at vide, om svaret er godt nok. Den nye metode kan fremover bruges til at teste chatbots, så du lettere kan stole på, at de giver fyldestgørende og sande svar.
Hvad nu?
Forskerne håber, at metoden kan blive standard for, hvordan AI-systemer evalueres. Det kan betyde, at udviklere fremover får et klart billede af, hvor deres chatbot halter – og kan rette op, før fejlene rammer dig.
- Metoden kaldes 'query-agnostic' – den virker uanset hvad der spørges om.
- Den måler både dækningsgrad og om påstande kan verificeres.
- Forskerne bag er Jeonghwan Choi og kolleger fra et forskningsmiljø.
- Artiklen er lagt på arXiv, hvor forskere deler ny viden.
- Metoden kan testes på chatbots uden at skulle lave faste testsæt.
Du kan fremover få mere pålidelige svar fra AI-chatbots, fordi udviklere får et værktøj til at fange huller og usande påstande, før de rammer dig.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder