Yiqi Zhu tester AI-assistenter i hverdagens mareridt
Forskere har lavet et katalog med svære opgaver, der tester, hvor godt AI-assistenter klarer sig i virkeligheden. Resultaterne er vigtige for, hvad du kan forvente af din telefons hjælper.
Det er sket
Et forskerhold, med Yiqi Zhu i spidsen, har bygget en ny slags sværhedsprøve til mobile AI-assistenter. I stedet for simple kommandoer som at sætte en alarm, skal assistenterne nu klare forvirrende situationer med støj, afbrydelser og uklare formuleringer. Det er et skridt væk fra de pæne testmiljøer og tættere på, hvordan du faktisk bruger din telefon.
Hvorfor det nytter
De fleste AI-assistenter fejler, når de møder virkelige scenarier. Det kan være en besked, der bliver afbrudt midt i en sætning, eller en opgave, der kræver, at assistenten spørger ind for at forstå, hvad du vil. Den nye test afslører, at der stadig er lang vej, før assistenterne kan bruges til alt det, vi drømmer om.
Kritikerne siger
Nogle vil måske mene, at testen er for streng, fordi den stiller krav, som mange mennesker selv ville have svært ved at opfylde. Men forskerne mener, at det er netop sådanne udfordringer, assistenterne skal kunne klare, hvis de skal blive rigtige hjælpere. Uden svære prøver kan vi ikke vide, hvor de fejler.
- Ny benchmark er udviklet til at teste mobile assistenter i udfordrende situationer.
- Testen fokuserer på virkelige scenarier med støj og uklare beskeder.
- AI-assistenter fejler ofte, når opgaver bliver afbrudt eller er tvetydige.
- Forskerne bag vil flytte test fra laboratorier ud i den virkelige verden.
- Resultaterne kan bruges til at forbedre, hvordan assistenter håndterer hverdagens rod.
Du kan forvente, at din telefons AI-assistent bliver bedre til at forstå dig, når du roder rundt i formuleringer – men det tager tid, før den er helt skarp.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder