MMShopBench-forskerne tester AI som din nye indkøbshjælper
Nyt benchmark viser, hvor godt AI-agenter klarer rigtige shopping-opgaver med billeder og flere samtalerunder.
Det er sket
Forskere bag MMShopBench har bygget et testværktøj, der måler, hvor godt AI-assistenter klarer indkøb i den virkelige verden. I modsætning til tidligere tests bruger det rigtige logfiler fra faktiske kunder, så opgaverne ligner det, du selv ville bede om – med billeder af varer og flere spørgsmål i samme samtale.
Sådan gik det
Testen udfordrer AI-modeller som GPT-4o og Claude 3.5 Sonnet med dagligdags opgaver såsom at finde den rigtige størrelse eller sammenligne priser på tværs af butikker. Selvom modellerne klarer simple trin, viser resultaterne, at de stadig fejler, når samtalen bliver lang, og når de skal forstå billeder sammen med tekst. Der er plads til forbedring.
Hvad nu?
MMShopBench giver udviklere et fælles mål at skyde efter – ligesom en karakterbog for AI-shopping. Med det kan man sammenligne nye modeller og se præcist, hvor de fejler. For dig kan det betyde, at fremtidens AI-assistenter bliver bedre til at handle ind for dig uden at misforstå dine ønsker.
- MMShopBench bruger rigtige kundelogfiler til at teste AI i shopping-scenarier.
- Opgaverne kræver, at AI forstår både billeder og tekst samtidig.
- Flere samtalerunder gør testen sværere end tidligere benchmarks.
- GPT-4o og Claude 3.5 Sonnet er blandt de testede modeller.
- Forskerne håber at forbedre AI's evne til at håndtere komplekse indkøb.
Du kan snart få en AI-assistent, der handler ind for dig – men først skal den lære at forstå billeder og lange samtaler uden at fejle.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder