AI-læger vurderes for sent i samtalen
Ny forskning viser, at AI vurderes først efter patientsvarene - men fejlene sker allerede i det første spørgsmål.
Det nye fund
Forskere bag en ny undersøgelse har opdaget, at AI-chatbots til sundhedsrådgivning bliver testet alt for sent i forløbet. De fleste evalueringer kigger kun på, hvad AI'en svarer på patientens sidste besked. Men ifølge forskerne opstår de alvorlige fejl allerede tidligere - nemlig i det allerførste spørgsmål, som patienten stiller.
Forklaringen
Fænomenet kaldes 'preformulation-gabet' - altså at AI'en skal forstå og omformulere patientens problem, før den kan hjælpe. Hvis AI'en misforstår det første spørgsmål, bliver alle de efterfølgende svar også forkerte. Alligevel måler man kun på svarene til sidst. Det svarer til at bedømme en læge kun på recepten - uden at se på, om diagnosen var rigtig.
Hvad det betyder
Forskerne foreslår, at AI-systemer fremover også vurderes på, hvordan de stiller opfølgende spørgsmål og sikrer, at de har forstået patienten korrekt fra starten. Det kan få stor betydning for, hvordan kommende AI-læger bliver udviklet - og forhåbentlig gøre dem mere sikre at bruge i virkeligheden.
- Forskningen fokuserer på AI-chatbots til medicinsk rådgivning.
- Fænomenet kaldes 'The Preformulation Gap' - et hul i forståelsen før formuleringen.
- Fejl opstår ofte allerede ved patientens første spørgsmål.
- Nuværende tests vurderer kun AI'ens svar - ikke dens indledende forståelse.
- Forskerne foreslår at evaluere AI'ens opfølgningsspørgsmål.
- Studiet er publiceret på arXiv.
Når du søger sundhedsråd hos en AI, kan den misforstå dig helt fra starten - uden at nogen opdager det. Fremtidige systemer bør tjekke deres forståelse tidligere, så du får mere pålidelig hjælp.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder