Hul mellem AI's viden og selvtillid
Forskere finder, at AI-modeller ofte ved, om et svar er forkert, men ikke viser det udadtil. Kan gøre dem mere pålidelige.
Opdagelsen
Forskere har fundet et mønster i AI-modeller: De kan 'vide' at et svar er forkert, men alligevel sige det med høj selvtillid. Ved at kigge ind i modellens indre lag, kan de se fejl, som den normale usikkerheds-måling overser. Det kalder de 'knowing-saying gap' - kløften mellem at vide og at sige.
Hvordan det virker
AI-modeller som ChatGPT ligner sorte bokse, men forskerne brugte 'probes' - små sensorer der læser aktiviteten i modellen. De fandt at modellen ofte har en korrekt fornemmelse af, om et svar er godt eller skidt, men at den ydre selvtillid ikke afspejler det. Hullet er størst ved svære spørgsmål.
Hvad det betyder
Det kan betyde, at vi får AI der bedre kan sige 'jeg ved det ikke' - i stedet for at svare sikkert og tage fejl. Det er vigtigt i alt fra patientrådgivning til finansielle anbefalinger, hvor et fejlsvar kan få store konsekvenser. Teknikken kan også bruges i fremtidens AI-udvikling.
- Forskere kortlagde forskellen mellem AI-modellers indre viden og ydre selvtillid.
- Kløften kaldes 'knowing-saying gap' og er størst ved komplekse opgaver.
- Probes aflæser modellens indre tilstande og kan spotte fejl tidligere.
- Traditionel selvtillids-måling overser mange fejl, viser undersøgelsen.
- Metoden kan gøre AI mere ærlig om egne begrænsninger.
Du får færre sikre, men forkerte svar fra AI-chatbots - og dermed et mere ærligt redskab, du kan stole på.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder