Matthew Nguyen finder vej til ærlig AI
Matthew Nguyen og kolleger viser, at styringsvektorer kan gøre AI mere ærlig. Metoden virker dog ikke altid på tværs.
Opdagelsen
Forskere ledet af Matthew Nguyen har undersøgt, hvordan man kan bruge såkaldte styringsvektorer til at påvirke AI-modellers interne tankeproces – den kæde af tanker, der fører til et svar. Ved at justere disse vektorer kan man få modellen til at være mere tro mod sine egne overvejelser i stedet for at finde på ting. Det lyder lovende, men undersøgelsen afslører, at metoden har svagheder.
Begrænsningerne
Forskerne testede, om styringsvektorerne virker på tværs af forskellige opgaver og scenarier. Resultatet? De generaliserer ikke altid. Virker vektoren for én type opgave, kan den fejle på en anden. Det betyder, at teknikken er mindre robust end håbet, og at man skal være varsom med at tro, at AI pludselig er blevet pålidelig på alle områder. Metoden kræver mere finjustering.
Vejen frem
Selvom der er bump på vejen, ser forskerne potentiale i at kombinere styringsvektorer med andre metoder for at gøre AI mere ærlig. De understreger, at forskningen er et vigtigt skridt mod at forstå, hvordan man kan få modeller til at skelne mellem viden og ren gætværk. For almindelige brugere betyder det, at vi skal blive ved med at være kritiske over for AI-svar.
- Forskningen er offentliggjort på arXiv under titlen 'On the Generalization of Steering Vectors for Chain-of-Thought Faithfulness'.
- Forskerholdet er ledet af Matthew Nguyen og tre kolleger fra arXiv-miljøet.
- Styringsvektorer er en teknik til at påvirke AI-modellers interne tankeproces.
- Metoden skal få AI-modeller til at følge deres egne logiske overvejelser.
- Tests viser, at vektorerne ikke altid virker på tværs af opgavetyper.
- Forskerne anbefaler at kombinere metoden med andre teknikker for bedre effekt.
Du kan ikke regne med, at AI fremover er helt ærlig – teknikken er endnu ikke moden. Forvent stadig fejl og vær kritisk, når du bruger AI til rådgivning.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder