DistilBERT fanger had på roman-urdu
Den lille AI-model DistilBERT opdager hadetale på roman-urdu lige så godt som BERT – og meget billigere.
Det nye fund
Forskere har testet, hvordan forskellige AI-modeller klarer at finde hadefulde beskeder på roman-urdu – et sprog skrevet med latinske bogstaver, som millioner bruger på sociale medier. Overraskelsen: En lille og hurtig model kan matche de helt store, når den bliver finjusteret rigtigt. Det gør det muligt at overvåge had på sprog, som ellers bliver overset.
Hvordan de gjorde
Holdet sammenlignede modeller som BERT og GPT med en kompakt model kaldet DistilBERT på en database med tusindvis af roman-urdu-beskeder. Den lille model opnåede samme præcision som de store, men med langt færre beregninger – et stort plus, når man skal køre overvågning i stor stil. Forskerne lagde også vægt på at undgå bias mod bestemte ord eller grupper.
Hvad det betyder
For dig, der færdes på sociale medier, kan det betyde hurtigere opdagelse af had og chikane på sprog, som platformene hidtil har overset. Roman-urdu tales især i Pakistan og Indien, men samme metode kan bruges på andre undertjente sprog. Det kan presse tech-giganterne til at tage ansvar – også uden for engelsk.
- Roman-urdu er urdu skrevet med latinske bogstaver – udbredt på nettet.
- DistilBERT, en lille AI, klarede sig lige så godt som store modeller som BERT.
- De små modeller kræver mindre regnekraft og er billigere i drift.
- Forskerne testede på et datasæt med tusindvis af kommentarer.
- Metoden kan overføres til andre sprog med få ressourcer.
- Undersøgelsen vil gøre hadedetektering mere retfærdig på tværs af sprog.
Du får mere trygge onlinefællesskaber, fordi AI nu kan opdage had på sprog som roman-urdu uden at kræve kæmpe serverparker – hurtigt og billigt.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder