PD-GS får talehoveder til at ligne os
Forskerne Ao Fu og Yi Zhou har udviklet PD-GS, der bruger fonemer til at styre mundbevægelser i digitale ansigter. Teknologien kan bruges i film og spil.
Det er nyt
Et forskerpar har udviklet en metode kaldet PD-GS, der bruger lyd til at styre et digitalt ansigt. Tidligere AI-modeller kunne få munden til at bevæge sig, men ofte så det stift eller unaturligt ud. Den nye teknik fokuserer på de mindste lydenheder i tale – fonemer – og oversætter dem direkte til præcise mundformer.
Sådan virker det
Metoden bygger på en teknologi kaldet 3D Gaussian Splatting, der skaber tredimensionelle billeder af ansigtet. Når AI'en hører lyd, vælger den de rigtige mundbevægelser ud fra de enkelte lyde. Det giver en synkronisering mellem tale og ansigt, som ligner virkeligheden meget tættere end tidligere.
Hvad kan det bruges til
Teknologien kan blandt andet bruges i film, spil og virtuelle assistenter. Forestil dig en AI-nyhedsoplæser eller en digital lærer, der taler til dig med naturlige ansigtsudtryk. Det kan også hjælpe mennesker med at kommunikere via avatarer, hvis de ikke selv kan tale eller bevæge ansigtet.
- Metoden hedder PD-GS og styres af fonemer – de enkelte lyde i tale.
- Teknologien bruger 3D Gaussian Splatting til at skabe ansigtet.
- Forskerne bag hedder Ao Fu og Yi Zhou.
- Resultatet er mere naturlige mundbevægelser end tidligere modeller.
- AI'en oversætter lyd direkte til ansigtsbevægelser i realtid.
Du kan snart opleve mere naturlige digitale ansigter i alt fra film og spil til chatbots – så det ikke længere føles som om, du taler med en robot, når du møder en AI.
Kilder:
arXiv cs.AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder