Spring til artiklen
nyhederModellanceringer
← Tilbage til nyhederne
Lanceringer · xAI News · 18.09.2026 · 2 min. læsning

Grok Voice Transcribe 2.0 er dobbelt så præcis

A chunky opaque microphone block faces forward, its flat front bearing the Grok product mark. Three bold waveform bars leave its grille and arrive on a thick rounded card as neat,

Fejlraten på korte stemmeklip falder fra 20,6 til 6,8 procent, og priserne er uændrede: 0,10 dollar i timen for batch.

Dobbelt så præcis som forgængeren

Grok Voice Transcribe 2.0 omsætter talt sprog til skrift og er ifølge annonceringen dobbelt så præcis som forgængeren Grok Voice Transcribe 1.0 – til samme pris.

På den offentlige leaderboard fra Artificial Analysis ligger modellen nummer et for præcision blandt 32 streaming-modeller. Streaming betyder, at teksten kommer løbende, mens lyden afspilles, i stedet for at hele optagelsen først skal behandles færdig.

Modellen bygger på det lyd-fundament, der også bærer Grok Voice. Ifølge annonceringen driver Grok Voice titusinder af kundesupportopkald om dagen og bruges til stemmeagenter i fysiske produkter, blandt andet Grok-assistenten i Tesla-biler.

Ord-fejlrate på udviklerens eget datasæt med korte flersprogede stemmeklip, 1.0 mod 2.0
20,6 % → 6,8 %
Præcision blandt streamingmodeller på Artificial Analysis' offentlige leaderboard
1. plads af 32
Batch-transskription; streaming koster 0,20 dollar pr. time – samme priser som version 1.0
0,10 dollar pr. time

Støjende optagelser er det svære

De fleste modeller klarer sig godt på ren lyd med én taler. Virkeligheden er sværere: dårlige telefonlinjer, stemmer der taler i munden på hinanden, lokale accenter og telefonnumre eller mailadresser, der læses højt.

Grok Voice Transcribe 2.0 er trænet på et datasæt af live, støjende og flersproget lyd fra mange forskellige omgivelser og efterfølgende finpudset.

Udvikleren har målt ordfejlraten på fire interne datasæt fra produktionstrafik: telefonlyd fra kundesupport, samtaler med Grok, oplæste kontokoder og mailadresser samt korte flersprogede stemmekommandoer. Modellen forbedrer sig på alle fire og ligger foran alle testede modeller på telefonlyd.

Fejlraten falder til 6,8 procent

Den største forbedring er flersprogethed. Modellen dækker snesevis af sprog, finder selv sproget og følger skift midt i en optagelse i én gennemkørsel.

Korte sætninger er svære, fordi der er lidt kontekst at genkende sproget ud fra. På det korte datasæt falder ordfejlraten fra 20,6 procent til 6,8 procent.

Samme pris – og snart standard

Eksisterende integrationer af Speech-to-Text-API'et får den bedre præcision uden kodeændringer. Prisen er uændret: 0,10 dollar pr. time lyd i batch og 0,20 dollar pr. time ved streaming. Diarisering, der viser hvem der siger hvad, tidsstempler og nøgleord er inkluderet.

Grok Voice Transcribe 2.0 bliver snart standard i API'et, og Grok Voice Transcribe 1.0 udfases i løbet af de kommende uger. Vil man blive på den gamle version i overgangen, skal man låse grok-voice-transcribe-1.0.

Flere detaljer
Derfor er det interessantNår Grok Voice Transcribe 1.0 udfases, skal eksisterende integrationer enten følge med over til 2.0 eller låse den gamle version for at undgå ændringer.

Kilder:
xAI News →

Læs dagens AI-nyheder på letlæst dansk →

Genfortalt i egne ord af AI-nyheder.com · AI-genereret illustration · Tjek altid originalkilden, før du handler på vigtige oplysninger.