Grok Voice Transcribe 2.0 er dobbelt så præcis

Fejlraten på korte stemmeklip falder fra 20,6 til 6,8 procent, og priserne er uændrede: 0,10 dollar i timen for batch.
Dobbelt så præcis som forgængeren
Grok Voice Transcribe 2.0 omsætter talt sprog til skrift og er ifølge annonceringen dobbelt så præcis som forgængeren Grok Voice Transcribe 1.0 – til samme pris.
På den offentlige leaderboard fra Artificial Analysis ligger modellen nummer et for præcision blandt 32 streaming-modeller. Streaming betyder, at teksten kommer løbende, mens lyden afspilles, i stedet for at hele optagelsen først skal behandles færdig.
Modellen bygger på det lyd-fundament, der også bærer Grok Voice. Ifølge annonceringen driver Grok Voice titusinder af kundesupportopkald om dagen og bruges til stemmeagenter i fysiske produkter, blandt andet Grok-assistenten i Tesla-biler.
- Ord-fejlrate på udviklerens eget datasæt med korte flersprogede stemmeklip, 1.0 mod 2.0
- 20,6 % → 6,8 %
- Præcision blandt streamingmodeller på Artificial Analysis' offentlige leaderboard
- 1. plads af 32
- Batch-transskription; streaming koster 0,20 dollar pr. time – samme priser som version 1.0
- 0,10 dollar pr. time
Støjende optagelser er det svære
De fleste modeller klarer sig godt på ren lyd med én taler. Virkeligheden er sværere: dårlige telefonlinjer, stemmer der taler i munden på hinanden, lokale accenter og telefonnumre eller mailadresser, der læses højt.
Grok Voice Transcribe 2.0 er trænet på et datasæt af live, støjende og flersproget lyd fra mange forskellige omgivelser og efterfølgende finpudset.
Udvikleren har målt ordfejlraten på fire interne datasæt fra produktionstrafik: telefonlyd fra kundesupport, samtaler med Grok, oplæste kontokoder og mailadresser samt korte flersprogede stemmekommandoer. Modellen forbedrer sig på alle fire og ligger foran alle testede modeller på telefonlyd.
Fejlraten falder til 6,8 procent
Den største forbedring er flersprogethed. Modellen dækker snesevis af sprog, finder selv sproget og følger skift midt i en optagelse i én gennemkørsel.
Korte sætninger er svære, fordi der er lidt kontekst at genkende sproget ud fra. På det korte datasæt falder ordfejlraten fra 20,6 procent til 6,8 procent.
Samme pris – og snart standard
Eksisterende integrationer af Speech-to-Text-API'et får den bedre præcision uden kodeændringer. Prisen er uændret: 0,10 dollar pr. time lyd i batch og 0,20 dollar pr. time ved streaming. Diarisering, der viser hvem der siger hvad, tidsstempler og nøgleord er inkluderet.
Grok Voice Transcribe 2.0 bliver snart standard i API'et, og Grok Voice Transcribe 1.0 udfases i løbet af de kommende uger. Vil man blive på den gamle version i overgangen, skal man låse grok-voice-transcribe-1.0.
Flere detaljer
- Atlassian fandt modellen mere præcis end sin nuværende løsning til at transskribere Loom-videoer.
- Transskription af en handlingsplan kan sendes videre til Cursor, som laver kodeændringerne.
- Modellen blev annonceret 18. september 2026.
Kilder:
xAI News →
Genfortalt i egne ord af AI-nyheder.com · AI-genereret illustration · Tjek altid originalkilden, før du handler på vigtige oplysninger.