Gemini 3.8 Live tænker, mens den taler

To nye talemodeller fra Google kan skifte sprog midt i samtalen og udføre opgaver i baggrunden. Extended Thinking ræsonnerer, mens den taler.
Tænker og taler samtidig
Google har lanceret Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking, som selskabet selv kalder sine mest avancerede modeller til levende dialog. Den centrale nyhed er, at Extended Thinking ræsonnerer og taler på samme tid.
Mens den arbejder, kvitterer den med små verbale vink som «Let me check that…», og den fortæller løbende, hvor langt den er i en opgave med flere trin. Samtalen bryder altså ikke sammen, selv når modellen løser noget komplekst i baggrunden.
- Speech to Speech Quality Index fra Artificial Analysis — førstepladsen til Gemini 3.8 Live Extended Thinking
- 82,6 point
- τ-Voice, benchmark for agentisk opgaveløsning via tale
- 68,6 %
- Sierra's τ-Voice-banking, opgaveløsning i et bankdomæne
- 35,1 %
97 sprog midt i samtalen
Gemini 3.8 Live læser visuelle input i næsten realtid, så samtalen kan trække på det, modellen ser. Den skifter automatisk mellem 97 understøttede sprog midt i en samtale.
Den kalder også værktøjer og API'er i baggrunden, mens den fortsætter med at tale. Ifølge Google kan den derfor kvittere for en opgave og blive ved med at snakke, indtil arbejdet er færdigt.
Førsteplads i talebenchmarks
På Artificial Analysis' Speech to Speech Quality Index tager Gemini 3.8 Live Extended Thinking førstepladsen med 82,6 point. Den scorer 68,6 procent på τ-Voice og 35,1 procent på Sierra's τ-Voice-banking benchmark, der måler, hvor godt en stemmeagent fuldfører opgaver. På Big Bench Audio lyder resultatet 97,7 procent.
Gemini 3.8 Live ligger nummer to i Speech Agent Arena. Google fremhæver også prisen som konkurrencedygtig, men oplyser ikke beløb.
Vandmærke i al lyden
Al lyd, som Googles AI-produkter genererer, får et SynthID-vandmærke. Det ligger umærkeligt for øret direkte i lyden, så AI-genereret indhold kan opdages og mindske risikoen for misinformation.
Modellerne er tilgængelige via Gemini API, Google Workspace og Gemini-appen. I Workspace kan man prøve Gemini 3.8 Live Extended Thinking i Docs Live, Gmail Live og Keep Live.
Flere detaljer
- Modellerne er også rullet ud til Search, oplyser Google.
- Google nævner ServiceNow's EVA-Bench og hævder, at modellerne flytter den såkaldte Pareto-front.
- Udviklingsplatforme som LiveKit, Pipecat, Vercel og LangChain bygger videre på Gemini Live API.
- Kilden er underskrevet af Gemini Audio Team, ikke Google DeepMind.
Kilder:
Google DeepMind → Google Gemini →
Genfortalt i egne ord af AI-nyheder.com · AI-genereret illustration · Tjek altid originalkilden, før du handler på vigtige oplysninger.