Slik snakker du med AI: Stemmemodus og talende KI-assistenter forklart
Sist faktasjekket:

Kort oppsummert
Med stemmemodus i ChatGPT eller Gemini snakker du med KI-en som med et menneske, og du kan avbryte den midt i en setning. Hos OpenAI heter funksjonen i dag ChatGPT Voice, drevet av modellen GPT-Live, som fra juli 2026 erstattet den eldre, mer trege Advanced Voice Mode. Hos Google heter den Gemini Live. En klassisk taleassistent som Siri leste opp ferdige svar fra et enklere system, men i stemmemodus snakker du med selve språkmodellen.
Hva skiller ny stemmemodus fra en klassisk taleassistent?
Klassiske taleassistenter har eksistert siden Siri kom i 2011, og de jobber i tre trinn. Først blir talen gjort om til tekst. Deretter tolker et regelbasert eller enkelt system teksten for å finne riktig kommando, og til slutt hentes svaret fra en ferdig database eller et enkelt søk. Det fungerer greit for enkle kommandoer som “sett en alarm klokken sju”. Men når du vil ha en åpen samtale der assistenten må resonnere, kommer den raskt til kort.
Den nye stemmemodusen fungerer helt annerledes:
- Full-dupleks lyd. Modellen lytter og “tenker” mens den snakker, og venter ikke til du er helt ferdig før den begynner å behandle det du sier. Derfor merker den når du avbryter, og kan reagere med en gang i stedet for å fullføre et svar den allerede har planlagt. Det viser en teknisk gjennomgang fra MindStudio.
- Direkte tale-til-tale-behandling. Nyere systemer blir i økende grad bygget for å forstå og lage lyd mer direkte, uten å gjøre alt om til tekst underveis. Da tar de bedre vare på nyanser som tonefall og pauser enn når alt går omveien via tekst.
- Samme resonnerende språkmodell som chatteksten din. Når du snakker med ChatGPT i stemmemodus, er det i praksis den samme modellen som svarer på skriftlige spørsmål. Forskjellen er bare at det er lagt til et lag for lyd i begge ender. Derfor kan den resonnere, huske hva dere har snakket om og svare på kompliserte spørsmål like godt som i tekst. Den er altså ikke begrenset til enkle kommandoer.
Google Gemini Live bygger på den samme grunnideen. I tillegg kan den “se” gjennom kameraet på telefonen eller via skjermdeling mens du snakker, og reagere på det den ser. Det skriver Google selv på produktsiden sin.
| Klassisk taleassistent (Siri, eldre Google Assistant) | Ny stemmemodus (ChatGPT, Gemini Live) | |
|---|---|---|
| Hvordan den lytter | Venter til du er ferdig, deretter behandling | Full-dupleks: lytter og “tenker” samtidig |
| Hva som svarer | Regelbasert system, forhåndsdefinert database | Samme resonnerende språkmodell som chatteksten |
| Kan du avbryte den? | Nei, må fullføre kommandoen | Ja, den stopper og svarer på det du nettopp sa |
Hva kan du faktisk bruke det til?
- Læring og øving. Flere har testet stemmemodus til å lære språk. Da kan du ha en ekte muntlig samtale og få rettet uttale og grammatikk mens du snakker, i stedet for å skrive frem og tilbake.
- Hands-free bruk. Fordi du ikke trenger å skrive, fungerer stemmemodus godt når hendene dine er opptatt, for eksempel i bilen, på kjøkkenet eller under trening.
- Vise frem noe og spørre om det samtidig. Når verktøyet støtter kamera og skjermdeling, kan du peke på en gjenstand eller en skjerm og spørre om det du ser mens du snakker. Da slipper du å beskrive det med ord først.
- Oversettelse i sanntid. Flere av verktøyene kan nå oversette en samtale fortløpende mens den pågår, og ikke bare enkeltsetninger etter at de er sagt ferdig.
Husk likevel at stemmemodus fortsatt er en samtale med en språkmodell, og at de samme begrensningene gjelder som i tekst. Den kan ta feil eller “finne på” ting den ikke er sikker på. Forskjellen er at feilene kommer muntlig i stedet for skriftlig, og for noen kan de da virke mer overbevisende enn de er. Artikkelen vår om hallusinasjoner, som er lenket nederst, forklarer mer om dette.
Hvorfor skjer dette skiftet akkurat nå?

Tre tekniske fremskritt har kommet på samme tid, og sammen gjør de naturlige stemmesamtaler med KI mulig i stor skala:
- Latency (forsinkelse) er kraftig redusert. For at en samtale skal føles naturlig, må svaret komme så raskt at det ikke oppstår keitete pauser. Tidligere systemer brukte ofte merkbar tid fra du sluttet å snakke til svaret kom, og derfor føltes samtalen stiv.
- Modellene håndterer avbrudd bedre. Nå kan modellen bli avbrutt og skifte spor midt i en setning uten å måtte starte svaret helt på nytt. Det er en stor teknisk forbedring sammenlignet med tidligere talegrensesnitt.
- Kostnaden ved å kjøre disse modellene har falt. Det krever langt mer regnekraft å behandle lyd mens samtalen pågår enn å behandle tekst. Derfor måtte KI-infrastrukturen bli billigere og mer effektiv før selskapene kunne tilby dette til vanlige brukere uten enorme kostnader per samtale.
Vanlige spørsmål
Er stemmemodus det samme som Siri eller Google Assistant?
Nei. Siri og den klassiske Google Assistant er bygget enklere. De sammenligner i hovedsak det du sier med en liste over faste kommandoer, og henter svaret fra en avgrenset database. I stemmemodus i ChatGPT og Gemini Live snakker du i stedet direkte med en fullverdig språkmodell som kan resonnere, altså den samme typen modell som svarer på skriftlige spørsmål.
Koster det noe å bruke stemmemodus?
Det varierer mellom leverandørene og endrer seg ofte, så AIFokus oppgir ikke faste priser her. Sjekk alltid leverandørens egen side for vilkårene som gjelder nå, før du regner med at en bestemt funksjon finnes i gratisversjonen eller i et abonnement.
Kan en KI i stemmemodus fortsatt ta feil?
Ja. Selv om svaret kommer muntlig, kan modellen fortsatt svare feil, og den kan høres selvsikker ut også når den er usikker. Du kan lese mer om dette i AIFokus sin artikkel om hvorfor KI “lyver”.
Oppsummering og kilder
Det viktigste å huske:
- Ny stemmemodus snakker direkte med samme underliggende språkmodell som chatteksten, ikke et enklere kommandosystem
- Full-dupleks lyd gjør at den kan avbrytes og svare på det du nettopp sa, i stedet for å fullføre et planlagt svar
- Dette skiller den grunnleggende fra klassiske taleassistenter som Siri og den eldre Google Assistant
- Nyere versjoner støtter kamera og skjermdeling samtidig med samtalen
- Feilkildene er de samme som i tekst, bare formidlet muntlig, noe som kan gjøre dem virke mer overbevisende
Kilder brukt i denne artikkelen:
- OpenAI Help Center: ChatGPT Voice
- OpenAI: Introducing GPT-Live
- Google: Gemini Live
- MindStudio: GPT Live Voice Mode, real-time translation and natural conversation explained
Sist oppdatert: August 2026
Se også: Hvorfor “lyver” KI noen ganger? Hallusinasjoner forklart enkelt for hva som skjer når svaret, muntlig eller skriftlig, rett og slett er feil, og Hva er en AI-companion, og hvorfor blir de så populære? for produkter som bygger videre på nettopp stemme og vedvarende samtale.
Les også

AI-agenter som jobber for deg mens du sover: Hva er faktisk mulig for en liten bedrift i dag?
Ideen om at AI kan jobbe for bedriften mens du sover høres ut som markedsføring. Noe av det er det også. Men noe av det er faktisk mulig i dag, for en liten bedrift, uten et eget teknisk team. Her er hva som faktisk skjer om natten, og hva som fortsatt bare er en visjon.

Claude Code for ikke-utviklere: Hva kan en bedriftseier faktisk bruke det til?
Claude Code ble laget for utviklere, i en terminal fylt med kommandoer. Men ideen bak, en KI som faktisk gjør en oppgave i stedet for bare å beskrive den, er nå på vei ut av utviklerverktøyet og inn i verktøy vanlige bedriftseiere kan bruke. Her er hva det faktisk kan hjelpe deg med.

Hva er en AI-arbeidsflyt, og hvordan begynner du i det små?
Ordet "AI-arbeidsflyt" dukker stadig oftere opp, uten at noen tar seg tid til å forklare hva det egentlig betyr. Her er begrepet forklart fra bunnen av og et konkret, lite eksempel du kan sette opp selv på under en time.