AI-verktøy og guider

Slik snakker du med AI: Stemmemodus og talende KI-assistenter forklart

O
Ole Gunnar Hellenes··8 min lesing

Sist faktasjekket:

En flytende bølgeform viser full-dupleks lyd i stemmemodus, mens en stanset linje viser den gamle taleassistenten

Kort oppsummert

Med stemmemodus i ChatGPT eller Gemini snakker du med KI-en som med et menneske, og du kan avbryte den midt i en setning. Hos OpenAI heter funksjonen i dag ChatGPT Voice, drevet av modellen GPT-Live, som fra juli 2026 erstattet den eldre, mer trege Advanced Voice Mode. Hos Google heter den Gemini Live. En klassisk taleassistent som Siri leste opp ferdige svar fra et enklere system, men i stemmemodus snakker du med selve språkmodellen.


Hva skiller ny stemmemodus fra en klassisk taleassistent?

Klassiske taleassistenter har eksistert siden Siri kom i 2011, og de jobber i tre trinn. Først blir talen gjort om til tekst. Deretter tolker et regelbasert eller enkelt system teksten for å finne riktig kommando, og til slutt hentes svaret fra en ferdig database eller et enkelt søk. Det fungerer greit for enkle kommandoer som “sett en alarm klokken sju”. Men når du vil ha en åpen samtale der assistenten må resonnere, kommer den raskt til kort.

Den nye stemmemodusen fungerer helt annerledes:

  • Full-dupleks lyd. Modellen lytter og “tenker” mens den snakker, og venter ikke til du er helt ferdig før den begynner å behandle det du sier. Derfor merker den når du avbryter, og kan reagere med en gang i stedet for å fullføre et svar den allerede har planlagt. Det viser en teknisk gjennomgang fra MindStudio.
  • Direkte tale-til-tale-behandling. Nyere systemer blir i økende grad bygget for å forstå og lage lyd mer direkte, uten å gjøre alt om til tekst underveis. Da tar de bedre vare på nyanser som tonefall og pauser enn når alt går omveien via tekst.
  • Samme resonnerende språkmodell som chatteksten din. Når du snakker med ChatGPT i stemmemodus, er det i praksis den samme modellen som svarer på skriftlige spørsmål. Forskjellen er bare at det er lagt til et lag for lyd i begge ender. Derfor kan den resonnere, huske hva dere har snakket om og svare på kompliserte spørsmål like godt som i tekst. Den er altså ikke begrenset til enkle kommandoer.

Google Gemini Live bygger på den samme grunnideen. I tillegg kan den “se” gjennom kameraet på telefonen eller via skjermdeling mens du snakker, og reagere på det den ser. Det skriver Google selv på produktsiden sin.

Klassisk taleassistent (Siri, eldre Google Assistant) Ny stemmemodus (ChatGPT, Gemini Live)
Hvordan den lytter Venter til du er ferdig, deretter behandling Full-dupleks: lytter og “tenker” samtidig
Hva som svarer Regelbasert system, forhåndsdefinert database Samme resonnerende språkmodell som chatteksten
Kan du avbryte den? Nei, må fullføre kommandoen Ja, den stopper og svarer på det du nettopp sa

Hva kan du faktisk bruke det til?

  • Læring og øving. Flere har testet stemmemodus til å lære språk. Da kan du ha en ekte muntlig samtale og få rettet uttale og grammatikk mens du snakker, i stedet for å skrive frem og tilbake.
  • Hands-free bruk. Fordi du ikke trenger å skrive, fungerer stemmemodus godt når hendene dine er opptatt, for eksempel i bilen, på kjøkkenet eller under trening.
  • Vise frem noe og spørre om det samtidig. Når verktøyet støtter kamera og skjermdeling, kan du peke på en gjenstand eller en skjerm og spørre om det du ser mens du snakker. Da slipper du å beskrive det med ord først.
  • Oversettelse i sanntid. Flere av verktøyene kan nå oversette en samtale fortløpende mens den pågår, og ikke bare enkeltsetninger etter at de er sagt ferdig.

Husk likevel at stemmemodus fortsatt er en samtale med en språkmodell, og at de samme begrensningene gjelder som i tekst. Den kan ta feil eller “finne på” ting den ikke er sikker på. Forskjellen er at feilene kommer muntlig i stedet for skriftlig, og for noen kan de da virke mer overbevisende enn de er. Artikkelen vår om hallusinasjoner, som er lenket nederst, forklarer mer om dette.


Hvorfor skjer dette skiftet akkurat nå?

Tre ikonmerker med klokke, bølgelinje og fallende pil viser hvorfor stemmemodus ble mulig akkurat nå

Tre tekniske fremskritt har kommet på samme tid, og sammen gjør de naturlige stemmesamtaler med KI mulig i stor skala:

  1. Latency (forsinkelse) er kraftig redusert. For at en samtale skal føles naturlig, må svaret komme så raskt at det ikke oppstår keitete pauser. Tidligere systemer brukte ofte merkbar tid fra du sluttet å snakke til svaret kom, og derfor føltes samtalen stiv.
  2. Modellene håndterer avbrudd bedre. Nå kan modellen bli avbrutt og skifte spor midt i en setning uten å måtte starte svaret helt på nytt. Det er en stor teknisk forbedring sammenlignet med tidligere talegrensesnitt.
  3. Kostnaden ved å kjøre disse modellene har falt. Det krever langt mer regnekraft å behandle lyd mens samtalen pågår enn å behandle tekst. Derfor måtte KI-infrastrukturen bli billigere og mer effektiv før selskapene kunne tilby dette til vanlige brukere uten enorme kostnader per samtale.

Vanlige spørsmål

Er stemmemodus det samme som Siri eller Google Assistant?

Nei. Siri og den klassiske Google Assistant er bygget enklere. De sammenligner i hovedsak det du sier med en liste over faste kommandoer, og henter svaret fra en avgrenset database. I stemmemodus i ChatGPT og Gemini Live snakker du i stedet direkte med en fullverdig språkmodell som kan resonnere, altså den samme typen modell som svarer på skriftlige spørsmål.

Koster det noe å bruke stemmemodus?

Det varierer mellom leverandørene og endrer seg ofte, så AIFokus oppgir ikke faste priser her. Sjekk alltid leverandørens egen side for vilkårene som gjelder nå, før du regner med at en bestemt funksjon finnes i gratisversjonen eller i et abonnement.

Kan en KI i stemmemodus fortsatt ta feil?

Ja. Selv om svaret kommer muntlig, kan modellen fortsatt svare feil, og den kan høres selvsikker ut også når den er usikker. Du kan lese mer om dette i AIFokus sin artikkel om hvorfor KI “lyver”.


Oppsummering og kilder

Det viktigste å huske:

  • Ny stemmemodus snakker direkte med samme underliggende språkmodell som chatteksten, ikke et enklere kommandosystem
  • Full-dupleks lyd gjør at den kan avbrytes og svare på det du nettopp sa, i stedet for å fullføre et planlagt svar
  • Dette skiller den grunnleggende fra klassiske taleassistenter som Siri og den eldre Google Assistant
  • Nyere versjoner støtter kamera og skjermdeling samtidig med samtalen
  • Feilkildene er de samme som i tekst, bare formidlet muntlig, noe som kan gjøre dem virke mer overbevisende

Kilder brukt i denne artikkelen:

Sist oppdatert: August 2026

Se også: Hvorfor “lyver” KI noen ganger? Hallusinasjoner forklart enkelt for hva som skjer når svaret, muntlig eller skriftlig, rett og slett er feil, og Hva er en AI-companion, og hvorfor blir de så populære? for produkter som bygger videre på nettopp stemme og vedvarende samtale.

Les også

#ai-verktoy#stemmemodus#taleassistent