AI-verktøy og guider

Slik snakker du med AI: Stemmemodus og talende KI-assistenter forklart

O
Ole Gunnar Hellenes··8 min lesing

Sist faktasjekket:

En flytende bølgeform viser full-dupleks lyd i stemmemodus, mens en stanset linje viser den gamle taleassistenten

TL;DR (Kort oppsummert)

I dag kan du åpne ChatGPT eller Gemini, trykke på et mikrofonikon og ha en flytende, muntlig samtale med en KI-modell akkurat som med et menneske. Du kan til og med avbryte den midt i en setning, og den stopper og svarer på det du nettopp sa. Dette kalles gjerne Advanced Voice Mode hos OpenAI og Gemini Live hos Google. Det er noe helt annet enn en klassisk taleassistent som Siri eller den eldre Google Assistant, som i hovedsak omsatte talen din til tekst, sendte teksten til et enklere system og leste opp et forhåndsformulert svar. Denne artikkelen forklarer forskjellen og hva som faktisk skjer teknisk når du snakker direkte med en språkmodell.

 


 

Hva skiller ny stemmemodus fra en klassisk taleassistent?

Klassiske taleassistenter har eksistert siden Siri kom i 2011. De bygger på en tretrinnsprosess: tale gjøres om til tekst, teksten tolkes av et regelbasert eller enkelt system for å finne riktig kommando, og svaret hentes fra en forhåndsdefinert database eller et enkelt søk. Det fungerer greit for avgrensede kommandoer (“sett en alarm klokken sju”). Det blir derimot raskt utilstrekkelig for åpne, resonnerende samtaler.

Den nye generasjonen stemmemodus fungerer annerledes på et grunnleggende nivå:

  • Full-dupleks lyd. Modellen lytter og “tenker” samtidig som den snakker, i stedet for å vente til du er helt ferdig før den begynner å behandle input. Det gjør at den kan oppfatte at du avbryter. Den kan reagere umiddelbart i stedet for å fullføre et forhåndsplanlagt svar, ifølge en teknisk gjennomgang fra MindStudio.
  • Direkte tale-til-tale-behandling. Nyere systemer er i økende grad bygget for å forstå og generere lyd mer direkte, i stedet for kun å gå via en mellomliggende tekstoversettelse hele veien. Det bevarer nyanser som tonefall og pauser bedre enn en ren tekst-til-tale-omvei.
  • Samme resonnerende språkmodell som chatteksten din. Når du snakker med ChatGPT i stemmemodus, er det i praksis den samme underliggende modellen som svarer på skriftlige spørsmål, bare med et lag for lyd lagt til i begge ender. Det betyr at den kan resonnere, huske kontekst i samtalen og svare på kompliserte spørsmål på samme måte som i tekst. Den er altså ikke begrenset til enkle kommandoer.

Google Gemini Live bygger på samme grunnidé. Den er i tillegg bygd for å kunne “se” gjennom telefonens kamera eller skjermdeling samtidig som du snakker og reagere på det den ser, ifølge Googles egen produktside.

Klassisk taleassistent (Siri, eldre Google Assistant) Ny stemmemodus (ChatGPT, Gemini Live)
Hvordan den lytter Venter til du er ferdig, deretter behandling Full-dupleks: lytter og “tenker” samtidig
Hva som svarer Regelbasert system, forhåndsdefinert database Samme resonnerende språkmodell som chatteksten
Kan du avbryte den? Nei, må fullføre kommandoen Ja, den stopper og svarer på det du nettopp sa

 


 

Hva kan du faktisk bruke det til?

  • Læring og øving. Flere har testet stemmemodus til språklæring, siden du kan ha en fullverdig, muntlig samtale og få rettet uttale og grammatikk i sanntid, i stedet for å skrive frem og tilbake.
  • Hands-free bruk. Fordi du ikke trenger å skrive, fungerer stemmemodus godt når hendene dine er opptatt, for eksempel i bilen, på kjøkkenet eller under trening.
  • Vise frem noe og spørre om det samtidig. Med kamera- og skjermdelingsstøtte kan du peke på et objekt eller en skjerm og stille spørsmål om det du ser, mens du snakker, uten å måtte beskrive det med ord først.
  • Oversettelse i sanntid. Flere av verktøyene støtter nå å oversette en samtale fortløpende mens den pågår, ikke bare enkeltsetninger etter at de er sagt ferdig.

Det er verdt å presisere at stemmemodus fortsatt er en samtale med en språkmodell, med de samme grunnleggende begrensningene som gjelder i tekst: den kan fortsatt ta feil eller “finne på” ting den ikke er sikker på (se AIFokus sin egen artikkel om hallusinasjoner under), bare formidlet muntlig i stedet for skriftlig, noe som for enkelte kan gjøre feilene virke mer overbevisende enn de er.

 


 

Hvorfor skjer dette skiftet akkurat nå?

Tre ikonmerker med klokke, bølgelinje og fallende pil viser hvorfor stemmemodus ble mulig akkurat nå

Tre tekniske utviklinger har kommet sammen samtidig og gjort naturlig stemmesamtale med en KI praktisk mulig i stor skala:

  1. Latency (forsinkelse) er kraftig redusert. For at en samtale skal føles naturlig, må svartiden være kort nok til at det ikke oppstår klumsete pauser. Tidligere systemer hadde ofte merkbar forsinkelse mellom at du sluttet å snakke og svaret kom, noe som gjorde at samtalen føltes stiv.
  2. Modellene håndterer avbrudd bedre. Evnen til å bli avbrutt og skifte spor midt i en setning, uten å måtte starte responsen på nytt fra bunnen, er en vesentlig teknisk forbedring fra tidligere talegrensesnitt.
  3. Kostnaden ved å kjøre disse modellene har falt. Å behandle lyd i sanntid er langt mer regnekrevende enn å behandle tekst. Rimeligere og mer effektiv KI-infrastruktur er en direkte forutsetning for at selskapene kan tilby dette til vanlige brukere uten enorme kostnader per samtale.

 


 

Vanlige spørsmål

Er stemmemodus det samme som Siri eller Google Assistant?

Nei. Siri og den klassiske Google Assistant bygger på en enklere arkitektur som i hovedsak matcher talen din mot forhåndsdefinerte kommandoer og henter svar fra en avgrenset database. Stemmemodus i ChatGPT og Gemini Live snakker i stedet direkte med en fullverdig, resonnerende språkmodell, den samme typen modell som svarer på skriftlige spørsmål.

Koster det noe å bruke stemmemodus?

Det varierer mellom leverandørene og endrer seg ofte, så AIFokus oppgir ikke faste priser her. Sjekk alltid leverandørens egen side for gjeldende vilkår før du forventer en bestemt funksjon i en gratis- eller abonnementsversjon.

Kan en KI i stemmemodus fortsatt ta feil?

Ja. Den muntlige formen endrer ikke det grunnleggende: modellen kan fortsatt svare feil eller usikkert på en selvsikker måte. Se AIFokus sin egen artikkel om hvorfor KI “lyver” for mer om dette fenomenet.

 


 

Oppsummering og kilder

Ny stemmemodus i verktøy som ChatGPT og Gemini Live lar deg ha en flytende, avbrytbar samtale direkte med en resonnerende språkmodell, ikke bare et system som matcher talekommandoer mot en database, slik klassiske taleassistenter som Siri gjør. Skiftet er mulig fordi forsinkelsen er kraftig redusert, modellene håndterer avbrudd naturlig, og regnekraften som trengs for å behandle lyd i sanntid er blitt billigere.

Det viktigste å huske:

  • Ny stemmemodus snakker direkte med samme underliggende språkmodell som chatteksten, ikke et enklere kommandosystem
  • Full-dupleks lyd gjør at den kan avbrytes og svare på det du nettopp sa, i stedet for å fullføre et planlagt svar
  • Dette skiller den grunnleggende fra klassiske taleassistenter som Siri og den eldre Google Assistant
  • Nyere versjoner støtter kamera og skjermdeling samtidig med samtalen
  • Feilkildene er de samme som i tekst, bare formidlet muntlig, noe som kan gjøre dem virke mer overbevisende

Kilder brukt i denne artikkelen:

Sist oppdatert: August 2026

Se også: Hvorfor “lyver” KI noen ganger? Hallusinasjoner forklart enkelt for hva som skjer når svaret, muntlig eller skriftlig, rett og slett er feil, og Hva er en AI-companion, og hvorfor blir de så populære? for produkter som bygger videre på nettopp stemme og vedvarende samtale.

Les også

#ai-verktoy#stemmemodus#taleassistent