AI i hverdagen

Kan du stole på ChatGPT som helserådgiver?

O
Ole Gunnar Hellenes··7 min lesing

Sist faktasjekket:

En chatboble med spørsmålstegn og et personikon med hake viser at KI kan spørres, men fagperson bør bekrefte svaret

Kort oppsummert

Bare delvis. ChatGPT og lignende chatboter er nyttige når du vil forstå et fagbegrep eller lese deg opp på en tilstand. Men en studie i Nature Medicine viser at folk som bruker dem til å vurdere egne symptomer, ofte bommer på hvor akutt situasjonen er. Ved reell tvil bør du derfor kontakte fastlegen eller legevakten.


Helseministeren som ville ha deg bort fra ChatGPT

Mange bruker i dag ChatGPT eller lignende chatboter til å tolke symptomer før de eventuelt går til lege. Det er så vanlig at helseminister Jan Christian Vestre i 2026 gikk uvanlig tydelig ut mot det. Han ønsker en egen, kvalitetssikret norsk tjeneste som folk kan bruke i stedet for å google symptomene sine eller spørre ChatGPT, ifølge Dagens Medisin. Han kalte den en “digital førstelinje” med kvalitetssikret innhold, i motsetning til et generelt KI-verktøy uten medisinsk kontroll.

Uttalelsen gjenspeiler en reell og dokumentert bekymring i helsevesenet. Samtidig kommer det bekymring fra motsatt kant, for også legene bruker KI stadig oftere i konsultasjonene sine. Det har Aftenposten omtalt.

KI er ikke ubrukelig for helsespørsmål. Men den har en dokumentert og spesifikk svakhet som du bør kjenne til før du stoler på et symptområd fra en chatbot.


Hva forskningen faktisk viser

To fyllingsmålere viser tydelig kontrast: KI presterer bra på generell faktainformasjon (høy fylling, grønn hake), men svakt og usikkert på å vurdere hvor akutt et symptom er (lav fylling, spørsmålstegn) To fyllingsmålere illustrerer forskjellen: sterkere på generell informasjon, svakere på å vurdere alvorlighetsgrad.

En studie fra Oxford Internet Institute ved University of Oxford testet dette direkte. Den ble publisert i Nature Medicine i februar 2026 og er fagfellevurdert, altså kontrollert og godkjent av andre forskere før publisering. Studien var også forhåndsregistrert. Det betyr at forskerne offentliggjorde spørsmålene og metoden sin før de startet, slik at de ikke kunne plukke ut resultater som passet dem i etterkant.

Forskerne testet hvordan 1 298 vanlige briter presterte når de brukte en av tre språkmodeller til å vurdere ti oppdiktede pasientkasus. Deltakerne var ikke helsepersonell, og modellene var GPT-4o, Llama 3 og Command R+. De som brukte en KI-modell, var signifikant dårligere enn en kontrollgruppe til å finne ut hvilke medisinske tilstander som faktisk var relevante. Kontrollgruppen brukte vanlig nettsøk eller egen kunnskap. At forskjellen er signifikant, betyr at den er så stor at forskerne mener den neppe skyldes tilfeldigheter.

Når det gjaldt riktig neste steg, var det derimot ingen statistisk sikker forskjell mellom KI-brukerne og kontrollgruppen. Neste steg betyr her om de burde dra til akuttmottaket, gå til fastlegen eller vente og se an. Begge gruppene svarte riktig i underkant av halvparten av tilfellene, 43,0 prosent samlet. Konklusjonen var altså nyansert. Med en KI-chatbot ble folk ikke bedre til å vurdere alvorlighetsgrad enn med et vanlig nettsøk, og de ble til dels dårligere til å finne ut hvilken tilstand det var.

En metaanalyse fra 2025 går bredere ut. En metaanalyse samler og sammenligner funn fra mange studier, og denne bygger på 83 av dem. Den ble publisert i npj Digital Medicine og fant at KI-chatbotene samlet traff riktig diagnose i 52,1 prosent av tilfellene, på tvers av ulike medisinske spørsmål. Det er markant lavere enn erfarne leger i samme sammenligning.

Mayo Clinic peker på en konkret årsak som ofte blir oversett. Når folk søker helseinformasjon, gir de ofte ikke chatboten nok detaljer til at den kan gi et presist svar. Selv små forskjeller i hvordan du beskriver et symptom, kan gi et helt annet svar. Problemet ligger altså ikke bare i KI-en, men i samspillet mellom hvordan vi beskriver egne symptomer og hvordan modellen tolker akkurat den beskrivelsen.


Hvor KI faktisk gjør det bra

Bildet er ikke ensidig negativt. I 2023 omtalte det norske fagmediet healthtalk.no en studie der to nederlandske forskere ved Amsterdam UMC testet ChatGPT på kardiologispørsmål. På relativt enkle spørsmål, av typen en pasient stiller fastlegen, svarte chatboten riktig i 90 prosent av tilfellene. På mer kompliserte spørsmål, av typen en fastlege stiller en spesialist, falt andelen til rundt 50 prosent. Det passer med et mønster som går igjen i forskningen. KI gjør det relativt bra på generell informasjon og fakta, som hva et begrep betyr eller hva som er vanlige bivirkninger av en medisin. Derimot er den markant svakere når den skal vurdere DIN spesifikke, akutte situasjon. Merk at dette var en eldre test fra 2023 med en tidligere GPT-4-versjon, og ikke en fersk måling av dagens modeller.

En amerikansk studie fra 2023 fant til og med at ChatGPT traff riktig i 72 prosent av tilfellene i visse avgrensede kliniske beslutningsscenarier. Det er på nivå med en nyutdannet lege, ifølge Dagens Medisin. Nøyaktigheten varierer altså mye med HVA du spør om, ikke bare med hvilken modell du bruker. Begge disse studiene tester dessuten eldre KI-modeller enn dem som er i vanlig bruk i dag. Om nyere modeller er bedre, svarer vi på under Vanlige spørsmål.

Studie Hva ble testet Resultat
Oxford Internet Institute / Nature Medicine (2026) Riktig neste steg (akuttmottak/fastlege/vente) 43,0 prosent, ingen sikker forskjell fra kontrollgruppe
npj Digital Medicine, metaanalyse av 83 studier (2025) Samlet diagnosenøyaktighet hos KI-chatboter 52,1 prosent
Amsterdam UMC (2023) Enkle vs. kompliserte kardiologispørsmål 90 prosent (enkle), 50 prosent (kompliserte)
Amerikansk studie (2023) Avgrensede kliniske beslutningsscenarier 72 prosent, på nivå med en nyutdannet lege

En praktisk tommelfingerregel

En chatboble forgrener seg til to ikonbadger: et dokument med hake for generelle spørsmål og et personikon for kontakt med fagperson ved akutte symptomer Tommelfingerregelen visualisert: generelle spørsmål kan gå til KI, akutte symptomer bør gå til en fagperson.

Ut fra forskningen kan du trekke et ganske tydelig skille. KI er et nyttig oppslagsverktøy for generell informasjon og fakta. Du kan bruke det til å forstå et fagbegrep legen brukte, lese deg opp på en tilstand du allerede har fått diagnosen på, eller forberede spørsmål til et legebesøk.

Derimot bør ikke KI avgjøre akutte beslutninger, som om et symptom er alvorlig nok til at du bør ringe legevakten eller dra til akuttmottaket. Det er nettopp når spørsmålet blir komplisert eller krever å peke på riktig tilstand, at forskningen gjentatte ganger finner de svakeste resultatene for KI, uansett hvilken modell som er testet. Det snevrere spørsmålet handler om riktig hastegrad, altså om du bør til akutten, til fastlegen eller bare vente. Der fant Oxford-studien ingen sikker forskjell mellom KI-brukere og kontrollgruppen. Begge grupper svarte riktig i under halvparten av tilfellene.

Er du usikker, er det tryggeste rådet fortsatt det enkleste. Ved reell tvil kontakter du fastlegen, legevakten på 116 117 eller nødnummeret 113. En chatbot kjenner ikke hele sykehistorien din og kan ikke undersøke deg fysisk, og forskningen viser at den har en dokumentert svakhet nettopp når den skal vurdere alvorlighetsgrad.


Vanlige spørsmål

Er dette det samme som artikkelen om KI som terapeut?

Nei. Den artikkelen handler om psykisk helse og KI som samtalepartner i vanskelige perioder. Denne artikkelen handler om fysiske symptomer og medisinsk alvorlighetsgrad. Det er et annet risikoområde, med andre studier og andre svakheter.

Er nyere KI-modeller bedre på dette enn eldre?

En studie som sammenlignet flere ChatGPT-versjoner direkte, fant at selvhjelpsrådene har blitt noe bedre over tid. Men nøyaktigheten når modellen skal vurdere hvor akutt en situasjon er, har ikke blitt tilsvarende bedre fra versjon til versjon. Studien er publisert i det fagfellevurderte tidsskriftet Communications Medicine, arkivert hos PMC, og den viser at det ikke er gitt at “nyere er automatisk tryggere” på nettopp dette punktet.

Hva er den norske “digitale førstelinjen” helseministeren snakket om?

Det er en planlagt offentlig tjeneste med kvalitetssikret innhold. Tanken er at du skal kunne bruke den i stedet for å søke på egen hånd i Google eller ChatGPT når du får nye symptomer. Dagens Medisin omtalte planen i 2026. Da denne artikkelen ble skrevet, var det ennå ikke avklart hvordan tjenesten skal se ut eller når den lanseres.

Bør jeg slutte å bruke KI til helsespørsmål helt?

Ikke nødvendigvis. Forskningen tyder på at KI er nyttig til generell informasjon og fakta, men at du ikke bør bruke den til å vurdere hvor akutt et symptom er. Bruk den gjerne i tillegg til helsepersonell, men ikke i stedet for dem når du er reelt usikker.


Oppsummering og kilder

Det viktigste å huske:

  • Forskning i Nature Medicine viser lav treffsikkerhet når folk bruker KI til å vurdere alvorlighetsgraden av symptomer
  • Norges helseminister har eksplisitt sagt han vil ha folk bort fra å bruke Google og ChatGPT ved nye symptomer
  • KI presterer bedre på generell, faktabasert informasjon enn på din spesifikke, akutte situasjon
  • Ved reell tvil kontakter du fastlege, legevakt på 116 117 eller nødnummer 113, ikke en chatbot

Kilder brukt i denne artikkelen:

Sist oppdatert: August 2026

Les også

En vifte av like dokumentkort viser at ett kort med grønn markering og pennemerke skiller seg fra resten.
AI i hverdagen24. aug. 20267 min

Kan rekruttereren se at du brukte KI i jobbsøknaden din?

NTNU har droppet søknadsbrev i deler av sin rekruttering, rett og slett fordi strømmen av KI-genererte søknader gjorde dem mindre nyttige. Spørsmålet er kanskje ikke om rekrutterere "avslører" KI-bruk teknisk, men at KI-språket ofte gjør søknaden mindre overbevisende. Her er hva som faktisk skjer, og hvordan du bruker KI uten at det går ut over deg.

Les artikkelen →
#ai-i-hverdagen#helse#chatbot