Hva er treningsdata, og hvorfor er det omstridt hvor KI-modeller henter den fra?
Sist faktasjekket:

Kort oppsummert
Treningsdata er tekst, bilder, kode og annet innhold som en KI-modell finner mønstre i og bygger sin “forståelse” av verden på. Det er omstridt fordi det meste er hentet fra internett uten at noen har spurt om lov, mens KI-selskapene ofte mener at bruken er lovlig. Verken norske domstoler eller Stortinget har gitt et endelig svar ennå.
Hva er treningsdata, konkret?
Når en KI-modell trenes, får den enorme mengder eksempler. Det er ikke fasitsvar, men rått materiale som modellen selv skal finne mønstre i. For tekstmodellene bak ChatGPT, Claude eller Gemini er det som regel en blanding av:
- Tekst fra nettsider, hentet inn i stor skala av automatiserte verktøy som gjennomsøker internett. Slike verktøy kalles ofte “crawlere”.
- Bøker og publiserte tekster, der noen er lisensiert, mens andre er hentet fra digitale boksamlinger uten at forfatteren nødvendigvis er kontaktet.
- Kode fra offentlig tilgjengelige kodebaser, som ligger bak modellenes evne til å skrive og forstå programmeringsspråk.
- Bilder, med tilhørende tekstbeskrivelser, for modeller som skal generere eller forstå bilder.
- Samtaledata, noen ganger fra brukere som selv har samtykket til at det de skriver, brukes til videre trening.
Meningen er at modellen skal lære seg mønstrene i hvordan språk, resonnement og sammenhenger fungerer, ikke at den skal huske dataene og gjengi dem ordrett. Derfor er kvaliteten og bredden på treningsdataen noe av det som betyr mest for hvor god den ferdige modellen blir.
Hvorfor er dette så omstridt?
Opphavsrett: er det lov å bruke andres verk uten å spørre?
Kjernespørsmålet er enkelt å formulere, men vanskelig å svare på. Er det lov å trene en kommersiell KI-modell på opphavsrettsbeskyttet materiale som bøker, artikler og bilder, uten samtykke fra dem som skapte det? I Norge reguleres dette av åndsverkloven, som er den norske loven om opphavsrett og gjennomfører EUs opphavsrettsdirektiver. Norske forfatterorganisasjoner har advart mot det de mener er ulovlig bruk av beskyttede verk i KI-trening. KI-selskapene mener på sin side ofte at treningen er lovlig “transformativ bruk”. Med det mener de at innholdet brukes til noe helt annet enn det opprinnelig var laget for, og ikke bare kopieres videre.
Spørsmålet er så uavklart at Stortinget har hatt et representantforslag til behandling i perioden 2025–2026. Forslaget ber regjeringen vurdere endringer i regelverket, nærmere bestemt om samtykke og innsyn i hvilke data som faktisk er brukt.
Internasjonalt har det samme spørsmålet vært oppe i flere amerikanske rettssaker gjennom 2025, og utfallene spriker. Enkelte domstoler har kommet til at selve treningen kan regnes som “fair use”, som er en unntaksregel i amerikansk opphavsrett. Andre domstoler har vurdert konkrete tilfeller annerledes, for eksempel bruk av ulovlig nedlastede tekster. Heller ikke internasjonalt finnes det altså ett samlet svar, og situasjonen er fortsatt i bevegelse i både USA, EU og Norge.
Personvern: hva med data om deg som privatperson?
Treningsdata handler ikke bare om bøker og nettartikler. Flere selskaper bruker også innhold som brukerne selv har lastet opp eller skrevet, til videre trening. Forbrukerrådet har blant annet klaget inn Meta for å bruke innhold som brukerne har delt, til KI-trening uten godt nok samtykke. I 2025 publiserte Forbrukerrådet også en rapport om generativ KI, altså KI-verktøy som selv lager nytt innhold, som ChatGPT. Rapporten konkluderer med at slike verktøy kan sette grunnleggende forbrukerrettigheter i spill, fordi det ofte er uklart for den enkelte hva som samles inn og hva det brukes til. Vi har også en egen gjennomgang av hva som skjer med det du selv skriver til en KI-chatbot.
To syn som sjelden møtes
I praksis har debatten delt seg i to leirer:
| Rettighetshavernes syn | KI-selskapenes syn | |
|---|---|---|
| Kjerneargument | Bruk av beskyttet innhold i stor skala, uten samtykke og uten betaling, henter ut verdi fra andres arbeid uten å kompensere dem | Å lære av eksisterende tekst og bilder ligner på hvordan et menneske lærer av det det har lest og sett |
| Hva de mener om “transformasjon” | Gjelder uansett hvor “transformert” sluttresultatet fremstår | Modellen “kopierer” ikke verkene direkte. Den lærer mønstre fra dem |
| Konkret krav / advarsel | Krever tydeligere regler om samtykke og åpenhet om hvilke data som faktisk er brukt | Mener datamengden som trengs ikke lar seg lisensiere fra hver enkelt rettighetshaver, og at et slikt krav ville stanse utviklingen av teknologien |
Foreløpig har ingen av synene vunnet fullt gjennomslag, verken i norsk eller internasjonal rett. Derfor er treningsdata et av de tydeligste eksemplene på et AI-spørsmål der teknologien har løpt raskere enn lovverket.

Hva betyr dette for deg som bruker?
Du merker sjelden denne debatten direkte, men den påvirker noen konkrete valg du faktisk kan ta:
- Noen tjenester lar deg reservere deg mot at bildene, tekstene og innleggene dine brukes til KI-trening. Meta er ett eksempel, og der har Forbrukerrådet publisert en egen veiledning for hvordan du reserverer deg.
- Kunstnere og skribenter tar i økende grad i bruk egne “opt out”-verktøy og merkelapper for å vise at innholdet deres ikke skal brukes i treningsdatasett. Det finnes likevel ingen garanti for at alle KI-selskaper respekterer det.
- Hva en modell “vet” avhenger av hva den er trent på. Debatten har derfor også en praktisk side, fordi kvaliteten, bredden og skjevhetene i treningsdataen påvirker direkte hvor god og balansert modellen du bruker faktisk er.

Vanlige spørsmål
Er det ulovlig for KI-selskaper å bruke bøker og artikler i treningen?
Det finnes ikke noe entydig svar. Det avhenger av hvilket land, hvilket regelverk og hvilken konkret sak man ser på. Rettspraksisen er dessuten fortsatt i bevegelse i både USA, EU og Norge, og nettopp derfor regnes spørsmålet som omstridt og ikke avklart.
Kan jeg finne ut om mitt eget innhold er brukt til å trene en bestemt modell?
Som regel ikke direkte og fullstendig, for de færreste KI-selskaper offentliggjør en full liste over alt treningsmaterialet. Det er nettopp slik åpenhet norske forfatter- og kunstnerorganisasjoner har etterlyst.
Er norsk innhold også brukt til å trene store, internasjonale modeller?
Sannsynligvis i noen grad, siden de store modellene trenes på enorme mengder internettinnhold på mange språk. Norsk er likevel bare en svært liten andel sammenlignet med engelskspråklig materiale, og det er noe av forklaringen på at mange modeller er sterkere på engelsk enn på norsk.
Løser KI-loven (AI Act) dette problemet?
Ikke fullt ut. Opphavsrett til treningsdata reguleres i hovedsak av egne opphavsrettsregler og ikke av KI-loven, selv om de to regelverkene griper inn i hverandre på enkelte punkter. Hva KI-loven faktisk dekker, går vi gjennom i artikkelen om hva KI-loven betyr for deg som forbruker.
Oppsummering og kilder
Det viktigste å huske:
- Treningsdata er materialet (tekst, bilder, kode) en KI-modell lærer mønstre fra, ikke fasitsvar den slår opp i
- Det meste hentes fra internett, ofte uten samtykke fra den enkelte rettighetshaver
- Norsk og internasjonal rettspraksis er fortsatt uavklart, med sprikende domsutfall i 2025
- Stortinget har hatt saken til behandling, uten en endelig konklusjon foreløpig
- Noen tjenester (som Meta) lar deg reservere eget innhold fra fremtidig KI-trening
Kilder brukt i denne artikkelen:
- Alura: AI og opphavsrett i Norge – hva er lov i 2026?
- Lov & Data: Fra åndsverk til algoritme – navigering av opphavsrett i KI-alderen
- Stortinget: Dokument 8:249 S (2025–2026) (primærkilde, representantforslag)
- Teknologirådet: Stortingets teknogruppe – KI og opphavsrett i Norge
- Advokatbladet: Kampen om opphavsrett i AI-æraen
- Patentstyret: Skapande kunstig intelligens vs. opphavsrett
- Forbrukerrådet: Ny rapport – generativ KI setter grunnleggende rettigheter i spill
- Forbrukerrådet: Forbrukerrådet krever at Meta stopper KI-trening
Sist oppdatert: August 2026
Merk: Rettstilstanden på dette området er i rask bevegelse, både i Norge, EU og internasjonalt. Denne artikkelen beskriver situasjonen slik den fremstår per august 2026, og bør oppdateres hvis det kommer nye, avklarende dommer eller lovendringer.
Les også

Hvem forsker egentlig på KI? Laboratoriene bak OpenAI, DeepMind og Anthropic forklart
Hver gang en ny AI-modell lanseres, er det gjerne ett av tre-fire navn bak. Men det finnes langt flere aktører enn det, med helt ulike mål, eierstruktur og finansiering, fra amerikanske Big Tech-laboratorier til kinesiske selskaper som gir bort modellene sine gratis, til et norsk forskningskonsortium du kanskje aldri har hørt om.

Hvorfor blir AI-modeller stadig større, og hvorfor stopper det ikke der?
GPT-1 hadde 117 millioner parametere. GPT-3 hadde 175 milliarder, altså nesten 1500 ganger så mange. Hvorfor blir AI-modeller stadig større, hvem bestemmer hvor grensen går, og har utviklingen faktisk begynt å endre retning i 2026?

Hvorfor klarer ikke KI å telle bokstaver i et ord? Tokenisering forklart
Spør en KI-chatbot hvor mange r-er det er i "strawberry", og den kan svare feil, selv om den kan forklare kvantefysikk. Dette er ikke fordi KI-en er dum. Det handler om hvordan den faktisk "ser" tekst, og det forklarer også hvorfor KI av og til bommer på enkel matte.