AI-forskning og utvikling

Hvorfor blir AI-modeller stadig større, og hvorfor stopper det ikke der?

O
Ole Gunnar Hellenes··8 min lesing

Sist faktasjekket:

En stolpegraf med kraftig økende søylehøyde illustrerer hvor dramatisk AI-modeller har vokst i parameterstørrelse over tid.

Kort oppsummert

AI-modeller har vokst fordi skaleringslover viser at ytelsen øker forutsigbart med mer treningsdata, mer regnekraft og flere parametere, altså innstillinger modellen justerer under trening. Fra GPT-1 i 2018 til GPT-3 i 2020 gikk antallet fra 117 millioner til 175 milliarder. Men “større” betyr ikke lenger automatisk “smartere”, så i 2026 satser bransjen også på å la modellene “tenke” lenger før de svarer.


Fra 117 millioner til 175 milliarder på to år

Tall som “milliarder av parametere” kan virke abstrakte, så la oss starte konkret. En parameter er en liten justerbar verdi inne i modellen. Den virker litt som en vektskive som avgjør hvor mye modellen skal legge vekt på et bestemt mønster i dataene. Jo flere parametere, jo flere slike vektskiver har modellen å justere på under treningen.

Utviklingen har gått fort. GPT-1 kom i 2018 med 117 millioner parametere, og GPT-2 hadde 1,5 milliarder i 2019. I 2020 hadde GPT-3 hele 175 milliarder, nesten 1500 ganger så mange som GPT-1. Nyere modeller oppgir sjelden eksakte tall, men uavhengige analysemiljøer anslår at de største modellene i dag ligger i en helt annen størrelsesorden enn GPT-3. Veksten har likevel ikke skjedd fordi større alltid er bedre i seg selv. Den skjedde fordi forskere fant en forutsigbar sammenheng mellom størrelse og ytelse.


Skaleringslover: Regelen bak veksten

I 2020 publiserte forskere hos OpenAI det som ofte regnes som det første systematiske beviset for det vi i dag kaller skaleringslover. De viste at en språkmodells ytelse følger et forutsigbart mønster, en såkalt “power law”, når du øker tre ting samtidig. Det er mengden treningsdata, antall parametere og hvor mye regnekraft som brukes til treningen (compute). Dermed var det ikke lenger snakk om prøving og feiling. Selskapene kunne regne seg frem til hvor mye bedre en modell sannsynligvis ville bli, før de faktisk trente den.

I 2022 la et forskerteam i Google DeepMind frem en presisering som endret hvordan hele bransjen tenkte. Modellen deres, Chinchilla, hadde bare 70 milliarder parametere og var mindre enn flere av datidens største modeller, men den presterte likevel bedre. Forklaringen var at mange tidligere modeller hadde for mange parametere i forhold til hvor mye treningsdata de fikk se. Den nye tommelfingerregelen, ofte kalt “Chinchilla-optimal”, pekte på rundt 20 tokens treningsdata per parameter som best innenfor et gitt budsjett for regnekraft. Størrelsen alene er altså ikke nok, for modellen må også få nok data å lære av til å utnytte størrelsen.

Tre ikoner for treningsdata, parametere og regnekraft smelter sammen til én stigende kurve i tråd med skaleringsloven.


Hvorfor stopper det ikke bare der, da?

Et naturlig spørsmål er hvorfor selskapene ikke bare finner den “perfekte” størrelsen og blir der. Svaret er at skaleringslovene i seg selv ikke har noe innebygd tak. Så lenge du kan skaffe mer regnekraft og mer data, forutsier lovene bedre ytelse, selv om gevinsten per ekstra dollar gradvis blir mindre. Dette kalles “diminishing returns”. Hver nye dobling av regnekraft gir mindre forbedring enn den forrige, men den gir fortsatt en forbedring.

Dette skaper et press i hele bransjen. Så lenge en konkurrent kan bli litt bedre ved å bruke mer regnekraft, er det vanskelig for noen å stoppe frivillig, selv om gevinsten per krone blir stadig mindre. Samtidig har det de siste par årene kommet en reell faglig debatt om ren størrelsesskalering nærmer seg en praktisk vegg. Det er to grunner til det. Mengden høykvalitets treningsdata på internett er begrenset, og kostnadene ved å trene enda større modeller vokser enormt.


Den nye skaleringsaksen: Å tenke lenger, ikke bare være større

Det store skiftet i 2026 er at bransjen har funnet en ny måte å bli bedre på som ikke krever en enda større modell. I stedet for bare å gjøre modellen større under trening lar utviklerne den bruke mer regnekraft når den svarer. Modellen får altså “tenke” gjennom flere steg før den gir deg et svar. Dette kalles gjerne test-time compute eller inferenstid-skalering, og det er selve mekanismen bak det vi kaller reasoning-modeller.

Derfor er ikke “blir AI-modeller stadig større” lenger et helt presist spørsmål. Grunnmodellene fortsetter å vokse, men mye av den synlige forbedringen i 2025 og 2026 kommer fra denne nyere aksen. I januar 2026 omtalte Demis Hassabis offentlig et skifte mot modeller som kan fortsette å lære og resonnere etter at treningen er ferdig, og ikke bare bli større på forhånd. Hassabis ledet Google DeepMind som toppsjef frem til august 2026, og han er nå styreleder i DeepMind og sjefsforsker i morselskapet Alphabet.

Her er de to skaleringsaksene oppsummert:

Skaleringsakse Når den brukes Hva den gjør
Trening (den klassiske) Før modellen tas i bruk Gjør selve modellen større: flere parametere, mer treningsdata, mer regnekraft
Inferenstid (“tenke lenger”) Når modellen svarer deg Lar modellen bruke flere steg med resonnering før den gir et svar, uten å endre modellens grunnstørrelse

Et klossetårn og en klokke med tidsspiral viser skillet mellom å gjøre modellen større og å la den tenke lenger.


Vil dette noen gang stoppe?

De fleste forskere tror ikke at ren parameterskalering forsvinner helt. De tror heller at den i økende grad blir kombinert med andre metoder. Eksempler er treningsdata av høyere kvalitet i stedet for bare mer data, smartere arkitektur og mer regnekraft brukt når modellen svarer, og ikke bare under treningen. Skaleringslovene har ingen naturlig, hard grense innebygd. Men det finnes praktiske grenser for hvor mye strøm, penger og god treningsdata som faktisk er tilgjengelig i verden.


Vanlige spørsmål

Betyr flere parametere alltid en bedre AI?

Ikke nødvendigvis. Chinchilla-funnet fra 2022 viste konkret at en mindre modell med riktig mengde treningsdata kan slå en større modell som ikke har fått nok data å lære av. Det som teller, er forholdet mellom størrelse, data og regnekraft, og ikke ett av tallene alene.

Hva er egentlig en “skaleringslov”?

Det er en sammenheng som forskere har observert og beskrevet matematisk. Den viser at en modells ytelse øker forutsigbart når du øker mengden treningsdata, antall parametere og regnekraft samtidig. Det er ingen naturlov i fysisk forstand, men mønsteret har holdt seg påfallende stabilt på tvers av mange ulike modeller og selskaper.

Vil AI-modeller bli uendelig store til slutt?

Neppe i praksis. I teorien har skaleringslovene ingen innebygd øvre grense, men tilgjengelig strøm, penger og mengden god treningsdata setter en reell begrensning. Det er en av grunnene til at bransjen nå i økende grad ser mot andre metoder. Et eksempel er å la modellen bruke mer tid på å resonnere i stedet for bare å gjøre den enda større.

Hvorfor snakker alle om GPU-mangel hvis det handler om data og størrelse?

Fordi regnekraft er den tredje og like avgjørende faktoren i skaleringslovene. Selv med nok data og en plan for å gjøre modellen større krever treningen enorme mengder spesialisert datakraft i form av GPU-er. Denne kapasiteten er både dyr og fysisk begrenset globalt. Derfor er regnekraft en reell flaskehals i praksis og ikke bare et teoretisk poeng.


Oppsummering og kilder

Det viktigste å huske:

  • GPT-1 (2018) hadde 117 millioner parametere, og GPT-3 (2020) hadde 175 milliarder
  • Skaleringslover viser en forutsigbar sammenheng mellom størrelse, data, regnekraft og ytelse
  • Chinchilla-funnet fra Google DeepMind i 2022 viste at riktig forhold mellom data og størrelse betyr mer enn ren størrelse alene
  • I 2026 kommer mye av den nye ytelsesforbedringen fra at modeller “tenker” lenger ved svar, ikke bare fra større grunnmodeller

Kilder brukt i denne artikkelen:

Sist oppdatert: August 2026

Les også

#ai-forskning#fundament#skaleringslover