AI-verktøy og guider

Slik fungerer AI-bildegenerering, forklart uten fagspråk

O
Ole Gunnar Hellenes··8 min lesing

Sist faktasjekket:

En gradientstripe viser tilfeldig støy som gradvis blir til et klart bilde, selve prinsippet bak generativ KI

Kort oppsummert

En KI som lager bilder, starter ikke med et blankt lerret, men med ren, tilfeldig støy. Den fjerner støyen steg for steg, til det står igjen et bilde som passer beskrivelsen din. Teknikken kalles en diffusjonsmodell, og modellen lærte den ved å gjøre det motsatte under treningen: Den ødela ekte bilder med støy og lærte å reversere prosessen.


Det korte svaret: fra støy til bilde

Tenk deg et gammelt TV-apparat uten signal, der skjermen bare viser grå “snø”. Tenk deg så at noen langsomt justerer støyen over noen titalls små steg, slik at et gjenkjennelig motiv gradvis dukker opp. Det ligner litt på et bilde som fremkalles i et mørkerom. I grove trekk er det dette en diffusjonsmodell gjør når den lager et bilde fra teksten din.

Prosessen har to hovedaktører:

  • Teksten din (prompten) er kompasset. Modellen har lært å knytte ord til visuelle mønstre, så når du skriver “En rødhåret hund på en strand i solnedgang”, styrer det hvilken retning støyen skal renskes i for hvert steg.
  • Selve rensingen skjer i mange små runder, ofte 20 til 50 steg. I hvert steg gjetter modellen bort litt av støyen og sammenligner resultatet med det teksten beskriver. Deretter tar den et nytt og litt bedre steg, og etter det siste steget sitter du igjen med et ferdig bilde.

Modellen “husker” altså ikke et bestemt bilde fra treningen og limer det inn. Den har lært et generelt mønster for hvordan støy henger sammen med motiver, og bruker det til å bygge noe helt nytt hver gang. Derfor er resultatet ikke en kopi av noe den har “sett” før.


Hvordan lærte modellen dette i utgangspunktet?

Det høres kanskje bakvendt ut, men modellen lærte å lage bilder ved å bli trent på å ødelegge dem.

En gradientstripe viser et bilde som gradvis dekkes av støy, slik modellen ble trent før den lærte å reversere prosessen

Under treningen tar utviklerne millioner av ekte fotografier og illustrasjoner og legger støy over dem, litt etter litt, helt til bildet bare er snø. Så trenes modellen på å gjette akkurat hvor mye støy som ble lagt til i hvert lille steg. Når den har gjort dette presist nok millioner av ganger, på millioner av ulike bilder, har den lært det generelle mønsteret. Den vet da hvordan prosessen kan reverseres, fra støy tilbake til et sammenhengende bilde. Slik forklarer IBM det i sin tekniske gjennomgang av diffusjonsmodeller.

Når modellen først kan dette, snur man prosessen når den skal brukes. Da starter den med bare støy, uten noe ekte bilde i bunnen. Så bruker den det lærte mønsteret til å bygge et helt nytt bilde fra grunnen av, styrt av teksten din.

Teksten kobles inn gjennom en egen språkmodell, som er trent til å forstå hva ord som “akvarell”, “close-up” eller “cyberpunk” betyr visuelt. Jo bedre denne koblingen mellom tekst og bilde er trent, desto bedre forstår bildegeneratorene stilbeskrivelser, komposisjon og spesifikke detaljer i prompten din.


Hvorfor akkurat denne metoden, og ikke noe enklere?

Før diffusjonsmodellene ble vanlige, brukte de fleste bildegeneratorer en annen teknikk, som kalles generative motstandsnettverk (GAN). Der “konkurrerte” to modeller mot hverandre. Den ene prøvde å lage falske bilder, og den andre prøvde å avsløre dem. GAN-er kunne lage overbevisende bilder raskt, men de slet med mangfold og stabilitet, og ved kompliserte motiver ble resultatene ofte ensartede eller forvrengte.

Diffusjonsmodellene viste seg å være mer stabile å trene, og de ga et bredere spekter av resultater, ifølge en grundig teknisk gjennomgang fra AI Summer. Ulempen er hastigheten. Fordi bildet bygges opp i mange små steg i stedet for ett, tar det som regel lenger tid å lage et bilde med en diffusjonsmodell enn med en GAN. Nyere versjoner har blitt betydelig raskere fordi de trenger færre steg, men den grunnleggende “steg for steg”-ideen er fortsatt kjernen i teknologien.

GAN Diffusjonsmodell
Metode To modeller konkurrerer: én lager, én avslører falske bilder Fjerner støy steg for steg over mange runder
Stabilitet i trening Kan slite med mangfold og stabilitet Mer stabil å trene
Hastighet Raskere å generere Historisk tregere, men nyere versjoner har redusert stegene kraftig

To like store kort viser to konkurrerende modeller mot en gradient fra støy til bilde, GAN og diffusjonsmodell side om side

Blant de mest kjente verktøyene som bruker teknikken i dag, er OpenAIs GPT Image, Midjourney, Googles Imagen og Stable Diffusion. Stable Diffusion er en modell med åpen kildekode som mange andre verktøy bygger videre på. Alle bruker det samme grunnprinsippet, men de skiller seg i hvordan de er trent og hvilke data de har lært av.


Vanlige spørsmål

Kopierer AI-en et ekte bilde når den lager et nytt?

Nei, ikke i vanlig forstand. Modellen lagrer ikke enkeltbilder fra treningsdataene og limer dem sammen. I stedet har den lært et statistisk mønster for hvordan motiver henger sammen med beskrivelser, og ut fra det mønsteret bygger den et nytt bilde fra ren støy. Likevel er det omstridt hvor grensen går mellom “å lære et mønster” og “å gjenbruke opphavsrettsbeskyttet materiale”. AIFokus har en egen, grundigere artikkel om treningsdata og opphavsrett. Du finner den under Se også nederst.

Hvorfor bommer AI-bilder fortsatt på ting som hender og tekst?

Hender kan stå i svært mange ulike stillinger, og derfor er de vanskelige å fange likt i treningsdataene. Tekst i bilder krever i tillegg at modellen forstår bokstaver som eksakte symboler, og det har diffusjonsprosessen historisk vært svak på. Nyere modeller har blitt merkbart bedre på begge deler. Men feilene kommer fra den samme grunnleggende mekanikken, ikke fra en enkeltstående “bug”.

Er diffusjonsmodeller det samme som ChatGPT-teknologi?

Nei. ChatGPT og lignende tekstmodeller bygger på en annen arkitektur. De er såkalte transformer-modeller, som forutsier neste ord i en tekst. Diffusjonsmodeller er bygget for å forutsi og fjerne støy i bilder, og etter hvert også i video og lyd. Noen nyere systemer kombinerer begge teknikkene i samme produkt, men de løser to ulike grunnleggende problemer.


Oppsummering og kilder

Det viktigste å huske:

  • Bildegenerering starter med ren støy, ikke et blankt lerret, og bygges opp i mange små steg
  • Modellen er trent ved å lære å reversere en prosess der ekte bilder gradvis ble ødelagt med støy
  • Teksten din styrer hvilken retning støyen “renskes” i, gjennom en egen tekst-til-bilde-kobling
  • Diffusjonsmodeller har i stor grad erstattet den eldre teknikken GAN, fordi de gir mer stabile og varierte resultater
  • Stable Diffusion, GPT Image og Midjourney bruker alle samme grunnprinsipp, med ulike treningsdata og finjusteringer

Kilder brukt i denne artikkelen:

Sist oppdatert: August 2026

Se også: Hva er generativ AI? Slik fungerer modellene for det bredere bildet, Hva er treningsdata, og hvorfor er det omstridt hvor KI-modeller henter den fra? for opphavsrettspørsmålet rundt hva modeller faktisk har lært av, og Klarer du fortsatt å se forskjell på ekte bilder og AI-bilder? Dette sier forskningen for hvorfor bildene denne teknologien lager blir stadig vanskeligere å avsløre.

Les også

#ai-verktoy#generativ-ai#diffusjonsmodell