Regresjon og modellers gyldighet

La et digitalt verktøy finne modellen som passer best til dataene. Velg modelltype, tolk tallene, og vurder hvor langt modellen kan brukes.

1P2P
Utforsk

Start her: utforsk

En ny app har fått brukere de første åtte månedene. De oransje punktene viser antall brukere (i hundre tusen) måned for måned. Tallene er tenkte. Ekte målinger ligger nesten aldri nøyaktig på en rett linje, men vi ser et tydelig mønster.

Dra i AA og BB og lag den rette linja du synes passer best. De røde strekene viser hvor langt hvert punkt er fra linja.

1234567891234567
Samlet avvik (summen av de røde avstandene i andre): 8,697

Prøv dette:

  1. Lag linja som passer best etter øyemål. Hvor mange punkter ligger over linja, og hvor mange under?
  2. Prøv å gjøre det samlede avviket så lite som mulig. Hva er det minste du klarer?
  3. Kan en rett linje gå gjennom alle punktene? Hva forteller det om hvordan antall brukere vokser?
Forklaring

Forklaring

Steg 1: Hva gjør verktøyet?

I modellen øverst prøvde du å gjøre de røde avstandene så små som mulig. Et digitalt verktøy gjør akkurat det samme, bare systematisk: Du bestemmer modelltypen, for eksempel lineær. Verktøyet prøver alle mulige linjer og velger den der det samlede avviket er minst. (Det kvadrerer de loddrette avstandene og gjør summen så liten som mulig.) Å la verktøyet finne den beste modellen kalles regresjon, og resultatet kalles regresjonsmodellenRegresjonÅ finne den funksjonen av en valgt type som passer best til et sett med datapunkter..

Steg 2: Velg modelltype

ModellFormelNår passer den?
Lineærf(x)=ax+bf(x) = ax + bSamme tillegg for hver xx. Punktene ligger på en linje.
Eksponentiellf(x)=a⋅bxf(x) = a \cdot b^xSamme prosentvise endring for hver xx.
Andregradf(x)=ax2+bx+cf(x) = ax^2 + bx + cStiger og så synker (eller omvendt), med et topp- eller bunnpunkt.
Potensf(x)=a⋅xbf(x) = a \cdot x^bGår gjennom origo og vokser saktere og saktere (eller fortere og fortere).

Se på både punktene og situasjonen. En modell for renter bør være eksponentiell, selv om de første punktene ser ganske rette ut.

Modell: Samme data, fire modeller

Samme app-data som øverst, nå i tusen brukere. Bytt modell og se både hvor godt den passer, og hva den spår langt fram i tid. Flytt glidebryteren til måned 20.

510152050010001500
Modell (tt = måned): f(t)=62,38t+86,79f(t) = 62{,}38t + 86{,}79
Stigningstallet betyr at modellen endrer seg med 62,4 per måned.
I måned 5: modellen gir 398,7.
Forklaringsgrad R2=0,9849R^2 = 0{,}9849. Jo nærmere 1, jo bedre passer modellen til dataene, men sjekk alltid om modellen gir mening utenfor dataene.

Lim gjerne inn egne målinger.

Prøv dette:

  1. Hvilke modeller passer godt til de åtte målingene? Se på R2R^2.
  2. Hva spår hver av modellene for måned 20? Hvilken tror du mest på, og hvorfor?
  3. Hvorfor passer den eksponentielle modellen dårlig her? Se på hvordan økningen fra måned til måned endrer seg.
  4. Endre dataene i tekstfeltet: Legg til et punkt for måned 9 med 1000 tusen brukere. Hva skjer?

Steg 3: Regresjon i GeoGebra og regneark

  • GeoGebra: Legg punktene inn i regnearket, marker dem, og velg «Regresjonsanalyse». Eller skriv RegLin(liste), RegEksp(liste), RegPoly(liste, 2) eller RegPot(liste).
  • Regneark: Lag et punktdiagram og legg til en «trendlinje» med formel.

Steg 4: Tolk tallene

Tallene i modellen skal forklares med ord og enheter:

  • Lineær: aa er endringen per enhet xx, bb er verdien når x=0x = 0.
  • Eksponentiell: aa er startverdien, bb er vekstfaktoren. b=1,248b = 1{,}248 betyr 24,8 %24{,}8\ \% vekst per periode.
  • Andregrad: Toppunktet eller bunnpunktet er ofte det interessante.

Steg 5: Forklaringsgraden R2R^2

Mange verktøy viser forklaringsgradenForklaringsgradTallet R2R^2 mellom 0 og 1 som forteller hvor godt en regresjonsmodell passer til dataene. 1 betyr perfekt tilpasning. R2R^2, et tall mellom 0 og 1. Nær 1 betyr at punktene ligger tett inntil modellen. Men høy R2R^2 betyr ikke at modellen er riktig utenfor dataene.

Steg 6: Innenfor og utenfor dataene

Å bruke modellen mellom målingene er ofte trygt. Å bruke den utenfor målingene (for eksempel til å spå framtiden) er risikabelt. Tre modeller kan passe like godt til dataene, men gi helt ulike svar om ti år.

Eksempler

Gjennomgåtte eksempler

Eksempel 1: Tolk en eksponentiell modell

Salget av energidrikk i Norge (tusen liter) fra 2015 er modellert ved E(x)=17 396⋅1,248xE(x) = 17\,396 \cdot 1{,}248^x, der xx er antall år etter 2015. (Fra eksamen i 1P, våren 2023.) Forklar tallene.

17 396: Ifølge modellen ble det solgt omtrent 17,4 millioner liter i 2015.
1,248: Salget øker med 24,8 %24{,}8\ \% per år ifølge modellen.
Eksempel 2: Vurder gyldigheten

Fra 2021 til 2022 økte salget fra 67 997 til 73 109 tusen liter. Passer modellen fortsatt?

Økning: 73 109−67 99767 997⋅100 %≈7,5 %\dfrac{73\,109 - 67\,997}{67\,997} \cdot 100\ \% \approx 7{,}5\ \%.
Modellen forutsetter 24,8 %24{,}8\ \% økning per år. Den faktiske veksten er mye lavere.
Modellen overdriver veksten de siste årene, og bør ikke brukes til å spå framover.
Eksempel 3: Velg modelltype

Hvilken modelltype passer til situasjonene?

Lønn med fast timelønn: lineær (samme tillegg per time).
Et beløp på en sparekonto med fast rente: eksponentiell (samme prosent per år).
Overskudd som funksjon av antall solgte varer, med et best mulig salgstall: andregrad (toppunkt).
Vanlige feil

Vanlige feil

  • Å velge modell bare ut fra R2R^2. Tenk også på situasjonen.
  • Å bruke modellen langt utenfor dataene uten å kommentere det.
  • Å gjengi tallene uten å tolke dem. Forklar hva aa og bb betyr i situasjonen, med enheter.
  • Å tro at modellen er virkeligheten. Den er en forenkling som passer i et visst område.
Huskelapp

Huskelapp

  • Regresjon: verktøyet finner den beste modellen av typen du velger.
  • Lineær: samme tillegg. Eksponentiell: samme prosent. Andregrad: topp/bunn. Potens: a⋅xba \cdot x^b.
  • Tolk tallene med ord og enheter.
  • R2R^2 nær 1: punktene ligger nær modellen.
  • Innenfor dataene: ofte trygt. Utenfor: vær kritisk.
Oppgaver

Øv selv