OLS & Multiple Regression
OLS Β· Koeffizienten Β· ModellgΓΌte Β· Multiple Regression
Β© Dr. Rainer DΓΌsing Β· Interactive Tools by Claude
N = 30 Studierende X₁ = Lernzeit (h/Woche) Xβ‚‚ = Schlafstunden (h/Nacht) Y = Klausurnote (0–100 Pkt.)
Das Least-Squares-Prinzip
Warum minimiert OLS die quadrierten Abweichungen β€” und was bedeutet das?
Lernzeit (h/Woche) β†’ Klausurnote
bβ‚€
β€”
b₁
β€”
RΒ²
β€”
RSS
β€”
RSS-Vergleich (kleiner = besser)
Ihre Gerade
β€”
OLS (min)
β€”
Modell:
Y = β€” + β€” Β· X₁
Tutorial β€” Das Least-Squares-Prinzip

Was Sie sehen
30 simulierte Studierende: Lernzeit X₁ (h/Woche) β†’ Klausurnote Y (Punkte). Die orangene Gerade ist Ihre SchΓ€tzlinie β€” ziehbar ΓΌber zwei runde Anker am linken und rechten Rand. Schalten Sie ● Residuals ein: grΓΌne Striche = positive Residuen (Punkt liegt ΓΌber der Gerade), rote Striche = negative Residuen (Punkt liegt darunter). Ein Residuum eα΅’ = yα΅’ βˆ’ Ε·α΅’ ist die Abweichung des beobachteten vom vorhergesagten Wert.

Was tun
Ziehen Sie die Anker, bis Ihre RSS (orangener Balken, absoluter Wert) mΓΆglichst klein wird. Klicken Sie dann β—Ž OLS zeigen β€” die blaue OLS-Gerade erscheint. Der zweite Balken zeigt deren RSS. Vergleich: Wie nah kamen Sie ans Minimum?

Was ist RSS? (Residual Sum of Squares)
RSS = Ξ£eα΅’Β² = Ξ£(yα΅’ βˆ’ Ε·α΅’)Β². OLS findet analytisch exakt das bβ‚€ und b₁, fΓΌr das RSS global minimal ist β€” eindeutig und beweisbar. Kein Ausprobieren: b₁ = Cov(X,Y)/Var(X), bβ‚€ = Θ³ βˆ’ b₁·xΜ„.

Warum Quadrate, nicht BetrΓ€ge?
(1) FΓΌr jede OLS-Gerade gilt Ξ£eα΅’ = 0 β€” positive und negative Residuen heben sich trivialerweise auf. (2) Das Quadrieren bestraft große Residuen ΓΌberproportional: ein Residuum von 10 kostet 100, nicht 10. (3) Das Quadrat liefert eine differenzierbare Funktion β†’ geschlossene, eindeutige LΓΆsung.

Gauss-Markov: Unter den 5 OLS-Annahmen (β†’ Modul β‘’) ist OLS der BLUE β€” Best Linear Unbiased Estimator. Kein anderer linearer unverzerrter SchΓ€tzer hat kleinere Varianz.

I β€” linear
II β€” quadratisch
III β€” Ausreißer
IV β€” Leverage-Punkt
Alle vier DatensΓ€tze haben (nahezu) identische Kennwerte: b₁ β‰ˆ 0.50, bβ‚€ β‰ˆ 3.0, r β‰ˆ .816, RΒ² β‰ˆ .667. Dennoch zeigen Scatterplot und Residualplot fundamental verschiedene Muster. Fazit: Koeffizienten und RΒ² allein genΓΌgen nicht β€” Residualdiagnostik ist Pflicht.
bβ‚€, b₁ und Ξ² verstehen
Steigung, Achsenabschnitt und standardisierter Koeffizient β€” visuell und formal
Regressionsgerade mit Koeffizienten-Visualisierung
bβ‚€
β€”
b₁
β€”
Ξ²
β€”
b₁: Pro +1 h Lernzeit steigt die erwartete Note um β€” Punkte.
Ξ² = r = β€” β€” bivariat gilt stets Ξ² = r.
bβ‚€: Erwartete Note bei 0 h Lernzeit (extrapoliert, inhaltlich oft nicht sinnvoll).
Tutorial β€” bβ‚€, b₁ und Ξ² verstehen

Was Sie sehen
Die OLS-Gerade durch alle 30 Datenpunkte. Aktivieren Sie β–³ Steigung fΓΌr das Steigungsdreieck und βœ› Mittelwert fΓΌr den Schwerpunkt (xΜ„, Θ³) im Koordinatensystem.

b₁ = β€” β€” Steigung (unstandardisiert)
Pro +1 h Lernzeit steigt die erwartete Note um β€” Punkte. Einheit: Punkte/Stunde. Interpretation: deskriptiv, kein Kausaleffekt. b₁ ist skalenabhΓ€ngig.
Das Steigungsdreieck im Koordinatensystem zeigt konkret: +3 h Lernzeit β†’ +β€” Punkte (= 3 Β· b₁).

Ξ² = β€” β€” standardisierter Koeffizient
Pro +1 SD in X₁ steigt Y um Ξ² SD. Bivariat gilt immer Ξ² = r (Pearson-Korrelation). Ξ² erlaubt den Vergleich von PrΓ€diktoren unterschiedlicher Skalen innerhalb einer Studie.
Wichtig: Ξ² gibt nicht direkt die Wichtigkeit an β€” bei korrelierten PrΓ€diktoren kann Ξ² stark vom partiellen Effekt abweichen (β†’ Modul β‘£).

bβ‚€ = β€” β€” Achsenabschnitt
Erwartete Note bei X₁ = 0 h Lernzeit. Da 0 h außerhalb des beobachteten Bereichs liegt, ist das eine Extrapolation β€” inhaltlich meist nicht sinnvoll interpretierbar.

Schwerpunkt (xΜ„ = β€” h | Θ³ = β€” Pkt)
Die OLS-Gerade lΓ€uft immer durch (xΜ„, Θ³) β€” mathematisch zwingend, da bβ‚€ = Θ³ βˆ’ b₁·xΜ„.

Berechnungsformeln:
b₁ = Ξ£(xα΅’ βˆ’ x)(yα΅’ βˆ’ y) / Ξ£(xα΅’ βˆ’ x)Β² = Cov(X,Y) / Var(X)
bβ‚€ = y βˆ’ b₁ Β· x  Β·  Ξ² = b₁ Β· (SDX / SDY) = r  (bivariat)
b₁ (unstandardisiert) berichtet man, wenn die Einheit inhaltlich bedeutsam ist: β€ž+1 h Lernzeit β†’ +β€” Punkte".

Ξ² (standardisiert) erlaubt den Vergleich von PrΓ€diktoren verschiedener Skalen innerhalb einer Studie. Achtung: Ξ² variiert mit SD(X) und SD(Y) β€” Vergleiche zwischen Studien sind nicht zulΓ€ssig.

Im bivariaten OLS gilt stets: Ξ² = r = β€”. Im multiplen Modell (Modul β‘£) ist Ξ² β‰  r.
ModellgΓΌte & Varianzzerlegung
TSS = SSM + RSS, RΒ², adjusted RΒ² und die Annahmen des OLS-Modells
Gesamt (TSS) β€” AbstΓ€nde der Punkte vom Mittelwert Θ³
TSS = SSM + RSS
SSM
RSS
SSM = β€” RSS = β€”
RΒ²
β€”
adj. RΒ²
β€”
fΒ²
β€”
r (Pearson)
β€”
RΒ² = SSM/TSS = β€”% der Gesamtvarianz in Y werden durch X₁ erklΓ€rt.
fΒ² = RΒ²/(1βˆ’RΒ²) = SSM/RSS:  klein β‰₯ .02 Β· mittel β‰₯ .15 Β· groß β‰₯ .35
Tutorial β€” Varianzzerlegung & ModellgΓΌte

Was Sie sehen β€” drei Modi (TSS = SSM + RSS)
TSS (graue Striche): AbstΓ€nde aller Punkte vom Mittelwert Θ³ β€” die Gesamtstreuung in Y, unabhΓ€ngig vom Modell. SSM (grΓΌne Striche): AbstΓ€nde des Modells (Regressionsgerade) vom Mittelwert Θ³ β€” der Anteil, den das Modell gegenΓΌber β€žnur Θ³ als Vorhersage" erklΓ€rt. RSS (rote Striche): AbstΓ€nde der Punkte vom Modell β€” die Residuen, also was unerklΓ€rt bleibt. Der Balken links zeigt das SSM : RSS-VerhΓ€ltnis. Wechseln Sie die Modi ΓΌber die SchaltflΓ€chen.

TSS = β€” β€” Total Sum of Squares
TSS = Ξ£(yα΅’ βˆ’ Θ³)Β². Gesamtvarianz in Y β€” hΓ€ngt nicht vom Modell ab.

SSM = β€” (β€”% von TSS) β€” Sum of Squares Model
SSM = Ξ£(Ε·α΅’ βˆ’ Θ³)Β². Der vom Modell erklΓ€rte Anteil β€” der Abstand der Regressionsgeraden vom Mittelwert Θ³ an der Stelle jedes Datenpunktes (ein Beitrag pro Beobachtung), also die Verbesserung gegenΓΌber β€žnur Θ³". Je grâßer SSM relativ zu TSS, desto besser der Fit. OLS maximiert SSM (Γ€quivalent zum Minimieren von RSS).

RSS = β€” (β€”% von TSS) β€” Residual Sum of Squares
RSS = Ξ£eα΅’Β² β€” nicht erklΓ€rte Varianz. TSS = SSM + RSS ist mathematisch exakt.

R² und f² (Cohens Effektgrâße)
RΒ² = SSM/TSS: Anteil erklΓ€rter Varianz. Achtung: RΒ² steigt immer mit jedem weiteren PrΓ€diktor! Adjusted RΒ² korrigiert mit Strafterm pro PrΓ€diktor.
fΒ² = RΒ²/(1βˆ’RΒ²) = β€” β†’ β€” Effekt. Cohen (1988): .02 klein Β· .15 mittel Β· .35 groß.

β‘ 
LinearitΓ€t: Die Beziehung zwischen X und Y ist linear. Verletzung: Residual-vs-Fitted-Plot zeigt systematisches Muster. Abhilfe: Transformation oder polynomiale Terme.
β‘‘
UnabhΓ€ngigkeit: Beobachtungen sind unabhΓ€ngig (keine Autokorrelation, kein Clustering). Verletzung bei LΓ€ngsschnitt- oder Nested-Daten β†’ gemischte Modelle notwendig.
β‘’
HomoskedastizitΓ€t: Varianz der Residuen ist konstant ΓΌber alle X-Werte β€” kein StreufΓ€cher. Die SchΓ€tzung der Regressionsgeraden selbst bleibt auch unter HeteroskedastizitΓ€t unverzerrt β€” betroffen ist nur die Inferenzstatistik (wie bei der Normalverteilungsannahme). Verletzung: heteroskedastizitΓ€tsrobuste Standardfehler (HC3), WLS oder ein distributionelles Modell (Οƒ selbst als Funktion von X, z.B. bf(y ~ x, sigma ~ x) in brms).
β‘£
Normalverteilung der Fehler Ξ΅: Nur fΓΌr Inferenzstatistik nΓΆtig β€” nicht fΓΌr die OLS-SchΓ€tzung selbst, die schon unter den 4 Annahmen oben allein durch das Gauss-Markov-Theorem zum BLUE wird (β†’ Modul β‘ ). Bei n β‰₯ 30 greift der zentrale Grenzwertsatz.
β‘€
Keine perfekte MultikollinearitΓ€t (multiple Regression): Sind zwei PrΓ€diktoren perfekt korreliert, ist (Xα΅€X) nicht invertierbar. Hohe KollinearitΓ€t blΓ€ht Standardfehler auf β†’ VIF > 10 kritisch. Siehe Modul β‘£.
Multiple Regression & Added Variable Plot
Was bedeutet β€žunter Kontrolle von Xβ‚‚"? Partielle Slopes visuell verstehen.
Schritt β‘  β€” Bivariates Modell: Y ~ X₁
Schritt
Korrelation X₁↔Xβ‚‚
Koeffizientenvergleich
Modell b₁ β₁ RΒ²
Bivariat β€” β€” β€”
Partiell β€” β€” β€”
AVP-Slope
β€”
Ξ”b₁
β€”
Schritt β‘  zeigt die bivariate Regression Y auf X₁ β€” wie in Modul β‘ . Das bivariate b₁ enthΓ€lt noch den Einfluss von Xβ‚‚, wenn X₁ und Xβ‚‚ korreliert sind.
Tutorial β€” Multiple Regression & AVP

Von der Geraden zur Ebene
Bivariat (Y ~ X₁) ist die LΓΆsung eine Gerade im 2D-Raum. Mit zwei PrΓ€diktoren (Y ~ X₁ + Xβ‚‚) wird sie zur RegressionsflΓ€che (Ebene) im 3D-Raum. b₁ ist die Steigung in X₁-Richtung, bβ‚‚ in Xβ‚‚-Richtung β€” jeweils bei festgehaltenem anderen PrΓ€diktor.

Warum multiple Regression?
X₁ (Lernzeit) und Xβ‚‚ (Schlaf) korrelieren mit r₁₂ = β€”. Das bivariate Modell misst nicht den reinen X₁-Effekt β€” b₁ enthΓ€lt auch den Einfluss von Xβ‚‚. Das multiple Modell hΓ€lt Xβ‚‚ statistisch konstant.

Die Koeffizienten lesen (Tabelle links)
Bivariat b₁: Steigung aus Y ~ X₁ allein β€” enthΓ€lt Konfundierung durch Xβ‚‚.
Partiell b₁: Steigung aus Y ~ X₁ + Xβ‚‚ β€” bereinigt um Xβ‚‚.
Ξ”b₁: Die Differenz quantifiziert die Konfundierung. Bei r₁₂ = 0 ist Ξ”b₁ = 0.

Schritt β‘  β€” Bivariate Ausgangslage
Was Sie sehen: Die bivariate OLS-Gerade Y ~ X₁ (Lernzeit β†’ Note) β€” identisch mit Modul β‘ .
Tipp: Notieren Sie das bivariate b₁ (Tabelle links), wechseln Sie dann r₁₂ und vergleichen Sie.

Konfundierung im Vergleich
bivariat b₁ = β€” Β· partiell b₁ = β€” Β· Ξ”b₁ = β€”
Je grâßer r₁₂, desto mehr weicht das bivariate vom partiellen b₁ ab.

AVP-Prinzip: Ein Added Variable Plot (Partialregression) macht den partiellen Effekt von X₁ auf Y sichtbar β€” bereinigt um Xβ‚‚. Dazu wird Xβ‚‚ sowohl aus Y (e(Y|Xβ‚‚)) als auch aus X₁ (e(X₁|Xβ‚‚)) herausgerechnet. Die Steigung der Regressionslinie durch die Residualvektoren entspricht exakt dem partiellen Koeffizienten b₁ aus dem multiplen Modell.
Lernkarten β€” OLS & Multiple Regression
β‘  OLS-Kriterium
OLS minimiert die Summe der quadrierten Residuen: min Ξ£(yα΅’ βˆ’ Ε·α΅’)Β². Das Quadrieren hat zwei GrΓΌnde: Vorzeichen werden neutralisiert, und große Residuen werden ΓΌberproportional stΓ€rker bestraft als kleine. Die LΓΆsung ist eindeutig und liefert immer Ξ£eα΅’ = 0.
β‘‘ Koeffizient b₁
Interpretation: β€žPro +1 Einheit X steigt der erwartete Wert von Y um b₁ Einheiten β€” alle anderen PrΓ€diktoren konstant gehalten (ceteris paribus)." Im bivariaten Fall: b₁ = Ξ£(xα΅’βˆ’xΜ„)(yα΅’βˆ’Θ³) / Ξ£(xα΅’βˆ’xΜ„)Β². Der ZΓ€hler ist die Kovarianz, der Nenner die Varianz von X.
β‘’ Intercept bβ‚€
bβ‚€ ist der erwartete Y-Wert, wenn alle PrΓ€diktoren gleich 0 sind. Das ist oft inhaltlich nicht sinnvoll (z. B. 0 Lernstunden, 0 Schlaf). bβ‚€ wird fΓΌr die Vorhersage benΓΆtigt, sollte aber meist nicht inhaltlich interpretiert werden. Immer gilt: Θ³ = bβ‚€ + b₁·xΜ„.
β‘£ RΒ² und adj. RΒ²
RΒ² = SSM/SST ∈ [0, 1] β€” Anteil erklΓ€rter Varianz. RΒ² steigt mit jedem hinzugefΓΌgten PrΓ€diktor, auch nutzlosen. Adjusted RΒ² korrigiert dafΓΌr: adj.RΒ² = 1 βˆ’ (1βˆ’RΒ²)Β·(nβˆ’1)/(nβˆ’kβˆ’1). adj.RΒ² sinkt, wenn ein neuer PrΓ€diktor weniger erklΓ€rt als durch Zufall erwartet.
b₁ im multiplen Modell ist nicht derselbe wie im bivariaten Modell β€” er ist der Slope im Added Variable Plot (AVP): Regression von e(Y|Xβ‚‚) auf e(X₁|Xβ‚‚). Dieser Wert entspricht dem Partial Slope: Effekt von X₁ auf Y, nachdem der gemeinsame Anteil von Xβ‚‚ aus beiden herausgerechnet wurde.
β‘₯ Standardisierung Ξ²
Ξ² = b Β· (SD_X / SD_Y) β€” der standardisierte Regressionskoeffizient. Ξ² gibt an, um wie viele Standardabweichungen Y steigt, wenn X um eine SD steigt. Erlaubt Vergleich von PrΓ€diktoren mit verschiedenen Skalen, aber nur innerhalb einer Stichprobe. Zwischen Studien sind Ξ²-Werte wegen unterschiedlicher SDs nicht direkt vergleichbar.
? Hilfe β€” OLS & Multiple Regression

Was ist OLS?

Ordinary Least Squares (OLS) ist das Standardverfahren zur SchΓ€tzung linearer Regressionsmodelle. Es findet diejenigen Koeffizienten bβ‚€ und b₁, die die Summe der quadrierten Residuen minimieren: min Ξ£(yα΅’ βˆ’ Ε·α΅’)Β². Die LΓΆsung folgt aus den Normalgleichungen:

  • b₁ = Ξ£(xα΅’βˆ’xΜ„)(yα΅’βˆ’Θ³) / Ξ£(xα΅’βˆ’xΜ„)Β²
  • bβ‚€ = Θ³ βˆ’ b₁·xΜ„
β–Έ Matrizennotation (fΓΌr Interessierte)
Im multiplen Fall mit Design-Matrix X (nΓ—(k+1), erste Spalte Einsen) und Vektor y:
b = (Xα΅€X)⁻¹ Xα΅€y
Voraussetzung: (Xα΅€X) ist invertierbar β†’ keine perfekte MultikollinearitΓ€t.

Koeffizienteninterpretation

b₁ (unstandardisiert): β€žPro +1 Einheit X steigt ΕΆ um b₁ Einheiten, wenn alle anderen PrΓ€diktoren konstant gehalten werden." Das β€žceteris paribus" ist entscheidend β€” im multiplen Modell ist b₁ ein partieller Effekt, kein marginaler Roheffekt.

Ξ² (standardisiert): Vergleich von PrΓ€diktoren unterschiedlicher Skalen. Vorsicht: Ξ² ist stichprobenspezifisch und darf nicht zwischen Studien verglichen werden.

RΒ² und ModellgΓΌte

RΒ² = SSM/TSS = 1 βˆ’ RSS/TSS. Im bivariaten Fall gilt RΒ² = rΒ². RΒ² steigt mit jedem PrΓ€diktor, auch bei zufΓ€lligen Variablen (Freedman's Paradox). Adjusted RΒ² korrigiert fΓΌr die Anzahl der PrΓ€diktoren k:

adj.RΒ² = 1 βˆ’ (1βˆ’RΒ²)Β·(nβˆ’1)/(nβˆ’kβˆ’1)

Effektgrâße f²

fΒ² = RΒ²/(1βˆ’RΒ²) β€” Effektgrâße fΓΌr multiple Regression. Konventionen (Cohen 1988): klein β‰₯ .02, mittel β‰₯ .15, groß β‰₯ .35. Besser als Konventionen: SESOI β€” den kleinsten inhaltlich bedeutsamen Effekt vor der Studie definieren.

Wann versagt OLS?

  • NichtlinearitΓ€t β€” Residual-vs-Fitted-Plot zeigt Muster
  • HeteroskedastizitΓ€t β€” StreufΓ€cher in Residualplot
  • Ausreißer/Leverage β€” Einzelne Punkte bestimmen die Gerade (β†’ Anscombe)
  • MultikollinearitΓ€t β€” Hohe r(X₁,Xβ‚‚) blΓ€ht Standardfehler auf; VIF > 10 kritisch
  • Messfehler β€” Attenuation von b₁ (Koeffizienten werden zur Null hin verzerrt)

Verwandte Tools im Bayes Thinking Lab

WeiterfΓΌhrende Literatur