Maximum Likelihood — welcher Parameter macht die beobachteten Daten am plausibelsten?
· Likelihood ≠ Wahrscheinlichkeit
Stufe 1
Schritt 1 — Datenpunkt platzieren
Schritt 2 — Verteilung verschieben → Likelihood ablesen
Schritt 1: Datenpunkt y setzen (σ = 1, fest)
Datenpunkt y (beobachtet, fest)
—
Verteilung zentriert bei μ
—
Dichtewert = Likelihood L(μ|y)
—
Likelihood-Kurve: wie hoch ist f(y|μ) für jedes μ?
Maximum bei μ =
— (= y)
Log-Likelihood ℓ(μ|y)
—
Die rechte Kurve zeigt für jedes mögliche μ, wie hoch die Dichtefunktion
am Datenpunkt y wäre. Das Maximum liegt genau bei μ = y.
Das ist MLE für einen Datenpunkt.
Likelihood ≠ Wahrscheinlichkeit — der zentrale Unterschied
P(y | θ): Wahrscheinlichkeit der Daten y, wenn Parameter θ bekannt ist.
θ fest, y unbekannt.
L(θ | y): Likelihood des Parameters θ, wenn die Daten y beobachtet sind. y fest, θ unbekannt.
Dieselbe mathematische Formel — vollständig andere Interpretation.
Likelihood summiert sich nicht auf 1 und ist keine Wahrscheinlichkeit über θ. Bei stetigen Verteilungen ist L der Dichtewert — dieser kann > 1 sein (σ in Stufe 2 sehr klein stellen, dann steigt die Dichtefunktion über 1).
L(θ | y): Likelihood des Parameters θ, wenn die Daten y beobachtet sind. y fest, θ unbekannt.
Dieselbe mathematische Formel — vollständig andere Interpretation.
Likelihood summiert sich nicht auf 1 und ist keine Wahrscheinlichkeit über θ. Bei stetigen Verteilungen ist L der Dichtewert — dieser kann > 1 sein (σ in Stufe 2 sehr klein stellen, dann steigt die Dichtefunktion über 1).
Warum Log-Likelihood? — Stufe 1 & 2
Die Likelihood von n Beobachtungen ist das Produkt der Einzeldichten:
Bei vielen kleinen Werten (z.B. 0.04 × 0.09 × … × 0.06) wird das Produkt extrem klein — numerischer Underflow. Stufe 2 zeigt das live: das Produkt der roten Linien wird im Infotext angezeigt und schrumpft rasant.
Der Logarithmus macht aus dem Produkt eine Summe:
Warum funktioniert das? Der Logarithmus ist eine monoton steigende Funktion — wenn L(θ) größer wird, wird log L(θ) ebenfalls größer, und dort wo L(θ) sein Maximum erreicht, hat auch log L(θ) sein Maximum. Das Maximum liegt also an genau derselben Stelle θ̂ — egal ob man L(θ) oder ℓ(θ) maximiert.
Der entscheidende praktische Vorteil: Statt tausender winzig kleiner Zahlen zu multiplizieren (was zu numerischem Underflow führt, d.h. der Computer rechnet einfach 0), addiert man nun handhabbare negative Zahlen. Kein Präzisionsverlust, keine Rundungsfehler.
MLE maximiert daher immer ℓ(θ) = log L(θ).
L(θ|y₁…yₙ) = ∏ᵢ f(yᵢ|θ)Bei vielen kleinen Werten (z.B. 0.04 × 0.09 × … × 0.06) wird das Produkt extrem klein — numerischer Underflow. Stufe 2 zeigt das live: das Produkt der roten Linien wird im Infotext angezeigt und schrumpft rasant.
Der Logarithmus macht aus dem Produkt eine Summe:
ℓ(θ) = Σᵢ log f(yᵢ|θ)Warum funktioniert das? Der Logarithmus ist eine monoton steigende Funktion — wenn L(θ) größer wird, wird log L(θ) ebenfalls größer, und dort wo L(θ) sein Maximum erreicht, hat auch log L(θ) sein Maximum. Das Maximum liegt also an genau derselben Stelle θ̂ — egal ob man L(θ) oder ℓ(θ) maximiert.
Der entscheidende praktische Vorteil: Statt tausender winzig kleiner Zahlen zu multiplizieren (was zu numerischem Underflow führt, d.h. der Computer rechnet einfach 0), addiert man nun handhabbare negative Zahlen. Kein Präzisionsverlust, keine Rundungsfehler.
MLE maximiert daher immer ℓ(θ) = log L(θ).
MLE — das Prinzip & Schätzer — Stufe 1 & 2
Maximum Likelihood Estimation sucht θ, das die beobachteten Daten
am plausibelsten macht:
Das ist kein Urteil über θ selbst — nur über seine Kompatibilität mit den Daten. Andere θ-Werte sind nicht unmöglich, nur weniger plausibel.
Analytische MLE-Schätzer (Normal):
μ̂ = ȳ · σ̂² = Σ(yᵢ−ȳ)²/n (biased — n statt n−1!)
In Stufe 1 sieht man: μ̂ = y (ein Punkt), in Stufe 2: μ̂ = ȳ (alle Punkte).
θ̂ = argmax ℓ(θ|y)Das ist kein Urteil über θ selbst — nur über seine Kompatibilität mit den Daten. Andere θ-Werte sind nicht unmöglich, nur weniger plausibel.
Analytische MLE-Schätzer (Normal):
μ̂ = ȳ · σ̂² = Σ(yᵢ−ȳ)²/n (biased — n statt n−1!)
In Stufe 1 sieht man: μ̂ = y (ein Punkt), in Stufe 2: μ̂ = ȳ (alle Punkte).
Mehrdimensionales MLE: μ und σ gleichzeitig — Stufe 2
MLE kann mehrere Parameter gleichzeitig schätzen — ein wichtiger Vorteil gegenüber
einfachen Momentenschätzern.
Für die Normalverteilung gibt es zwei unbekannte Parameter: μ (Lage) und σ (Streuung). Die Log-Likelihood wird dann zu einer Fläche über dem (μ, σ)-Raum — ein Gebirge statt einer Kurve. Der gemeinsame MLE liegt am Gipfel dieser Fläche:
In Stufe 2: „Auch σ variieren" aktivieren → Heatmap zeigt die 2D-Landschaft. Der helle Punkt ist der gemeinsame Gipfel. Dieses Prinzip skaliert auf beliebig viele Parameter — so schätzt lm() und glm() in R intern.
Für die Normalverteilung gibt es zwei unbekannte Parameter: μ (Lage) und σ (Streuung). Die Log-Likelihood wird dann zu einer Fläche über dem (μ, σ)-Raum — ein Gebirge statt einer Kurve. Der gemeinsame MLE liegt am Gipfel dieser Fläche:
μ̂ = ȳ σ̂ = √(Σ(yᵢ−ȳ)²/n)In Stufe 2: „Auch σ variieren" aktivieren → Heatmap zeigt die 2D-Landschaft. Der helle Punkt ist der gemeinsame Gipfel. Dieses Prinzip skaliert auf beliebig viele Parameter — so schätzt lm() und glm() in R intern.
MLE ist allgemein — Poisson & Bernoulli — Stufe 3
MLE funktioniert für jede parametrische Familie — nicht nur Normal.
Das ist das Fundament von GLMs:
Poisson (Trainingsstunden/Woche): λ̂ = ȳ · Log-Likelihood: Σᵢ [yᵢ·log(λ) − λ]
Bernoulli (Mindestleistung 0/1): p̂ = Anteil Einsen · Log-Likelihood: Σᵢ [yᵢ·log(p) + (1−yᵢ)·log(1−p)]
In Stufe 3 zwischen den Familien wechseln: Die Likelihood-Landschaft verändert ihre Form — Parabel für Bernoulli, asymmetrisch für Poisson — aber der Mechanismus ist identisch: finde den Gipfel.
Poisson (Trainingsstunden/Woche): λ̂ = ȳ · Log-Likelihood: Σᵢ [yᵢ·log(λ) − λ]
Bernoulli (Mindestleistung 0/1): p̂ = Anteil Einsen · Log-Likelihood: Σᵢ [yᵢ·log(p) + (1−yᵢ)·log(1−p)]
In Stufe 3 zwischen den Familien wechseln: Die Likelihood-Landschaft verändert ihre Form — Parabel für Bernoulli, asymmetrisch für Poisson — aber der Mechanismus ist identisch: finde den Gipfel.
Modellvergleich mit AIC & BIC — Stufe 3
Der maximierte Log-Likelihood-Wert ℓ̂ lässt sich direkt für Modellvergleiche nutzen:
AIC = −2·ℓ̂ + 2k (k = Anzahl Parameter)
BIC = −2·ℓ̂ + k·log(n)
Kleinerer AIC/BIC = bessere Passung bei gleicher Komplexität. AIC bestraft weniger stark als BIC — bei großem n bevorzugt BIC sparsamere Modelle.
Anwendungsbeispiel: Passt Poisson oder Negativ-Binomial besser auf die Trainingsstunden-Daten? Gleiche Daten, verschiedene Familien — AIC/BIC entscheiden. In Stufe 3 werden AIC und BIC live berechnet.
AIC = −2·ℓ̂ + 2k (k = Anzahl Parameter)
BIC = −2·ℓ̂ + k·log(n)
Kleinerer AIC/BIC = bessere Passung bei gleicher Komplexität. AIC bestraft weniger stark als BIC — bei großem n bevorzugt BIC sparsamere Modelle.
Anwendungsbeispiel: Passt Poisson oder Negativ-Binomial besser auf die Trainingsstunden-Daten? Gleiche Daten, verschiedene Familien — AIC/BIC entscheiden. In Stufe 3 werden AIC und BIC live berechnet.