Konsistenz und Generalisierung

Vier Hypothesenräume, zwei Datenmengen — Begleitmaterial zu Abbildung 19.1 (Russell & Norvig, Künstliche Intelligenz).

Was Konsistenz bedeutet

Eine Hypothese hh heißt konsistent mit einer Trainingsmenge D={(x1,y1),,(xn,yn)}D = \{(x_1, y_1), \dots, (x_n, y_n)\}, wenn sie jeden einzelnen Trainingspunkt exakt trifft:

Definition

h(xj)=yjfu¨r alle j=1,,nh(x_j) = y_j \quad \text{für alle } j = 1, \dots, n

Gleichbedeutend: der Trainingsfehler ist exakt null. Bei quadratischer Verlustfunktion also RSS(h)=j(yjh(xj))2=0RSS(h) = \sum_j (y_j - h(x_j))^2 = 0.

Konsistenz ist eine binäre Ja/Nein-Eigenschaft, keine graduelle Qualitätsaussage. Sie ist außerdem eine Aussage ausschließlich über die bereits gesehenen Daten — über das Verhalten von hh an einer neuen Stelle xx sagt sie nichts.

Herkunft des Begriffs

Der Ausdruck stammt aus der logischen Sichtweise des Lernens. Man denkt sich jeden Datenpunkt als eine Beobachtung, die eine Hypothese entweder bestätigt oder ihr widerspricht. Konsistent heißt dann: die Hypothese steht zu keiner Beobachtung im Widerspruch. Im Versionsraum-Lernen (candidate elimination) ist genau die Menge der konsistenten Hypothesen das, was der Algorithmus verwaltet und mit jedem neuen Beispiel weiter einschränkt.

Abgrenzung zur Statistik

In der Statistik heißt ein Schätzer konsistent, wenn er für nn \to \infty in Wahrscheinlichkeit gegen den wahren Parameter konvergiert. Das ist eine asymptotische Aussage über unendlich viele Daten — also praktisch das Gegenteil dessen, was hier gemeint ist. Beide Begriffe heißen gleich und haben nichts miteinander zu tun.

Warum Konsistenz nicht ausreicht

Ob Konsistenz überhaupt erreichbar ist, hängt nicht von den Daten ab, sondern vom gewählten Hypothesenraum E\mathcal{E}. Ist E\mathcal{E} klein (etwa alle Geraden), gibt es meist gar keine konsistente Hypothese. Ist E\mathcal{E} groß genug, gibt es beliebig viele — und dann wird Konsistenz als Auswahlkriterium wertlos, weil sie zwischen ihnen nicht unterscheidet.

Der Schlüsselfall ist das Polynom vom Grad 12. Bei 13 paarweise verschiedenen xx-Werten ist die zugehörige Vandermonde-Matrix invertierbar, das Gleichungssystem Vw=yV \cdot w = y hat also genau eine Lösung. Eine exakt passende Hypothese existiert damit immer — unabhängig davon, wie die Daten aussehen. Konsistenz ist hier geschenkt und deshalb kein Qualitätssignal.

Vier Hypothesenräume im Vergleich

Alle vier Räume werden an dieselben 13 Datenpunkte angepasst. Die zugrunde liegende Funktion ist in beiden Zeilen dieselbe, f(x)=0,35x+sin(x)f(x) = 0{,}35x + \sin(x); die beiden Datenmengen unterscheiden sich nur durch ein anderes Rauschen ε\varepsilon.

Vier Diagrammspalten — Linear, Sinusförmig, Stückweise linear, Grad-12-Polynom — in zwei Zeilen für Datenmenge 1 und Datenmenge 2

Abbildung 1: Beste Anpassung aus vier Hypothesenräumen. Obere Reihe: Datenmenge 1. Untere Reihe: dieselben vier Räume, angepasst an Datenmenge 2 (gleiche Funktion, anderes Rauschen).

HypothesenraumFormFreie ParameterTrainingsfehlerKonsistent?
Linearh(x)=w1x+w0h(x) = w_1 x + w_026,70nein
Sinusförmigh(x)=w1x+sin(w0x)h(x) = w_1 x + \sin(w_0 x)20,54nein
Stückweise linearPolygonzug durch die Punkte240,00ja
Grad-12-Polynomh(x)=wixi,  i=012h(x) = \sum w_i x^i,\; i = 0 \dots 12130,00ja

Tabelle 1: Der Trainingsfehler ist das Mittel der Residuenquadratsummen über beide Datenmengen. Beim stückweise linearen Modell zählen zwei Parameter pro Segment (12 Segmente).

Der eigentliche Test: Stabilität

Konsistenz allein trennt Unter- und Überanpassung nicht — sie sagt nur, ob die linke Seite der Fehlerzerlegung null ist. Aussagekräftiger ist der Vergleich der beiden Anpassungen: Da beide Datenmengen dieselbe Funktion f(x)f(x) beschreiben, sollte ein gutes Modell zweimal annähernd dasselbe liefern. Der Flächeninhalt zwischen den Kurven ist ein direktes Maß für die Varianz des Verfahrens.

Beide Anpassungen je Hypothesenraum übereinandergelegt, die Fläche dazwischen grau markiert

Abbildung 2: Beide Anpassungen übereinandergelegt. Die graue Fläche ist der Unterschied, den allein das Rauschen verursacht — links kaum sichtbar, rechts dominant.

Zwei Balkendiagramme: Trainingsfehler je Hypothesenraum links, mittlerer Kurvenabstand rechts

Abbildung 3: Trainingsfehler (links) und mittlerer Kurvenabstand (rechts). Die beiden Extreme liegen an entgegengesetzten Enden: linear hat großen Fehler bei kleinem Abstand, das Polynom Fehler null bei großem Abstand. Der Wert 1,68 ist wegen der Beschneidung am Bildrand noch unterschätzt.

Lesart der vier Spalten

Hoher Bias, kleine Varianz

Linear

Zwei Freiheitsgrade reichen nicht aus, um die Krümmung abzubilden. Der Fehler bleibt groß, beide Geraden liegen aber fast aufeinander. Klassische Unteranpassung.

Bestes Modell der vier

Sinusförmig

Der Raum enthält die Struktur der wahren Funktion. Der Restfehler von 0,54 ist genau das Rauschen, das nicht mitgelernt wird. Formal nicht konsistent — und trotzdem das beste Modell der vier.

Speichert statt zu lernen

Stückweise linear

Konsistent per Konstruktion, weil die Punkte einfach verbunden werden. Das Modell speichert die Daten, statt sie zu komprimieren: 24 Parameter für 13 Punkte erklären nichts. Zwischen den Punkten ist es reine Interpolation.

Überanpassung in Reinform

Grad-12-Polynom

Fehler null, aber die Kurve schwingt an den Rändern wild aus (Runge-Phänomen). Die minimale Änderung der Daten verändert die Hypothese drastisch.

Konsequenzen für die Praxis

Ockhams Rasiermesser

Wenn Konsistenz nicht auswählt, braucht es ein zweites Kriterium. Ockhams Rasiermesser liefert es: unter den hinreichend gut passenden Hypothesen die einfachste wählen. Formal wird daraus die Minimierung von Verlust plus Komplexitätsstrafe:

Regularisierte Zielfunktion

h=argminh[Loss(h,D)+λKomplexita¨t(h)]h^{*} = \arg\min_h \bigl[\, \text{Loss}(h, D) + \lambda \cdot \text{Komplexität}(h) \,\bigr]

Bei linearen Modellen ist der zweite Term etwa λw2\lambda \lVert w \rVert^2 (Ridge) oder λw1\lambda \lVert w \rVert_1 (Lasso). Der Parameter λ\lambda steuert genau den Kompromiss, den die vier Spalten aufspannen.

Bei verrauschten Daten ist Konsistenz schädlich

Exakter Fit als Symptom

Das Rauschen wird mitgelernt

Gilt yj=f(xj)+εjy_j = f(x_j) + \varepsilon_j mit Rauschen ε\varepsilon, dann bedeutet h(xj)=yjh(x_j) = y_j für alle jj, dass die Hypothese das Rauschen mitlernen muss — sie hat gar keine andere Wahl. Ein exakter Fit ist unter Rauschen also nicht das Ziel, sondern das Symptom.

Der Begriff Konsistenz gehört streng genommen in die idealisierte Welt deterministischer Zielfunktionen; im verrauschten Fall ersetzt man ihn durch „minimiert eine regularisierte Verlustfunktion”.

Merksätze

Vier Sätze zum Mitnehmen

Merksatz 1

Konsistent = Trainingsfehler exakt null, nichts weiter.

Merksatz 2

Konsistenz ist eine Eigenschaft des Paars (Hypothese, Trainingsmenge) — nie eine Aussage über neue Daten.

Merksatz 3

Ein hinreichend großer Hypothesenraum macht Konsistenz garantiert erreichbar und damit als Kriterium wertlos.

Merksatz 4

Der Vergleich zweier Anpassungen an ähnliche Daten misst Varianz und sagt mehr über Generalisierung aus als der Trainingsfehler.

Quellen: Russell & Norvig, Künstliche Intelligenz — Ein moderner Ansatz, Kapitel 19 (Abbildung 19.1). — Deisenroth, Faisal & Ong, Mathematics for Machine Learning, Cambridge University Press 2020, Kapitel 8 (mml-book.com). Die Abbildungen sind eigene Nachrechnungen mit der Funktion 0,35x + sin(x) und additivem Rauschen, nicht die Originalgrafiken.