Regularisierung (engl. regularization) fasst Techniken zusammen, die ein Modell daran hindern, sich zu stark an die Trainingsdaten anzupassen. Das Ziel ist ein Overfitting-Schutz: Das Modell soll das zugrunde liegende Muster lernen statt des Rauschens und auf neuen Daten gut generalisieren.
Warum Regularisierung?
Je mehr Parameter ein Modell hat, desto leichter „memoriert" es die Trainingsbeispiele. Overfitting zeigt sich darin, dass die Fehlerquote auf Trainingsdaten sinkt, auf neuen Daten aber steigt. Regularisierung bestraft Komplexität und hält die Gewichte klein – ein sanfter Eingriff, der die Loss-Funktion um einen Strafterm ergänzt.
Wichtige Regularisierungsverfahren
- L2-Regularisierung (Ridge): Die Quadratsumme der Gewichte fließt in den Verlust ein. Große Gewichte werden bestraft, kleine bleiben – das Modell wird „ruhiger", kein Gewicht wird exakt null.
- L1-Regularisierung (Lasso): Die Betragssumme der Gewichte wird bestraft. Sie treibt unwichtige Gewichte exakt auf null – praktisch eine automatische Feature-Auswahl, die das Modell sparsam macht.
- Elastic Net: Kombination aus L1 und L2 – sparsam wie Lasso, stabil wie Ridge.
- Dropout: Bei neuronalen Netzen werden während des Trainings zufällig Neuronen deaktiviert – dadurch lernt das Netz redundante, robuste Muster.
- Early Stopping: Das Training wird abgebrochen, sobald der Fehler auf Validierungsdaten wieder steigt.
- Baumtiefe begrenzen: Bei Entscheidungsbäumen und Ensemble-Verfahren wie Gradient Boosting wirken kleinere Bäume, eine niedrige Lernrate und frühzeitiges Stoppen wie eine natürliche Regularisierung.
Die Stärke λ
Die Stärke des Strafterms wird mit λ (Lambda) bezeichnet und ist ein Hyperparameter: Ein großes λ erzwingt sehr kleine Gewichte (Gefahr: Unteranpassung), ein kleines λ lässt das Modell freier lernen (Gefahr: Overfitting). Der passende Wert wird typischerweise über Datensatz-Split und Experimente gesucht. Da die Strafterme differenzierbar sind, funktioniert die Optimierung unverändert mit Gradient Descent.
Verwandte Grundlagen: Overfitting, Hyperparameter, Gradient Boosting, Loss-Funktion.