Epoch und Batch Size: Zwei zentrale Begriffe des KI-Trainings. Sie beschreiben, in welchen Schleifen und Portionen ein Modell aus seinen Trainingsdaten lernt.

Was ist eine Epoch?

Eine Epoch ist ein vollständiger Durchlauf durch alle Trainingsbeispiele. Nach einer Epoch hat das Modell jedes Beispiel genau einmal gesehen. Ein einzelner Durchlauf reicht meist nicht: Das Modell braucht viele Wiederholungen (typisch zehn bis mehrere hundert Epochen), bis sich die Gewichte stabilisiert haben und die Loss Function einen niedrigen Wert erreicht. Mehr Epochen verbessern das Lernen — aber nur bis zu einem Punkt. Danach beginnt das Modell, die Trainingsdaten auswendig zu lernen, statt Muster zu verallgemeinern. Dieses Problem heißt Overfitting.

Was ist die Batch Size?

Die Batch Size gibt an, wie viele Trainingsbeispiele das Modell in einem einzigen Schritt verarbeitet, bevor die Gewichte aktualisiert werden. Drei typische Varianten:

  • Full-Batch: Alle Beispiele auf einmal — sehr genaue Schätzung des Gradienten, aber speicherhungrig und langsam.
  • Mini-Batch (Standard): z.B. 32 oder 64 Beispiele pro Schritt — guter Kompromiss aus Geschwindigkeit und Stabilität.
  • Stochastic Gradient Descent (SGD): Ein einzelnes Beispiel pro Schritt — sehr häufig aktualisiert, dafür rauschig und oft langsamer zu konvergieren.

Zusammenhang

Anzahl der Updates pro Epoch = Anzahl der Trainingsbeispiele ÷ Batch Size. Beispiel: 10.000 Beispiele mit Batch Size 64 ergeben rund 156 Updates pro Epoch. Die Batch Size beeinflusst außerdem die Speicheranforderungen der Grafikkarte: Größere Batches brauchen mehr VRAM. Die Wahl von Epochs und Batch Size wird zusammen mit der Lernrate abgestimmt — zusammen bestimmen sie, ob das Training konvergiert oder in einem lokalen Minimum hängen bleibt.

Praxis-Tipps

  • Kleinere Batches (16-64) eignen sich gut als Startpunkt; größere Batches nur, wenn der VRAM reicht.
  • Den Loss-Verlauf über Epochen beobachten: Steigt der Validierungs-Loss wieder an, ist Overfitting erreicht.
  • Frühes Stoppen (Early Stopping) spart Rechenzeit: Training abbrechen, sobald der Validierungs-Loss nicht mehr sinkt.

Verwandte Grundlagen: Maschinelles Lernen, Training: Wie KI-Modelle lernen, Loss Function.