Die Aktivierungsfunktion ist eine mathematische Funktion, die in jedem Neuron eines neuronalen Netzes auf die gewichtete Summe der Eingaben angewendet wird. Sie entscheidet, ob und wie stark das Neuron „feuert“ — also welchen Wert es an die nächste Schicht weitergibt. Ohne Aktivierungsfunktionen wäre ein mehrschichtiges Netz nur eine einzige lineare Transformation und könnte keine komplexen Muster lernen.

Wie ein Neuron rechnet

Ein Neuron erhält Eingaben x₁ … xₙ, gewichtet mit den Gewichten w₁ … wₙ, plus einem Bias b. Zuerst wird die gewichtete Summe z = Σ wᵢ·xᵢ + b gebildet, danach liefert die Aktivierungsfunktion f den Ausgabewert a = f(z). Genau dieses f ist die Aktivierungsfunktion.

Die wichtigsten Vertreter

  • Sigmoid: bildet Werte auf (0, 1) ab, klassisch für Ausgabeschichten binärer Klassifikation — siehe Sigmoid-Funktion.
  • Tanh: Wertebereich (−1, 1), null-zentriert — früher Standard in versteckten Schichten.
  • ReLU (Rectified Linear Unit): f(z) = max(0, z) — heute die häufigste Wahl in versteckten Schichten, weil sie die Sättigungsprobleme der Sigmoid-Funktion vermeidet.
  • Softmax: wandelt mehrere Ausgaben in eine Wahrscheinlichkeitsverteilung über Klassen um — Standard der Ausgabeschicht bei Mehrklassen-Klassifikation.
  • Leaky ReLU, Swish, GELU: Varianten, die einzelne Nachteile der ReLU entschärfen.

Warum Nichtlinearität entscheidend ist

Verkettet man nur lineare Funktionen, bleibt das Ergebnis linear — ein solches Netz könnte keine nichtlinearen Entscheidungsgrenzen lernen und wäre nicht mächtiger als die lineare Klassifikation. Erst die Aktivierungsfunktionen machen tiefe Netze zu universellen Funktionsapproximatoren.

Praxis

  • Die Aktivierungsfunktion muss differenzierbar sein — der Backpropagation-Algorithmus berechnet die Gradienten durch sie hindurch.
  • Wie schnell sich die Gewichte dabei ändern, steuert die Lernrate.
  • Für Klassifikation: Sigmoid für zwei Klassen, Softmax für mehrere; in den versteckten Schichten meist ReLU.

Hintergrund: Neuronale Netze – Grundlagen und Deep Learning.