Masked Autoencoder (MAE) ist eine Variante des Autoencoders, die einen Teil der Eingabe absichtlich weglässt (maskiert) und aus dem Rest rekonstruiert. Das zwingt das Modell, die Struktur der Daten wirklich zu verstehen, statt sie nur zu kopieren.
Wie funktioniert ein Masked Autoencoder?
Das Prinzip stammt aus dem Sprachbereich: BERT maskiert Wörter und lässt das Modell sie vorhersagen. Der MAE überträgt diese Idee auf Bilder. Bei einem Bild werden zufällige Bildbereiche (Patches) maskiert — im Original-Paper von Kaiming He und Kollegen (2021, „Masked Autoencoders Are Scalable Vision Learners") sind das typischerweise 75 Prozent der Patches. Der Encoder verarbeitet nur die sichtbaren 25 Prozent, ein leichter Decoder rekonstruiert die fehlenden Bereiche. Durch den hohen Maskierungsanteil bleibt wenig Redundanz übrig, das Modell muss echte Bildsemantik lernen.
Asymmetrisches Encoder-Decoder-Design
Der Encoder ist ein Vision Transformer (ViT), der nur die sichtbaren Patches verarbeitet. Masken-Tokens werden erst im Decoder ergänzt, der deutlich kleiner ist als der Encoder. Das asymmetrische Design macht das Training effizient: Der Encoder sieht nur ein Viertel der Patches, Rechenaufwand und Speicher sinken entsprechend.
Warum ist der MAE so erfolgreich?
Der MAE liefert starke Repräsentationen für nachgelagerte Aufgaben (Transfer Learning): Die gelernten Merkmale lassen sich auf Klassifikation, Segmentierung und Detektion übertragen. Weil die Maskierung als Daten-Augmentierung wirkt und die Rekonstruktion ein hartes, aber lernbares Ziel ist, skaliert das Verfahren gut mit Modellgröße und Datenmenge. Ähnliche Ideen stecken auch in Diffusion Models, die Bilder schrittweise aus Rauschen rekonstruieren, und in Undercomplete Autoencodern, die über einen schmalen Bottleneck komprimieren.
Abgrenzung
Anders als ein Sparse Autoencoder, der über Aktivierungs-Penalties lernt, maskiert der MAE die Eingabe direkt. Anders als ein Overcomplete Autoencoder braucht er keine Zusatzregularisierung gegen die Identitätslösung — das Weglassen der Patches ist die Regularisierung.
Verwandte Grundlagen: CNN · LSTM · Regularized Autoencoder.