Consistency Distillation (CD) ist ein Verfahren, das ein vortrainiertes Diffusionsmodell in einen Generator verwandelt, der mit einem einzigen Netzwerkdurchlauf Bilder erzeugt. Es stammt aus dem Paper „Consistency Models" von Yang Song, Prafulla Dhariwal, Mark Chen und Ilya Sutskever (OpenAI, arXiv 2303.01469, ICML 2023). Das Ergebnis ist ein Consistency Model mit extrem schnellem Sampling.
Die Konsistenzfunktion
Ein Consistency Model lernt eine Konsistenzfunktion, die jeden Punkt entlang einer Rausch-Trajektorie auf denselben Datenpunkt abbildet — egal auf welchem Rauschlevel man startet. Dadurch genügt am Ende ein einziger Schritt vom reinen Rauschen zum Bild, statt der üblichen hundert oder tausend Denoising-Schritte eines Diffusion Models.
So läuft die Destillation ab
Bei der Destillation wird für jedes Trainingsbeispiel ein einziger Schritt eines ODE-Lösers (zum Beispiel Euler oder Heun) auf der Probability-Flow-ODE des vortrainierten Modells ausgeführt. Das Ergebnis dient als Ziel für die Konsistenzfunktion: Benachbarte Punkte derselben Trajektorie müssen dieselbe Vorhersage liefern (Selbst-Konsistenz-Loss). Die Probability-Flow-ODE selbst stammt aus dem Score-SDE-Framework.
Abgrenzung zum Consistency Training
Neben der Destillation gibt es das Consistency Training (CT), das ganz ohne vortrainiertes Diffusionsmodell auskommt und das Modell direkt von Grund auf lernt. CD ist der schnellere Weg, wenn bereits ein gutes Diffusionsmodell existiert, CT der flexiblere für den Aufbau von Grund auf. In den Experimenten des Papers übertrafen beide Varianten bestehende Destillationstechniken bei Ein- und Wenig-Schritt-Sampling.
Verwandte Grundlagen: Neural ODE.