Chunking (deutsch etwa „Zerstückelung") ist das Zerlegen von Dokumenten in kleinere Textabschnitte, die Retrieval-Augmented Generation und andere Suchsysteme einzeln indexieren und abrufen können. Statt ein ganzes Handbuch als einen Block zu verarbeiten, arbeitet ein RAG-System mit überschaubaren Chunks.
Warum Chunking wichtig ist
Ein Large Language Model kann nur eine begrenzte Menge Text in seinem Kontextfenster verarbeiten. Große Dokumente passen dort nicht hinein. Chunking löst das auf zwei Arten: Es macht jeden Abschnitt klein genug für den Kontext und es verbessert die semantische Suche, weil kleine, thematisch einheitliche Einheiten präziser gefunden und bewertet werden können.
Strategien im Überblick
- Fixed-Size-Chunking: Einfachste Methode — das Dokument wird in Blöcke von N Zeichen oder Tokens geschnitten, oft mit K Zeichen Überlappung zwischen benachbarten Chunks. Typisch sind 256 bis 1024 Tokens pro Chunk mit etwa 10 Prozent Überlappung (z. B. 512 Tokens / 50 Tokens). Schnell und leicht zu debuggen, kann aber Sätze oder Gedanken mittendrin zerreißen.
- Recursive Chunking: Zerlegt zuerst an Absätzen, dann an Sätzen, zuletzt an Wörtern. Erhält die Struktur des Textes (z. B. Markdown-Überschriften) und ist der Standard für Produktionssysteme.
- Semantic Chunking: Gruppiert Sätze, die inhaltlich zusammengehören, anhand der Ähnlichkeit ihrer Embeddings. Abschnittsgrenzen folgen dem Thema statt fester Längen — bessere konzeptuelle Gruppierung, dafür rechenintensiver.
- Document-Aware und Proposition-Level: Spezialfälle für Markdown/HTML/Code oder einzelne Aussagen (Propositions) als Chunks.
Abwägung
Zu große Chunks erzeugen Rauschen im Retrieval und kosten Tokens; zu kleine Chunks reißen Zusammenhänge auseinander. Die Wahl der Strategie hängt vom Dokumenttyp ab: Handbücher profitieren von Struktur-Chunking, Chats von semantischen Einheiten. Die gewählte Chunk-Größe bestimmt maßgeblich, welche Treffer der Retriever später mit Top-k-Retrieval liefert und wie gut ein Reranking sie sortieren kann.
Verwandte Grundlagen: Vektordatenbank, Tokenizer.