Das Kontextfenster (Context Window) eines LLM ist die maximale Menge an Text, die das Modell in einem Durchgang verarbeiten kann — gemessen in Tokens. Es umfasst Eingabe (Prompt), Zwischenrechnung und Antwort zusammen.

Typische Größen

  • GPT-4 Turbo / GPT-4.1: 128.000 Tokens (~90.000 Wörter)
  • Claude 3/3.5: 200.000 Tokens
  • Gemini 1.5 Pro: bis zu 1 Million Tokens

Was das Kontextfenster begrenzt

Alles, was das Modell „sieht" — Systemanweisung, Dokumente, Chat-Verlauf, Zwischenergebnisse — muss ins Fenster passen. Wird es überschritten, hilft Kürzen oder Zusammenfassen. Das Fenster ist kein Langzeitgedächtnis: Nach der Antwort ist der Kontext nicht dauerhaft gespeichert; RAG umgeht die Begrenzung, indem nur relevante Wissensausschnitte nachgeladen werden.

Längere Fenster erhöhen Kosten und Antwortzeit (Aufmerksamkeit wächst quadratisch). Techniken wie Prompt Engineering, Chunking und ein guter Tokenizer halten die Nutzung effizient. Verwandte Grundlagen: LLM-Token und Kontext, RAG in der Praxis.