LLM-Grundlagen: Token, Kontext und Temperatur
Große Sprachmodelle (LLMs) sagen Wort für Wort (bzw. Token für Token) das nächste Token voraus. Wer die Grundbegriffe kennt, nutzt sie besser.
Token
Ein Token ist ein Textbaustein – ca. 3-4 Zeichen im Englischen, bei Deutsch ähnlich. 1.000 Tokens ≈ 750 Wörter. Preise und Limits rechnen in Tokens.
Kontextfenster
Das Fenster (z.B. 8k, 32k, 128k, 1M Tokens) begrenzt, wie viel Text das Modell „sieht“. Alles darüber muss zusammengefasst oder weggelassen werden. Längerer Kontext kostet mehr Rechenzeit und kann die Qualität senken („Lost in the Middle“).
Temperatur
- 0.0-0.3: deterministisch – für Code, Fakten, Extraktion.
- 0.7-1.0: kreativ – für Texte, Ideen.
- >1.0: sehr zufällig – selten sinnvoll.
Top-p und Top-k
Top-p (Nucleus Sampling) wählt aus den wahrscheinlichsten Tokens, die zusammen p ausmachen. Top-k begrenzt auf die k wahrscheinlichsten. Zusammen mit Temperatur steuern sie die Zufälligkeit.
Kosten
Eingabe (Prompt) ist meist 3-10x günstiger als Ausgabe. Caching, kleinere Modelle für einfache Aufgaben und Batch-Verarbeitung senken Kosten.
Weiterführend: KI: LLM & Agenten.