Kontextfenster
Das Kontextfenster ist die maximale Menge an Text, gemessen in Token, die ein Sprachmodell bei einer einzelnen Anfrage gleichzeitig verarbeiten kann.
Das Kontextfenster bezeichnet die maximale Anzahl an Token, die ein Sprachmodell innerhalb einer Verarbeitung berücksichtigen kann.
Je nach Modell und Anbieter teilen sich Eingabe und mögliche Ausgabe dieses Budget oder unterliegen zusätzlichen Einzelgrenzen. Wird ein Grenzwert überschritten, muss die Anwendung Kontext kürzen, aufteilen oder die Anfrage ablehnen.
Warum das Kontextfenster begrenzt ist
Die unterstützte Kontextlänge hängt von Modellarchitektur, Training, Laufzeitumgebung und den Grenzen des jeweiligen Angebots ab.
Mehr Kontext benötigt in der Regel zusätzliche Rechenleistung und Speicher. Wie sich Aufwand, Latenz und Kosten entwickeln, unterscheidet sich jedoch nach Modell und technischer Implementierung.
Die unterstützte Token-Anzahl unterscheidet sich deutlich zwischen Modellen und kann sich mit neuen Versionen ändern. Verbindlich ist daher die Dokumentation der konkret eingesetzten Modellversion.
Eine Umrechnung von Token in Wörter liefert nur eine grobe Schätzung, da Sprache, Schreibweise und Tokenisierung das Verhältnis beeinflussen.
Warum größer nicht automatisch besser ist
Ein größeres Kontextfenster erlaubt mehr Dokumente oder einen längeren Verlauf innerhalb einer Anfrage. Die bloße Verfügbarkeit dieses Platzes sagt jedoch nichts darüber aus, wie zuverlässig das Modell jede enthaltene Information berücksichtigt.
Relevante, gut strukturierte Auswahl bleibt daher wichtiger als möglichst viel Kontext.
Was das für Architekturentscheidungen bedeutet
Für Agenten, Dokumentanalyse oder lange Dialoge ist die Kontextlänge eine konkrete Architekturgrenze. Mehr verarbeiteter Kontext beeinflusst außerdem Inferenzkosten, Latenz und gegebenenfalls Ergebnisqualität.
Legen Sie fest, welche Informationen für den jeweiligen Schritt erforderlich sind, wie ältere Inhalte verdichtet werden und wann eine externe Wissens- oder Zustandsspeicherung geeigneter ist.
Verwandte Begriffe
Verwandte Begriffe
Token
Ein Token ist eine Verarbeitungseinheit für Text, häufig ein Wort, Wortteil oder Satzzeichen. Token bestimmen unter anderem Kosten, Geschwindigkeit und Kontextgröße.
Begriff ansehen
Inferenz
Inferenz ist der Vorgang, bei dem ein bereits trainiertes KI-Modell eine Eingabe verarbeitet und eine Ausgabe erzeugt, im Unterschied zum Training, bei dem das Modell selbst angepasst wird.
Begriff ansehen
Passende Themen
Passende Themen
Agentic Engineering
Wie Entwicklungsteams Coding-Agents wiederholbar einsetzen und gemeinsame Regeln für Aufgaben, Kontext, Daten und Review entwickeln.
Übersicht ansehen
Passende Leistungen
Passende Leistungen
Softwareentwicklung
Für neue Produkte und bestehende Systeme, bei denen KI, Schnittstellen, Wartbarkeit und Betrieb gemeinsam geplant werden müssen.
Übersicht ansehen
Was möchten Sie technisch klären oder umsetzen?
Schildern Sie kurz die Ausgangslage, Ihr Ziel und die beteiligten Systeme. Wir melden uns mit einer fachlichen Einschätzung und einem Vorschlag für den nächsten sinnvollen Schritt.