Zum Hauptinhalt springen
Menü

Kontextfenster

Das Kontextfenster ist die maximale Menge an Text, gemessen in Token, die ein Sprachmodell bei einer einzelnen Anfrage gleichzeitig verarbeiten kann.

Das Kontextfenster bezeichnet die maximale Anzahl an Token, die ein Sprachmodell innerhalb einer Verarbeitung berücksichtigen kann.

Je nach Modell und Anbieter teilen sich Eingabe und mögliche Ausgabe dieses Budget oder unterliegen zusätzlichen Einzelgrenzen. Wird ein Grenzwert überschritten, muss die Anwendung Kontext kürzen, aufteilen oder die Anfrage ablehnen.

Warum das Kontextfenster begrenzt ist

Die unterstützte Kontextlänge hängt von Modellarchitektur, Training, Laufzeitumgebung und den Grenzen des jeweiligen Angebots ab.

Mehr Kontext benötigt in der Regel zusätzliche Rechenleistung und Speicher. Wie sich Aufwand, Latenz und Kosten entwickeln, unterscheidet sich jedoch nach Modell und technischer Implementierung.

Die unterstützte Token-Anzahl unterscheidet sich deutlich zwischen Modellen und kann sich mit neuen Versionen ändern. Verbindlich ist daher die Dokumentation der konkret eingesetzten Modellversion.

Eine Umrechnung von Token in Wörter liefert nur eine grobe Schätzung, da Sprache, Schreibweise und Tokenisierung das Verhältnis beeinflussen.

Warum größer nicht automatisch besser ist

Ein größeres Kontextfenster erlaubt mehr Dokumente oder einen längeren Verlauf innerhalb einer Anfrage. Die bloße Verfügbarkeit dieses Platzes sagt jedoch nichts darüber aus, wie zuverlässig das Modell jede enthaltene Information berücksichtigt.

Relevante, gut strukturierte Auswahl bleibt daher wichtiger als möglichst viel Kontext.

Was das für Architekturentscheidungen bedeutet

Für Agenten, Dokumentanalyse oder lange Dialoge ist die Kontextlänge eine konkrete Architekturgrenze. Mehr verarbeiteter Kontext beeinflusst außerdem Inferenzkosten, Latenz und gegebenenfalls Ergebnisqualität.

Legen Sie fest, welche Informationen für den jeweiligen Schritt erforderlich sind, wie ältere Inhalte verdichtet werden und wann eine externe Wissens- oder Zustandsspeicherung geeigneter ist.

Verwandte Begriffe

Verwandte Begriffe

Token

Ein Token ist eine Verarbeitungseinheit für Text, häufig ein Wort, Wortteil oder Satzzeichen. Token bestimmen unter anderem Kosten, Geschwindigkeit und Kontextgröße.

Begriff ansehen

Inferenz

Inferenz ist der Vorgang, bei dem ein bereits trainiertes KI-Modell eine Eingabe verarbeitet und eine Ausgabe erzeugt, im Unterschied zum Training, bei dem das Modell selbst angepasst wird.

Begriff ansehen

Passende Themen

Passende Themen

Agentic Engineering

Wie Entwicklungsteams Coding-Agents wiederholbar einsetzen und gemeinsame Regeln für Aufgaben, Kontext, Daten und Review entwickeln.

Übersicht ansehen

Passende Leistungen

Passende Leistungen

Softwareentwicklung

Für neue Produkte und bestehende Systeme, bei denen KI, Schnittstellen, Wartbarkeit und Betrieb gemeinsam geplant werden müssen.

Übersicht ansehen

Was möchten Sie technisch klären oder umsetzen?

Schildern Sie kurz die Ausgangslage, Ihr Ziel und die beteiligten Systeme. Wir melden uns mit einer fachlichen Einschätzung und einem Vorschlag für den nächsten sinnvollen Schritt.

Anfrage stellen