Context Window
Das Context Window (Kontextfenster) ist die maximale Menge an Text - gemessen in Tokens -, die ein Sprachmodell bei der Beantwortung einer Anfrage gleichzeitig berücksichtigen kann.
Kurz erklärt
Alles, was ein Sprachmodell bei der Generierung einer Antwort “sieht” - der Prompt, mitgelieferte Dokumente, vorherige Gesprächsverläufe und die bisher generierte Antwort selbst - muss innerhalb des Kontextfensters liegen. Wird diese Grenze überschritten, muss älterer Kontext gekürzt oder weggelassen werden, wodurch das Modell darauf keinen Zugriff mehr hat.
Beispiel
Ein Modell mit einem Kontextfenster von 100.000 Tokens kann etwa ein mittellanges Buch vollständig als Kontext verarbeiten. Ein sehr langes Gespräch oder ein umfangreiches Dokumentenset kann dieses Limit jedoch überschreiten, sodass frühere Teile des Gesprächs für das Modell nicht mehr sichtbar sind.
Warum ist das relevant?
Die Größe des Kontextfensters bestimmt maßgeblich, für welche Aufgaben ein Modell praktikabel einsetzbar ist - etwa die Analyse langer Verträge, umfangreicher Codebasen oder mehrstündiger Gesprächsverläufe. Systeme wie RAG wurden unter anderem entwickelt, um mit begrenzten Kontextfenstern dennoch auf große externe Wissensbestände zugreifen zu können, indem nur die jeweils relevanten Ausschnitte in den Kontext geladen werden.
Häufige Missverständnisse
Ein größeres Kontextfenster bedeutet nicht automatisch, dass ein Modell alle enthaltenen Informationen gleich gut nutzt - bei sehr langen Kontexten kann die Qualität der Antwort abnehmen, wenn relevante Informationen “in der Mitte” eines langen Textes untergehen. Auch verbraucht ein größeres Kontextfenster in der Regel mehr Rechenleistung und ist entsprechend teurer in der Nutzung.