Die harte Grenze hinter jedem KI-Gespräch. Warum sie eine Eigenschaft und kein Fehler ist, und warum ein größeres Fenster nicht gleichmäßig besser ist.
Jedes Gespräch mit einer KI hat eine harte Grenze, einen Punkt, ab dem sie nicht mehr sieht, was davor war. Die meisten haben sie längst erreicht, ohne es zu merken. Die Wiederholungen, die Widersprüche, die vergessenen Anweisungen sind keine Fehler. Sie sind eine grundlegende Eigenschaft dieser Modelle.
Ein Kontextfenster ist die maximale Textmenge, Eingabe und Ausgabe zusammen, die ein Modell in einer Interaktion verarbeiten kann. Alles außerhalb ist für das Modell unsichtbar. Alles darin ist das, womit es tatsächlich arbeitet.
Der Schreibtisch-Vergleich macht es greifbar. Du hast eine feste Fläche. Du kannst nur so viele Dokumente ausbreiten. Ist der Tisch voll und du legst eins dazu, fällt am anderen Ende etwas herunter. Das Modell kann nicht sehen, was auf dem Boden liegt.
Kontext wird in Tokens gemessen, grob drei bis vier Zeichen pro Token. Eine Geschäftsmail hat etwa 200 Tokens. Ein ganzes Buch geht in die Hunderttausende. Die Größen unterscheiden sich stark: Claude liegt bei den meisten Modellen bei 200.000 Tokens, mit experimentellen Funktionen bei einer Million, GPT-4 bei 128.000, manche kleineren Modelle nur bei 4.000 bis 8.000.
Alles konkurriert um dieselbe feste Ressource: der System-Prompt, der Gesprächsverlauf, über RAG geholte Dokumente und deine aktuelle Nachricht. Nähert man sich der Grenze, verhalten sich Modelle unterschiedlich. Manche schneiden das Älteste ab, manche fassen zusammen, manche hören einfach auf.
Die Annahme, die korrigiert gehört: Ein größeres Fenster bedeutet nicht gleiche Aufmerksamkeit über die gesamte Länge. Forschung zeigt, dass Modelle mit Informationen in der Mitte eines langen Kontexts Schwierigkeiten haben. Anfang und Ende bekommen die meiste Aufmerksamkeit. Das ist das dokumentierte Lost-in-the-Middle-Problem. Ein großes Fenster ist nützlich, aber nicht gleichmäßig verlässlich, und du bezahlst jeden Token, den du hineinschiebst.
| Modell oder Begriff | Größe oder Bedeutung | Was das für dich heißt |
|---|---|---|
| Token | Grob drei bis vier Zeichen | Kein Wort, kein Buchstabe. Die Einheit, in der alles gemessen wird. |
| Geschäftsmail | Etwa 200 Tokens | Ein brauchbarer Anhaltspunkt zum Schätzen. |
| Claude | 200.000 Tokens in den meisten Modellen, experimentell bis 1 Million | Verarbeitet lange Dokumente bequem. |
| GPT-4 | 128.000 Tokens | Immer noch groß, merklich kleiner als Claude. |
| Kleinere Modelle | 4.000 bis 8.000 Tokens | Ein 100-seitiges Vertragsdokument passt nicht. Du musst es zerteilen. |
| Was es füllt | System-Prompt, Verlauf, RAG-Dokumente, deine Nachricht | Alles konkurriert um denselben festen Platz. |
| Lost in the Middle | Aufmerksamkeit sinkt für Inhalt in der Mitte | Setz das Wichtige an den Anfang oder ans Ende. |
Ein Kontextfenster ist die maximale Textmenge, Eingabe und Ausgabe zusammen, die ein KI-Modell in einer Interaktion verarbeiten kann. Alles außerhalb ist für das Modell unsichtbar. Alles darin ist das, womit es tatsächlich arbeitet.
Weil es das Fenster verlassen hat. Das Gespräch hat den verfügbaren Platz gefüllt, und die ältesten Teile sind über die Kante gefallen. Das ist kein Fehler, sondern eine grundlegende Eigenschaft dieser Modelle.
Ein Token sind grob drei bis vier Zeichen, kein ganzes Wort und kein einzelner Buchstabe. Kontextfenster werden in Tokens gemessen. Eine Geschäftsmail hat etwa 200 Tokens, ein ganzes Buch geht in die Hunderttausende.
Nein. Forschung zeigt, dass Modelle mit Informationen in der Mitte eines sehr langen Kontexts oft Schwierigkeiten haben, während Anfang und Ende die meiste Aufmerksamkeit bekommen. Das ist das dokumentierte Lost-in-the-Middle-Problem. Außerdem bezahlst du jeden Token, den du hineinschiebst.
Nein. Kontextfenster bestehen über Sitzungen hinweg nicht. Jedes neue Gespräch startet frisch, das Fenster wird zurückgesetzt. Langzeitgedächtnis ist ein eigenes Architekturproblem, das das Kontextfenster nicht löst.
Der System-Prompt, der Gesprächsverlauf, über RAG geholte Dokumente und deine aktuelle Nachricht. Alles konkurriert um dieselbe feste Ressource, weshalb lange Gespräche mit großen abgerufenen Dokumenten am schnellsten an die Grenze stoßen.
Für dieses Video gibt es keine manuelle Untertitelspur. Diese Seite nutzt deshalb eine geprüfte Kapitel-Zusammenfassung, statt automatisch erzeugte Untertitel als Transkript zu veröffentlichen.
Jedes Gespräch mit einer KI hat eine harte Grenze, einen Punkt, ab dem sie nicht mehr sieht, was davor war. Die meisten haben sie längst erreicht, ohne es zu wissen. Das ist Teil sechs der Serie.
Warum KI in langen Gesprächen den Faden verliert, sich wiederholt, widerspricht und Anweisungen vergisst. Kein Fehler, sondern eine grundlegende Eigenschaft dieser Modelle, und wer sie versteht, baut anders damit.
Die Definition. Ein Kontextfenster ist die maximale Textmenge, Eingabe und Ausgabe zusammen, die ein Modell in einer Interaktion verarbeiten kann. Außerhalb ist unsichtbar, innerhalb ist das, womit es arbeitet.
Der Schreibtisch-Vergleich. Eine feste Fläche, nur so viele Dokumente gleichzeitig. Ist der Tisch voll und du legst eins dazu, fällt am anderen Ende etwas herunter. Das Modell kann nicht sehen, was auf dem Boden liegt.
Tokens als Einheit. Grob drei bis vier Zeichen pro Token, kein ganzes Wort und kein einzelner Buchstabe. Eine Geschäftsmail hat etwa 200 Tokens, ein ganzes Buch Hunderttausende.
Die Größen im Vergleich. Claude bei 200.000 Tokens in den meisten Modellen, experimentell bis zu einer Million, GPT-4 bei 128.000, manche kleineren Modelle nur bei 4.000 bis 8.000. Bei einem 100-seitigen Vertragsdokument entscheidet dieser Unterschied, ob du es überhaupt verarbeiten kannst oder zerteilen musst.
Was um den Platz konkurriert: System-Prompt, Gesprächsverlauf, über RAG geholte Dokumente und deine aktuelle Nachricht. Nähert sich die Grenze, verhalten sich Modelle unterschiedlich, manche schneiden Ältestes ab, manche fassen zusammen, manche hören einfach auf.
Die Korrektur, auf die es ankommt. Ein größeres Fenster bedeutet nicht gleiche Aufmerksamkeit über die ganze Länge. Forschung zeigt, dass Modelle mit Inhalt in der Mitte Schwierigkeiten haben, während Anfang und Ende die meiste Aufmerksamkeit bekommen. Das ist das dokumentierte Lost-in-the-Middle-Problem.
Zwei weitere Grenzen. Ein großes Fenster garantiert nicht die korrekte Nutzung von allem darin, und du bezahlst jeden Token, den du hineinschiebst. Kontextfenster bestehen außerdem nicht über Sitzungen hinweg, jedes Gespräch startet frisch. Langzeitgedächtnis ist ein eigenes Architekturproblem.
Das Fazit: Die KI hat vergessen, weil es das Fenster verlassen hat, der Tisch voll war und das Gespräch über die Kante fiel. Jetzt kannst du um die Grenze herum bauen. Als Nächstes: was passiert, wenn ein Agent nicht reicht.
Ich arbeite 1:1 mit Selbstständigen, Beratern, Coaches und kleinen Teams an praktischen KI-Workflows und Automatisierung. Das Erstgespräch ist kostenlos, dauert 15 Minuten und ist kein Verkaufsgespräch.
Kostenloses Erstgespräch buchen