KI-Sprachmodelle lesen keine Buchstaben oder Wörter. Sie lesen Tokens: kleine Textstücke, oft ein ganzes Wort, manchmal ein Teil davon. Und sie können nur eine begrenzte Zahl an Tokens auf einmal aufnehmen, eine Grenze, die Kontextfenster heißt (englisch Context Window). Diese zwei Ideen erklären, warum KI-Tools so bepreist sind, wie sie sind, warum lange Chats frühe Anweisungen vergessen und warum ein Modell Mühe haben kann, die Buchstaben in einem Wort zu zählen, das es gerade richtig geschrieben hat.
Was ist ein Token in der KI?
Bevor ein Modell deinen Prompt sieht, zerlegt ein Programm namens Tokenizer den Text in Stücke aus einem festen Vokabular und macht aus jedem Stück eine Zahl. Das Modell arbeitet ausschließlich mit diesen Zahlen, und es schreibt seine Antwort genauso, Token für Token, die die App wieder in Text umwandelt.
Das Vokabular wird aus großen Textmengen gelernt, deshalb sind häufige Wörter meist ein einzelnes Token, und seltenere Wörter werden in mehrere vertraute Stücke zerlegt. Ein Leerzeichen hängt oft am Anfang des folgenden Wortes. Ein englischer Satz könnte ungefähr so zerlegt werden:
Token ization isn 't magic .
Diese Zerlegung dient nur der Veranschaulichung. Jede Modellfamilie hat ihren eigenen Tokenizer, und derselbe Satz kann bei jedem in eine andere Zahl von Stücken zerfallen. Viele Anbieter veröffentlichen ein Tokenizer-Tool oder eine API zum Zählen von Tokens, damit du echte Zahlen prüfen kannst.
Auch Bilder, Audio und Dateien werden in Tokens umgewandelt, wenn ein Modell sie annimmt, und deshalb verbraucht ein angehängter Screenshot einen Teil desselben Budgets wie dein Text.
Wie viele Tokens hat ein Wort?
Für englischen Text gilt als verbreitete Faustregel etwa vier Zeichen pro Token, also ungefähr drei Viertel eines Wortes. Nach dieser Schätzung sind 1.000 Tokens etwa 750 englische Wörter, und ein Artikel mit 3.000 Wörtern hat etwa 4.000 Tokens.
Das Verhältnis verschiebt sich mit dem Inhalt:
- Andere Sprachen brauchen für dieselbe Bedeutung oft mehr Tokens. Tokenizer werden mit Daten trainiert, in denen Englisch stark vertreten ist, deshalb bekommen englische Wörter kompakte Tokens, während Text auf Japanisch, Koreanisch, Arabisch, Hindi und in vielen anderen Sprachen in mehr Stücke zerfällt. Auch deutsche Texte mit ihren langen zusammengesetzten Wörtern kosten meist mehr Tokens als die englische Fassung. Der Abstand hängt vom Tokenizer ab und ist bei neueren kleiner geworden, aber nicht verschwunden.
- Code verbraucht Tokens für Einrückung, Klammern, Operatoren und lange Bezeichner, deshalb kostet eine Datei oft mehr Tokens, als ihre Wortzahl vermuten lässt.
- Zahlen, URLs und ungewöhnliche Zeichenketten wie IDs und Hashes werden meist in viele kleine Tokens zerlegt.
Warum Tokens wichtig sind
Kosten. APIs rechnen pro Token ab, mit getrennten Preisen für die Tokens, die du schickst, und die Tokens, die das Modell schreibt. In einem Chat wird das ganze Gespräch mit jeder neuen Nachricht erneut gesendet, deshalb kostet ein langes Gespräch pro Nachricht mehr als ein kurzes.
Grenzen. Ein Modell hat ein Kontextfenster für alles, was es in einer Anfrage liest und schreibt, und oft eine eigene Obergrenze dafür, wie lang eine einzelne Antwort sein darf. In der API kannst du diese Grenze selbst setzen, und bei Anthropics API musst du es: max_tokens ist ein Pflichtparameter.
Geschwindigkeit. Die Antwort entsteht Token für Token, also dauert eine längere Antwort entsprechend länger.
Buchstabieraufgaben. Weil ein Modell ein Wort wie magic als eine oder zwei Einheiten sieht und nicht als fünf Buchstaben, sind Aufgaben, die von einzelnen Zeichen abhängen, etwa Buchstaben zählen, ein Wort rückwärts schreiben oder Wörter mit genau einer bestimmten Länge finden, für das Modell schwerer, als sie aussehen. Neuere Modelle kommen mit vielen davon besser zurecht, aber wenn es auf die Zeichen ankommt, prüf die Antwort oder bitte das Modell, das Wort zuerst Buchstabe für Buchstabe auszuschreiben.
Was ist ein Kontextfenster?
Das Kontextfenster ist die maximale Zahl an Tokens, die ein Modell in einer einzelnen Anfrage berücksichtigen kann. Stell es dir als Arbeitsgedächtnis des Modells vor: Alles, was das Modell zum Schreiben seiner Antwort nutzen kann, muss gleichzeitig hineinpassen, darunter:
- der System-Prompt, also die Anweisungen der App und deine eigenen
- das bisherige Gespräch, jede User-Nachricht und jede Antwort
- angehängte Dateien, eingefügte Dokumente und Such- oder Tool-Ergebnisse
- die Antwort, die gerade geschrieben wird
Alles außerhalb des Fensters existiert für das Modell nicht. Es gibt kein Hintergrundgedächtnis, in dem es nachschlagen könnte. Die Größe von Kontextfenstern unterscheidet sich stark zwischen Modellen und wächst ständig, also schau in der Dokumentation deines Anbieters nach, statt dich auf eine Zahl aus einem Artikel zu verlassen.
Das Modell behält auch zwischen Anfragen nichts. Was in einem Chat wie Gedächtnis aussieht, ist die App, die jedes Mal das ganze Gespräch erneut schickt. Gedächtnisfunktionen in Chat-Apps funktionieren genauso: Die App speichert Notizen über dich oder durchsucht deine früheren Chats und fügt das Gefundene in den Kontext neuer Chats ein.
Was passiert, wenn ein Chat lang wird
Wenn ein Gespräch über das Kontextfenster hinauswächst, muss etwas nachgeben. Je nach App werden die ältesten Nachrichten weggelassen, ältere Teile durch eine Zusammenfassung ersetzt, oder du erfährst, dass der Chat sein Limit erreicht hat und du einen neuen beginnen sollst. In jedem Fall können Details vom Anfang, auch Anweisungen aus deiner ersten Nachricht, ihre Wirkung auf die Antworten verlieren.
Ein volles Fenster ist nicht das einzige Problem. Je mehr Material ein Modell vor sich hat, desto mehr kann es übersehen, und in einem langen Chat konkurrieren die frühen Entscheidungen mit allem, was seitdem gesagt wurde. Anzeichen sind Antworten, die eine früher gesetzte Vorgabe ignorieren, Code, der auf eine Version zurückfällt, die du schon korrigiert hast, oder ein Modell, das eine Idee wiederholt, die du abgelehnt hast.
Mit dem Kontextfenster arbeiten
Starte für jede Aufgabe einen neuen Chat. Ein frischer Chat mit einer klaren ersten Nachricht schlägt meist einen langen Chat, der durch mehrere Themen gedriftet ist.
Nimm eine Zusammenfassung mit. Wenn in einem Chat nützliche Entscheidungen zusammengekommen sind, bitte um eine Zusammenfassung, die sich in einen neuen Chat einfügen lässt, und mach dort weiter. Füll die Lücken unten passend zu deiner Arbeit aus.
Ziel: eine Datenbank für eine kleine Bibliotheks-App, gespeichert in SQLite.
Entscheidungen:
- Ausleihen bekommen eine eigene Tabelle, damit die komplette Ausleihhistorie erhalten bleibt.
- Ein Buch gilt als verfügbar, wenn es keine Ausleihe mit leerem
returned_athat.
Aktuelles Schema:
CREATE TABLE books (id INTEGER PRIMARY KEY, title TEXT NOT NULL, author TEXT NOT NULL);
CREATE TABLE members (id INTEGER PRIMARY KEY, name TEXT NOT NULL, email TEXT UNIQUE);
CREATE TABLE loans (
id INTEGER PRIMARY KEY,
book_id INTEGER NOT NULL REFERENCES books(id),
member_id INTEGER NOT NULL REFERENCES members(id),
loaned_at TEXT NOT NULL,
returned_at TEXT
);
Offene Fragen:
- Brauchen wir Mahngebühren?
- Soll die Bibliothek mehrere Exemplare desselben Buches verwalten?
Füg nur ein, was die Aufgabe braucht. Die Funktion mit dem Bug und den Code, der sie aufruft, nicht das ganze Repository. Den fraglichen Abschnitt des Vertrags, nicht alle vierzig Seiten. Weniger Material heißt weniger zu übersehen.
Stell die Frage nach langem Material und wiederhole, was wichtig ist. Wenn du ein langes Dokument einfügst, stell deine Frage am Ende, danach, und wiederhole dort die wichtigsten Vorgaben. Die Anweisung steht dann direkt an der Stelle, an der das Modell zu schreiben beginnt.
Teil ein Dokument auf, das für eine Nachricht zu lang ist. Manche Apps begrenzen, wie viel du in eine einzelne Nachricht einfügen kannst, selbst wenn das Fenster des Modells mehr fassen könnte. Das Dokument in Teilen zu schicken, umgeht das Nachrichtenlimit, aber nicht das Kontextfenster: Jeder Teil zählt trotzdem mit. Sag dem Modell vorab, dass es nicht antworten soll, bis du alles geschickt hast.
Teil 1 von 3 erhalten
Zähl Tokens, wenn es darauf ankommt. Wenn du mit einer API baust, zähl vor dem Senden. OpenAIs Open-Source-Bibliothek tiktoken tokenisiert Text mit OpenAIs Tokenizern, und Anthropics API hat einen Endpunkt zum Zählen von Tokens. Zahlen vom Tokenizer eines Anbieters sind für einen anderen nur eine Schätzung.
import tiktoken
enc = tiktoken.get_encoding("o200k_base") # one of OpenAI's tokenizers
tokens = enc.encode("Tokenization isn't magic.")
print(len(tokens))
print([enc.decode([t]) for t in tokens])
Wenn du eine App um ein Modell herum baust, wird die Entscheidung, was ins Fenster kommt und in welcher Reihenfolge, zu einer eigenen Designaufgabe. Context Engineering behandelt das, und Prompt Chaining zeigt, wie du eine große Aufgabe in Schritte zerlegst, die jeweils bequem hineinpassen. Wie eine einzelne Nachricht in den gesamten Input passt, erklärt Was ist ein Prompt.
Häufig gestellte Fragen
Was ist ein Token in der KI?
Ein Token ist die Texteinheit, die ein Sprachmodell liest und schreibt. Es kann ein ganzes häufiges Wort sein, ein Teil eines längeren Wortes, ein Satzzeichen oder ein Stück Leerraum. Bevor ein Modell deinen Prompt sieht, zerlegt ein Tokenizer ihn in Tokens und macht aus jedem eine Zahl, und das Modell erzeugt seine Antwort Token für Token.
Wie viele Wörter sind 1.000 Tokens?
Für Englisch gilt als Faustregel etwa vier Zeichen pro Token, also ungefähr 750 Wörter pro 1.000 Tokens. Die echte Zahl hängt vom Tokenizer des Modells und vom Text ab. Code, Zahlen und viele Sprachen außer Englisch, auch Deutsch mit seinen langen zusammengesetzten Wörtern, brauchen für dieselbe Menge Inhalt mehr Tokens.
Was ist ein Kontextfenster?
Das Kontextfenster (englisch Context Window) ist die maximale Zahl an Tokens, die ein Modell in einer Anfrage berücksichtigen kann. Darin müssen der System-Prompt, das bisherige Gespräch, angehängte Dateien oder Tool-Ergebnisse und die Antwort, die das Modell gerade schreibt, Platz finden. Alles außerhalb existiert für das Modell nicht.
Was passiert, wenn ein Chat das Kontextfenster überschreitet?
Die App muss Platz schaffen. Je nach App lässt sie die ältesten Nachrichten weg, ersetzt sie durch eine Zusammenfassung oder sagt dir, dass das Gespräch sein Limit erreicht hat. So oder so können Anweisungen und Details vom Anfang des Chats ihre Wirkung auf die Antworten verlieren, und deshalb scheinen lange Chats manchmal Dinge zu vergessen.
Erinnert sich ChatGPT oder Claude an meine früheren Chats?
Das Modell selbst nicht. Jede Antwort entsteht aus dem, was bei dieser Anfrage im Kontextfenster steht. Manche Apps haben Gedächtnisfunktionen, die Notizen über dich speichern oder deine alten Chats durchsuchen und das Gefundene in neue Chats einfügen, und Projekte können gemeinsame Dateien und Anweisungen enthalten, aber das ist die App, die Text in den Kontext legt, nicht das Modell, das sich erinnert.