Tokens in anderen Sprachen
Teil des Abschnitts Grundlagen der AI Prompts-Journey von Coddy. Lektion 11 von 23.
Die meisten KI-Modelle wurden hauptsächlich mit englischen Texten trainiert. Das hat eine überraschende Folge: Für dieselbe Bedeutung benötigen nicht-englische Sprachen oft mehr Tokens.
Das Wort hello im Englischen ist typischerweise ein Token. Seine Entsprechungen in anderen Sprachen können jedoch anders aufgeteilt sein:
| Sprache | Wort | Ungefähre Anzahl an Tokens |
|---|---|---|
| Englisch | hello | 1 |
| Spanisch | hola | 1 |
| Japanisch | こんにちは | 3-5 |
| Arabisch | مرحبا | 2-4 |
| Russisch | привет | 2-3 |
Sprachen mit nicht-lateinischen Schriftsystemen wie Chinesisch, Japanisch, Koreanisch, Arabisch oder Hindi benötigen tendenziell deutlich mehr Tokens. Ein Satz, der im Englischen 10 Tokens umfasst, kann im Japanischen 20 oder 30 Tokens erfordern.
Das ist aus praktischen Gründen wichtig. Wenn du in einer nicht englischsprachigen Sprache arbeitest, erreichst du schneller die Grenzen des Kontextfensters, Antworten können mehr kosten und die Generierung kann etwas länger dauern. Das bedeutet nicht, dass die KI diese Sprachen schlechter beherrscht. Sie verarbeitet sie auf Token-Ebene lediglich weniger effizient.
Probier es selbst
Diese Lektion enthält keine Programmieraufgabe.
Diese Lektion enthält ein kurzes Quiz. Starte die Lektion, um es zu beantworten und deinen Fortschritt zu speichern.
Alle Lektionen in Grundlagen
2Wie die KI dich liest – Tokens
Was sind Tokens?Wörter ≠ TokensWarum die Token-Anzahl wichtig istDas KontextfensterTokens in anderen SprachenSpezielle Tokens, die man nie sieht3Deine ersten Prompts schreiben
KI spricht Markdown (standardmäßig)Das Ausgabeformat steuernTonfall und Stil steuernWenn die KI dich ignoriert