Les tokens dans d'autres langues
Fait partie de la section Fondamentaux du Journey AI Prompts de Coddy. Leçon 11 sur 23.
La plupart des modèles d’IA ont été entraînés principalement sur des textes en anglais. Cela a une conséquence surprenante : les langues autres que l’anglais utilisent souvent davantage de jetons pour exprimer le même sens.
Le mot hello en anglais constitue généralement un seul token. Mais ses équivalents dans d’autres langues peuvent être segmentés différemment :
| Langue | Mot | Nombre approximatif de tokens |
|---|---|---|
| Anglais | hello | 1 |
| Espagnol | hola | 1 |
| Japonais | こんにちは | 3-5 |
| Arabe | مرحبا | 2-4 |
| Russe | привет | 2-3 |
Les langues utilisant des écritures non latines, comme le chinois, le japonais, le coréen, l’arabe ou l’hindi, ont tendance à utiliser beaucoup plus de tokens. Une phrase qui nécessite 10 tokens en anglais peut en nécessiter 20 ou 30 en japonais.
Cela a son importance pour des raisons pratiques. Si tu travailles dans une langue autre que l’anglais, tu atteindras plus rapidement les limites de la fenêtre de contexte, les réponses pourront coûter plus cher et la génération prendra peut-être un peu plus de temps. Ce n’est pas que l’IA soit moins performante dans ces langues. Elle les traite simplement de manière moins efficace au niveau des tokens.
Essayez vous-même
Cette leçon ne comprend pas de défi de code.
Cette leçon comprend un petit quiz. Commencez la leçon pour y répondre et suivre votre progression.
Toutes les leçons de Fondamentaux
2Comment l'IA vous lit — Les Tokens
Qu'est-ce qu'un token ?Mots ≠ TokensPourquoi le nombre de tokens est importantLa fenêtre de contexteLes tokens dans d'autres languesLes tokens spéciaux que vous ne voyez jamais3Rédiger vos premiers prompts
L'IA parle Markdown (par défaut)Contrôler le format de sortieContrôler le ton et le styleQuand l'IA vous ignore