Menu
Coddy logo textTech

Les tokens dans d'autres langues

Fait partie de la section Fondamentaux du Journey AI Prompts de Coddy. Leçon 11 sur 23.

La plupart des modèles d’IA ont été entraînés principalement sur des textes en anglais. Cela a une conséquence surprenante : les langues autres que l’anglais utilisent souvent davantage de jetons pour exprimer le même sens.

Le mot hello en anglais constitue généralement un seul token. Mais ses équivalents dans d’autres langues peuvent être segmentés différemment :

LangueMotNombre approximatif de tokens
Anglaishello1
Espagnolhola1
Japonaisこんにちは3-5
Arabeمرحبا2-4
Russeпривет2-3

Les langues utilisant des écritures non latines, comme le chinois, le japonais, le coréen, l’arabe ou l’hindi, ont tendance à utiliser beaucoup plus de tokens. Une phrase qui nécessite 10 tokens en anglais peut en nécessiter 20 ou 30 en japonais.

Cela a son importance pour des raisons pratiques. Si tu travailles dans une langue autre que l’anglais, tu atteindras plus rapidement les limites de la fenêtre de contexte, les réponses pourront coûter plus cher et la génération prendra peut-être un peu plus de temps. Ce n’est pas que l’IA soit moins performante dans ces langues. Elle les traite simplement de manière moins efficace au niveau des tokens.

Essayez vous-même

Cette leçon ne comprend pas de défi de code.

quiz iconTestez-vous

Cette leçon comprend un petit quiz. Commencez la leçon pour y répondre et suivre votre progression.

Toutes les leçons de Fondamentaux