Tokens en otros idiomas
Parte de la sección Fundamentos del Journey de AI Prompts de Coddy — lección 11 de 23.
La mayoría de los modelos de IA se entrenaron principalmente con texto en inglés. Esto tiene una consecuencia sorprendente: los idiomas que no son el inglés suelen utilizar más tokens para el mismo significado.
La palabra hello en inglés es normalmente un token. Pero sus equivalentes en otros idiomas podrían dividirse de manera diferente:
| Idioma | Palabra | Tokens aproximados |
|---|---|---|
| Inglés | hello | 1 |
| Español | hola | 1 |
| Japonés | こんにちは | 3-5 |
| Árabe | مرحبا | 2-4 |
| Ruso | привет | 2-3 |
Los idiomas con escrituras no latinas —como el chino, el japonés, el coreano, el árabe o el hindi— tienden a utilizar significativamente más tokens. Una oración que ocupa 10 tokens en inglés podría requerir 20 o 30 tokens en japonés.
Esto es importante por razones prácticas. Si trabajas en un idioma que no sea el inglés, alcanzarás los límites de la ventana de contexto más rápido, las respuestas pueden costar más y la generación podría tardar un poco más. No es que la IA sea peor en estos idiomas; simplemente los procesa de manera menos eficiente a nivel de tokens.
Pruébalo tú mismo
Esta lección no incluye un desafío de código.
Esta lección incluye un breve cuestionario. Empieza la lección para responderlo y registrar tu progreso.
Todas las lecciones de Fundamentos
2Cómo te lee la IA — Tokens
¿Qué son los tokens?Palabras ≠ TokensPor qué importa el conteo de tokensLa ventana de contextoTokens en otros idiomasTokens especiales que nunca ves3Escribiendo tus primeros prompts
La IA habla Markdown (por defecto)Controlando el formato de salidaControlando el tono y el estiloCuando la IA te ignora