الرموز (Tokens) في اللغات الأخرى
جزء من قسم الأساسيات في رحلة AI Prompts على Coddy. الدرس 11 من 23.
دُرِّبت معظم نماذج الذكاء الاصطناعي أساسًا على نصوص باللغة الإنجليزية. ولهذا نتيجة مفاجئة: غالبًا ما تستخدم اللغات غير الإنجليزية عددًا أكبر من الرموز للمعنى نفسه.
كلمة hello في اللغة الإنجليزية تكون عادةً رمزًا واحدًا. لكن قد تُقسَّم مكافئاتها في اللغات الأخرى بشكل مختلف:
| اللغة | الكلمة | عدد الرموز التقريبي |
|---|---|---|
| الإنجليزية | hello | 1 |
| الإسبانية | hola | 1 |
| اليابانية | こんにちは | 3-5 |
| العربية | مرحبا | 2-4 |
| الروسية | привет | 2-3 |
تميل اللغات التي تستخدم أبجديات غير لاتينية، مثل الصينية أو اليابانية أو الكورية أو العربية أو الهندية، إلى استخدام عدد أكبر بكثير من الرموز. قد تتطلب جملة تستغرق 10 رموز في الإنجليزية 20 أو 30 رمزًا في اليابانية.
هذا مهم لأسباب عملية. إذا كنت تعمل بلغة غير الإنجليزية، فستصل إلى حدود نافذة السياق بسرعة أكبر، وقد تكون الاستجابات أكثر تكلفة، وقد يستغرق التوليد وقتًا أطول قليلًا. لا يعني ذلك أن الذكاء الاصطناعي أسوأ في التعامل مع هذه اللغات. بل إنه يعالجها بكفاءة أقل على مستوى الرموز المميزة.
جرّب بنفسك
لا يتضمّن هذا الدرس تحدّيًا برمجيًا.
يتضمن هذا الدرس اختبارًا قصيرًا. ابدأ الدرس للإجابة عليه وتتبّع تقدمك.
جميع دروس الأساسيات
2كيف يقرأك الذكاء الاصطناعي — الرموز (Tokens)
ما هي الرموز (Tokens)؟الكلمات ≠ الرموز (Tokens)لماذا يهم عدد الرموز (Tokens)؟نافذة السياق (Context Window)الرموز (Tokens) في اللغات الأخرىرموز (Tokens) خاصة لا تراها أبداً