الكلمات ≠ الرموز (Tokens)
جزء من قسم Fundamentals في رحلة AI Prompts على Coddy — الدرس 8 من 23.
من الأخطاء الشائعة افتراض أن الكلمة الواحدة تساوي رمزاً واحداً (token). الأمر لا يسير على هذا النحو.
كلمة cat هي رمز (token) واحد. لكن cats؟ قد تكون رمزين: cat و s. كلمة hello هي رمز واحد، لكن Hello التي تبدأ بحرف H كبير قد يتم تقسيمها إلى رموز (tokenized) بشكل مختلف.
تؤثر المسافات وعلامات الترقيم وحالة الأحرف جميعها على كيفية تقسيم النص.
إليك بعض الأمثلة المفاجئة:
| النص | الرموز التقريبية |
|---|---|
dog | 1 |
dogs | 1-2 |
extraordinary | 2-3 |
123456 | 2-3 |
!!! | 1-3 |
الأرقام خادعة بشكل خاص. قد تعتقد أن 1000 هو رمز واحد (token)، ولكن يمكن تقسيمه إلى 100 و 0، أو حتى رقماً تلو الآخر. لهذا السبب يواجه الذكاء الاصطناعي أحياناً صعوبة في الرياضيات الدقيقة - فهو لا يرى الأرقام بالطريقة التي تراها أنت.
الفكرة الأساسية: أعداد الرموز (tokens) غير متوقعة إذا كنت تكتفي بعدّ الكلمات. فالمطالبة المكونة من 100 كلمة قد تستهلك 130 رمزاً، أو 150، اعتماداً على الكلمات المحددة التي اخترتها.
راقب عداد الرموز في لوحة الدردشة أثناء الكتابة—ستلاحظ أنه لا يزداد بمقدار رمز واحد بالضبط لكل كلمة.
جرّب بنفسك
لا يتضمّن هذا الدرس تحدّيًا برمجيًا.
يتضمن هذا الدرس اختبارًا قصيرًا. ابدأ الدرس للإجابة عليه وتتبّع تقدمك.
جميع دروس Fundamentals
2كيف يقرأك الذكاء الاصطناعي — الرموز (Tokens)
ما هي الرموز (Tokens)؟الكلمات ≠ الرموز (Tokens)لماذا يهم عدد الرموز (Tokens)؟نافذة السياق (Context Window)الرموز (Tokens) في اللغات الأخرىرموز (Tokens) خاصة لا تراها أبداً