Menu

מחשבון סטיית תקן

טבלת הסטיות שורה אחר שורה: החלק שבאמת מקבלים עליו ציון.

מאת Nethanel Bar, מייסד שותף ומנכ"ל

עדכון אחרון

רוצים לפתור את אלה בלי מחשבון?

קורס המתמטיקה של Coddy מלמד את השיטה עצמה: פותרים כל שלב על לוח אינטראקטיבי ומקבלים הסבר מדויק איפה צעד השתבש.

סטיית תקן היא מרחק ממוצע מהממוצע

קחו רשימת מספרים ואת הממוצע שלה. כל ערך נמצא במרחק כלשהו מהממוצע, וסטיית התקן היא בערך הגודל הטיפוסי של המרחקים האלה. היא לא יכולה להיות הממוצע הפשוט שלהם, כי המרחקים מעל הממוצע ומתחתיו תמיד מבטלים זה את זה בדיוק לאפס. לכן כל מרחק מועלה קודם בריבוע, מחשבים את ממוצע הריבועים, והשורש הריבועי בסוף מבטל את ההעלאה בריבוע כך שהתשובה חוזרת ליחידות המקוריות.

זו כל הנוסחה, והחלק שבאמת בודקים אתכם עליו הוא האמצע: הטבלה של כל ערך פחות הממוצע, וכל אחד מההפרשים האלה בריבוע. הדף הזה מדפיס את הטבלה הזו במלואה, עם הסכום ששתי השונויות מחלקות. מחשבונים מתחרים מדפיסים את סיגמה ועוצרים, וזה בדיוק החלק שתלמיד יכול היה לחשב בטלפון.

יש שני מחלקים וההבדל חשוב. מחלקים את הסכום ב־n כשהמספרים שלכם הם הקבוצה כולה, האוכלוסייה. מחלקים ב־n − 1 כשהם מדגם שמייצג משהו גדול יותר, כי הממוצע של מדגם יושב קצת קרוב מדי לערכים שלו עצמו, וחילוק באחד פחות מפצה על כך. שתיהן מוצגות כאן, תמיד, כך שהמחלק הוא בחירה שאתם עושים ולא בחירה שדף עושה בשבילכם.

מה כדאי לשים לב

  • סכום הסטיות תמיד שווה לאפס. זה לא צירוף מקרים: זו בדיוק ההגדרה של ממוצע, ולכן צריך להעלות בריבוע לפני שמחשבים ממוצע.
  • השונות היא התשובה לפני השורש, והיחידות שלה בריבוע: קילוגרמים הופכים לקילוגרמים בריבוע, ולכן מוציאים שורש כדי לחזור לקילוגרמים.
  • המחלק של אוכלוסייה הוא n והמחלק של מדגם הוא n − 1. התשובה של המדגם תמיד הגדולה מבין השתיים, והפער מצטמצם ככל שהרשימה גדלה.
  • סטיית תקן אף פעם אינה שלילית, והיא אפס רק כשכל הערכים זהים: אין פיזור למדוד.
  • היא נמדדת באותן יחידות כמו הנתונים, בניגוד לשונות. זו הסיבה המעשית שהיא המספר שבדרך כלל מצטטים.
  • ערך חריג יחיד מזיז אותה הרבה, כי המרחק מועלה בריבוע לפני שהוא נספר. הרגישות הזו היא יתרון כשרוצים לזהות חריגים ומטרד כשלא.

איך מחשבים סטיית תקן ידנית

  1. מצאו את הממוצע

    חברו את כל הערכים וחלקו בכמות שלהם. שמרו על דיוק: אם הממוצע הוא 7/3, אל תכתבו 2.33, כי הטעות הזו עומדת להיות מועלית בריבוע.

  2. החסירו את הממוצע מכל ערך

    אלה הסטיות. חלקן שליליות, וזה בסדר; לבדיקה, הסכום שלהן צריך להיות בדיוק אפס.

  3. העלו כל סטייה בריבוע

    ההעלאה בריבוע מסירה את הסימנים ונותנת משקל רב יותר למרחקים הגדולים. חברו את הריבועים: הסכום הזה הוא סכום הריבועים.

  4. חלקו ב־n, או ב־n − 1

    ב־n אם הערכים האלה הם כל הקבוצה שמעניינת אתכם; ב־n − 1 אם הם מדגם מתוך משהו גדול יותר. התוצאה היא השונות.

  5. הוציאו שורש ריבועי

    זו סטיית התקן. היא באותן יחידות כמו הנתונים המקוריים, מה שלא היה נכון לגבי השונות.

אוכלוסייה מול מדגם, על אותן רשימות

אותם מספרים עם שני המחלקים. שימו לב איך הפער בין שתי התשובות מצטמצם ככל שהרשימה מתארכת.

ערכיםממוצעסכום ריבועיםσ (אוכלוסייה)s (מדגם)
2, 4, 4, 4, 5, 5, 7, 953222.138
1, 2, 3, 42.551.1181.291
10, 12, 23, 23, 16, 23, 21, 16182105.1235.477
3, 3, 33000
1, 2, 47/314/31.1061.528
5, 15105057.071
2, 4, 6, 8, 106402.8283.162
100, 100, 100, 200125750043.30150

דוגמאות פתורות

הרשימה הקלאסית מספרי הלימוד: 2, 4, 4, 4, 5, 5, 7, 9

plain
2, 4, 4, 4, 5, 5, 7, 9

סכום שמונת הערכים הוא 40, ולכן הממוצע הוא 5. הסטיות הן −3, −1, −1, −1, 0, 0, 2, 4 (וסכומן אפס, כמו שחייב להיות), וסכום הריבועים שלהן הוא 32. בחילוק ב־n = 8 מתקבלת שונות 4, והשורש הריבועי הוא בדיוק 2. כמדגם זה היה 32/7, ומתקבל בערך 2.138.

למה המחלק של המדגם נותן תשובה גדולה יותר: 1, 2, 3, 4

plain
1, 2, 3, 4

הממוצע הוא 2.5 וסכום הריבועים הוא 5. בחילוק ב־4 השונות היא 5/4 וסטיית התקן היא √5/2 ≈ 1.118; בחילוק ב־3 היא 5/3, בערך 1.291. התשובה של המדגם תמיד גדולה יותר, כי הממוצע של מדגם צמוד קצת יותר מדי לערכים שלו עצמו.

תשובה מדויקת שאינה מספר עשרוני: 1, 2, 4

plain
1, 2, 4

הממוצע הוא 7/3, לא 2.33. הסטיות הן −4/3, −1/3 ו־5/3, והריבועים שלהן הם 16/9, 1/9 ו־25/9, ובסך הכול 14/3. עיגול הממוצע קודם היה זורק ספרה עוד לפני שההעלאה בריבוע התחילה, ולכן כל שורה בטבלה כאן היא שבר.

אין פיזור בכלל: 3, 3, 3

plain
3, 3, 3

כל סטייה היא אפס, ולכן סכום הריבועים הוא אפס וגם סטיית התקן. זו הדרך היחידה שבה סטיית תקן יכולה להיות אפס: לא "המספרים קטנים" אלא "כל הערכים זהים".

מה ערך חריג עושה: 100, 100, 100, 200

plain
100, 100, 100, 200

שלושה ערכים מסכימים בדיוק ואחד לא, וסטיית התקן היא בערך 43, יותר מרבע מכל הטווח. ההעלאה בריבוע של המרחקים היא מה שנותן לערך הרחוק היחיד הזה משקל כה רב, ובדיוק לכן המדד טוב בזיהוי חריגים.

טעויות נפוצות

  • חישוב ממוצע הסטיות בלי להעלות בריבוע. הסכום שלהן הוא אפס בכל רשימה שנכתבה אי פעם, ולכן התשובה תמיד הייתה אפס.
  • עיגול הממוצע לפני החיסור. אם הממוצע הוא 7/3, עבודה עם 2.33 משבשת כל ריבוע שבא אחריו: שמרו על דיוק עד הסוף.
  • חילוק בכמות הלא נכונה. n מיועד לאוכלוסייה שלמה ו־n − 1 למדגם; שימוש ב־n על נתוני מדגם מקטין את הפיזור בכל פעם.
  • דיווח על השונות כסטיית התקן. השונות היא השלב שלפני השורש, והיחידות שלה בריבוע: אחת אינה גרסה מעוגלת של השנייה.
  • לשכוח את השורש לגמרי. אם התשובה שלכם נראית גדולה מדי לנתונים, זו בדרך כלל הסיבה.
  • להתייחס לסטייה שלילית כאל טעות. חלק מהסטיות אמורות להיות שליליות; אם אף אחת לא, הממוצע חושב לא נכון.

שאלות נפוצות על סטיית תקן

מה ההבדל בין סטיית תקן של אוכלוסייה לסטיית תקן של מדגם?
המחלק. סטיית תקן של אוכלוסייה מחלקת את סכום הריבועים ב־n, כי הערכים הם הקבוצה כולה. של מדגם מחלקת ב־n − 1, כי הממוצע של מדגם יושב קצת קרוב מדי לערכים שלו, וחילוק באחד פחות מפצה על כך. התשובה של המדגם תמיד הגדולה מבין השתיים.
באיזו מהן להשתמש?
אם המספרים שלכם הם כל מה שמעניין אתכם, הציונים של כל הכיתה או הגבהים של כל ששת הילדים, השתמשו בנוסחת האוכלוסייה. אם הם מדגם שנבחר לייצג משהו גדול יותר, השתמשו ב־n − 1. רוב עבודות הסטטיסטיקה מבקשות את גרסת המדגם, ורוב שאלות הבחינה אומרות איזו מהן רוצים.
איך מחשבים סטיית תקן ידנית?
מוצאים את הממוצע, מחסירים אותו מכל ערך, מעלים כל הפרש בריבוע, מחברים את הריבועים, מחלקים ב־n (או ב־n − 1) ומוציאים שורש ריבועי. הדף הזה מדפיס את כל הטבלה כדי שתוכלו להשוות כל שורה לעבודה שלכם, ולא רק את המספר הסופי.
למה מעלים את הסטיות בריבוע?
כי אחרת הסכום שלהן תמיד בדיוק אפס: המרחקים החיוביים והשליליים מבטלים זה את זה לפי ההגדרה של ממוצע. ההעלאה בריבוע מסירה את הסימנים, והיא גם נותנת משקל רב יותר למרחקים הגדולים, ולכן ערך חריג רחוק אחד מזיז סטיית תקן כל כך הרבה.
מה ההבדל בין שונות לסטיית תקן?
השונות היא הממוצע של הסטיות בריבוע; סטיית התקן היא השורש הריבועי שלה. היחידות של השונות בריבוע, קילוגרמים בריבוע או סנטימטרים בריבוע, וקשה לפרש אותן, ולכן מוציאים שורש כדי להחזיר את התשובה ליחידות של הנתונים.
האם סטיית תקן יכולה להיות שלילית או אפס?
אף פעם לא שלילית: היא שורש ריבועי של ממוצע של ריבועים. אפס רק כשכל הערכים זהים, כי זה המקרה היחיד שבו אין מרחק מהממוצע למדוד. אם יצא לכם מספר שלילי, סימן הלך לאיבוד איפשהו בטבלה.
מה סטיית התקן בעצם אומרת לי?
בערך כמה רחוק ערך טיפוסי נמצא מהממוצע. בנתונים עם התפלגות בצורת פעמון, כשני שלישים מהערכים נמצאים בטווח של סטיית תקן אחת מהממוצע וכ־95% בטווח של שתיים, וזה מה שהופך אותה לקנה המידה הסטנדרטי לשאלה "האם הערך הזה חריג?"
למה הדף הזה מציג שברים במקום מספרים עשרוניים?
כי אלה התשובות המדויקות. הממוצע של 1, 2 ו־4 הוא 7/3, וכל ריבוע שנבנה על 2.33 במקומו שגוי במקצת. המספר העשרוני מוצג לצד הערך המדויק ולא במקומו, והוא מסומן כקירוב בכל פעם שהשורש אי־רציונלי.

עוד כלים למתמטיקה

איור של שפות התכנות ב-Coddy

ללמוד מתמטיקה עם Coddy

להתחיל