Menu
Coddy logo textTech

סטטיסטיקה תיאורית

שיעור 14 מתוך 19 בקורס ניתוח נתונים עם Pandas של Coddy.

Pandas כוללת כמה פונקציות שעוזרות להבין את הנתונים ולנתח אותם. הנה כמה פונקציות נפוצות:

<strong>.count()</strong>: מחזירה את מספר התצפיות שאינן null:

df['column_name'].count()

<strong>.mean()</strong>: מחזירה את הממוצע של התצפיות שאינן null:

df['column_name'].mean()

<strong>.min()</strong> ו-<strong>.max()</strong>: מחזירות את הערכים המינימליים והמקסימליים של התצפיות שאינן null:

df['column_name'].min()
df['column_name'].max()

<strong>.median()</strong>: מחזירה את חציון התצפיות שאינן null:

df['column_name'].median()

<strong>.std()</strong>: מחזירה את סטיית התקן של התצפיות שאינן null:

df['column_name'].std()

הנה דוגמה לשימוש בשיטות האלה עם מה שלמדנו:

ספירת מספר השחקנים בקבוצה A:

players_a = df[df["group"] == "A"]
num_players = players_a["id"].count()
mean_score = players_a["score"].mean()
challenge icon

אתגר

קל

קובץ ה-CSV בשם visits.csv מכיל מידע על מספר הביקורים שנערכו במיקום מסוים בזמן מסוים.

הנה 5 השורות הראשונות בקובץ:

location_id,visits,timestamp
8,1771,27498
9,4187,79919
0,4959,54228
6,7721,41588

צרו מילון עם המפתחות הבאים: min, max, mean, std ו-median, וספקו את הערך המתאים של הנתונים הסטטיסטיים בעמודה visits עבור מזהה המיקום 5.

לבסוף, הדפיסו את המילון.

 

ניתן לכם חלק מהקוד לאתגר הזה; השלימו את החלק החסר.

נסו בעצמכם

# pandas as pd כבר יובא
df = pd.read_csv("./visits.csv")
# כתבו את הקוד שלכם למטה


res = {
    "min": locaion_5["visits"].min(),
    "max": # השלימו
    "mean": # השלימו
    "std": # השלימו
    "median": # השלימו
}
print(res)

כל השיעורים ביחידה ניתוח נתונים עם Pandas

תרגלו בעצמכם: קומפיילר Python אונליין