סטטיסטיקה תיאורית
שיעור 14 מתוך 19 בקורס ניתוח נתונים עם Pandas של Coddy.
Pandas כוללת כמה פונקציות שעוזרות להבין את הנתונים ולנתח אותם. הנה כמה פונקציות נפוצות:
<strong>.count()</strong>: מחזירה את מספר התצפיות שאינן null:
df['column_name'].count()<strong>.mean()</strong>: מחזירה את הממוצע של התצפיות שאינן null:
df['column_name'].mean()<strong>.min()</strong> ו-<strong>.max()</strong>: מחזירות את הערכים המינימליים והמקסימליים של התצפיות שאינן null:
df['column_name'].min()
df['column_name'].max()<strong>.median()</strong>: מחזירה את חציון התצפיות שאינן null:
df['column_name'].median()<strong>.std()</strong>: מחזירה את סטיית התקן של התצפיות שאינן null:
df['column_name'].std()הנה דוגמה לשימוש בשיטות האלה עם מה שלמדנו:
ספירת מספר השחקנים בקבוצה A:
players_a = df[df["group"] == "A"]
num_players = players_a["id"].count()
mean_score = players_a["score"].mean()אתגר
קלקובץ ה-CSV בשם visits.csv מכיל מידע על מספר הביקורים שנערכו במיקום מסוים בזמן מסוים.
הנה 5 השורות הראשונות בקובץ:
location_id,visits,timestamp
8,1771,27498
9,4187,79919
0,4959,54228
6,7721,41588צרו מילון עם המפתחות הבאים: min, max, mean, std ו-median, וספקו את הערך המתאים של הנתונים הסטטיסטיים בעמודה visits עבור מזהה המיקום 5.
לבסוף, הדפיסו את המילון.
ניתן לכם חלק מהקוד לאתגר הזה; השלימו את החלק החסר.
נסו בעצמכם
# pandas as pd כבר יובא
df = pd.read_csv("./visits.csv")
# כתבו את הקוד שלכם למטה
res = {
"min": locaion_5["visits"].min(),
"max": # השלימו
"mean": # השלימו
"std": # השלימו
"median": # השלימו
}
print(res)כל השיעורים ביחידה ניתוח נתונים עם Pandas
3מניפולציה של נתונים עם Pandas
החזרת התוצאה המבוקשתסינון נתוניםהוספה ומחיקהשינוי נתוניםשינוי מחרוזותשינויים מותאמים אישיתתרגלו בעצמכם: קומפיילר Python אונליין