סינון נתונים
שיעור 9 מתוך 19 בקורס ניתוח נתונים עם Pandas של Coddy.
Pandas מאפשר לנו לסנן שורות על סמך תנאי מסוים. כדי לסנן שורות, כתבו את התנאי בתוך סוגריים מרובעים:
filtered_df = df[df["number_column"] > 5]
filtered_df = df[df["string_column"] == "String Match"]כדי לשלב כמה תנאים, השתמשו במילת המפתח & (and) ובמילת המפתח | (or). כל תנאי חייב להיות בתוך סוגריים ():
filtered_df = df[(df['number_column'] >= 3) & (df['string_column'] == 'String Match')]מילת המפתח not היא ~ (לא גדול מ-5):
filtered_df = df[~df["number_column"] > 5]כדי לאחזר את כל הערכים שאינם ריקים מעמודה מסוימת:
filtered_df = df[~df["column"].isna()]כדי לבדוק אם ערך נמצא במערך:
filtered_df = df[df['column'].isin(['value1', 'value2', 'value3'])]
אתגר
קלקובץ ה-CSV stats.csv מכיל מידע על נתונים סטטיסטיים.
הנה 5 השורות הראשונות בקובץ:
ID,COUNTRY,COLOR,SKILL,SKILL_POINTS,UTILIZATION,IS_VALID,CATEGORY
1,France,Signal violet,marksmanship,14,0.1924,1,SHOW
2,Solomon Islands,Pearl violet,crocheting,4,0.6108,1,TREE
3,Germany,Bottle green,calligraphy,12,0.88646,0,SHOW
4,Mauritania,Fawn brown,paper cutting,9,0.058,1,JAPEאחזרו רק את השורות שעומדות בקריטריונים הבאים:
SKILL_POINTSגדול מ-7.UTILIZATIONקטן או שווה ל-0.7, או גדול מ-0.95.IS_VALIDשווה לאחד.CATEGORYהוא אחד מהבאים:JAPE,PLQRו-GHUP
שמרו את התוצאה הסופית במשתנה df.
נסו בעצמכם
# pandas as pd כבר יובא
df = pd.read_csv("./stats.csv")
# כתבו את הקוד שלכם למטה
כל השיעורים ביחידה ניתוח נתונים עם Pandas
3מניפולציה של נתונים עם Pandas
החזרת התוצאה המבוקשתסינון נתוניםהוספה ומחיקהשינוי נתוניםשינוי מחרוזותשינויים מותאמים אישיתתרגלו בעצמכם: קומפיילר Python אונליין