Menu
Coddy logo textTech

ניקוי נתונים - כלים נוספים

שיעור 7 מתוך 19 בקורס ניתוח נתונים עם Pandas של Coddy.

הסרת ערכים כפולים

שורות כפולות הן זהות לחלוטין. אם יש אפילו הבדל אחד, השורה לא תיחשב לכפולה.

df = df.drop_duplicates()

שינוי שמות של עמודות

בדרך כלל, נרצה להשתמש במוסכמה אחידה לשמות העמודות. לשם כך, אפשר לשנות את שמות העמודות באופן ידני:

df = df.rename(columns={"old_name": "new_name"})

שינוי סוגי נתונים

df["column name"] = df["column name"].astype(bool)
df["column name"] = df["column name"].astype(int)
challenge icon

אתגר

קל

קובץ ה-CSV missing.csv מבולגן.

הנה 5 השורות הראשונות של הקובץ:

ID,COUNTRY,COLOR,SKILL,SKILL_POINTS,UTILIZATION,IS_VALID
1,France,Signal violet,marksmanship,14,0.1924,1
1,France,Signal violet,marksmanship,14,0.1924,1
2,Solomon Islands,Pearl violet,,4,,1
3,Germany,,calligraphy,12,0.88646,0

נקו את הנתונים:

  • הסירו שורות כפולות.
  • שנו את שמות כל העמודות לאותיות קטנות.
  • המירו לעמודות בוליאניות עמודות שמכילות אחדות ואפסים (בדקו את מסגרת הנתונים כדי למצוא את העמודות המתאימות).

כדי לעבור על כל העמודות, אפשר להשתמש במאפיין .colunms:

for column in columns:
    # your code here

כדי לעקוב אחר ההתקדמות שלכם, הדפיסו את df:  print(df)

שמרו את התוצאה הסופית במשתנה df.
אל תדפיסו את df כדי לעבור את הבדיקה!

נסו בעצמכם

# pandas as pd כבר יובא
df = pd.read_csv("./missing.csv")
# כתבו את הקוד שלכם למטה

כל השיעורים ביחידה ניתוח נתונים עם Pandas

תרגלו בעצמכם: קומפיילר Python אונליין