שינוי מחרוזות
שיעור 12 מתוך 19 בקורס ניתוח נתונים עם Pandas של Coddy.
קצת יותר מסובך לעבוד עם מחרוזות, כי אי אפשר פשוט להוסיף להן 5 או להשוות אותן למספר. לשם כך, ל-Pandas יש כלי מיוחד .str שמאפשר לנו להשתמש בשיטות רבות שנתמכות במחרוזות של Python, כגון: .upper(), .lower(), .split() .len() וכו'.
כדי להמיר עמודת מחרוזות לאותיות גדולות:
df["existing_column"] = df["existing_column"].str.upper()כדי לשרשר כמה שיטות, צריך להשתמש בכמה מופעים של .str, כי כל שיטה מחזירה אובייקט סדרה:
.str.upper().str.split().str.lower()...כדי ליצור עמודות first_name ו-last_name מתוך full_name:
df["first_name"] = df["full_name"].str.split(" ").str[0]
df["last_name"] = df["full_name"].str.split(" ").str[1] אתגר
קלקובץ ה-CSV stats.csv מכיל מידע על נתונים סטטיסטיים.
הנה 5 השורות הראשונות של הקובץ:
ID,COUNTRY,COLOR,SKILL,SKILL_POINTS,UTILIZATION,IS_VALID,CATEGORY
1,France,Signal violet,marksmanship,14,0.1924,1,SHOW
2,Solomon Islands,Pearl violet,crocheting,4,0.6108,1,TREE
3,Germany,Bottle green,calligraphy,12,0.88646,0,SHOW
4,Mauritania,Fawn brown,paper cutting,9,0.058,1,JAPE- שנה את עמודת
COLORכך שתכיל רק את המילה האחרונה של העמודהCOLOR. - הוסף עמודה בשם
COUNTRY_LENGTHשמכילה את מספר התווים בעמודתCOUNTRY. - סנן את כל השורות שבהן עמודת
SKILLמכילה מילה אחת בלבד (לדוגמה, ל-"wood chopper" יש שתי מילים).
שמור את התוצאה במשתנה df.
נסו בעצמכם
# הספרייה pandas כבר יובאה בשם pd
df = pd.read_csv("./stats.csv")
# כתבו את הקוד שלכם למטה
כל השיעורים ביחידה ניתוח נתונים עם Pandas
3מניפולציה של נתונים עם Pandas
החזרת התוצאה המבוקשתסינון נתוניםהוספה ומחיקהשינוי נתוניםשינוי מחרוזותשינויים מותאמים אישיתתרגלו בעצמכם: קומפיילר Python אונליין