Czyszczenie danych — dodatkowe narzędzia
Lekcja 7 z 19 w kursie Analiza danych z pandas w Coddy.
Usuń zduplikowane wartości
Zduplikowane wiersze są dokładnie takie same. Jeśli występuje choć jedna różnica, wiersz nie zostanie uznany za duplikat.
df = df.drop_duplicates()Zmień nazwy kolumn
Zazwyczaj chcemy stosować jedną konwencję nazewnictwa kolumn. W tym celu możemy ręcznie zmienić nazwy kolumn:
df = df.rename(columns={"old_name": "new_name"})Zmień typy danych
df["column name"] = df["column name"].astype(bool)
df["column name"] = df["column name"].astype(int)Wyzwanie
ŁatwyPlik CSV missing.csv jest nieuporządkowany.
Oto pierwsze 5 wierszy pliku:
ID,COUNTRY,COLOR,SKILL,SKILL_POINTS,UTILIZATION,IS_VALID
1,France,Signal violet,marksmanship,14,0.1924,1
1,France,Signal violet,marksmanship,14,0.1924,1
2,Solomon Islands,Pearl violet,,4,,1
3,Germany,,calligraphy,12,0.88646,0Oczyść dane:
- Usuń zduplikowane wiersze.
- Zmień nazwy wszystkich kolumn na zapisane małymi literami.
- Zamień kolumny zawierające jedynki i zera (sprawdź ramkę danych, aby znaleźć odpowiednie kolumny) na kolumny typu Boolean.
Aby iterować po wszystkich kolumnach, możesz użyć właściwości .colunms:
for column in columns:
# your code hereAby śledzić postępy, wyświetl df: print(df)
Zapisz końcowy wynik w zmiennej df.
Nie wyświetlaj df, aby zaliczyć test!
Spróbuj swoich sił
# pandas jako pd jest już zaimportowany
df = pd.read_csv("./missing.csv")
# Napisz swój kod poniżej
Wszystkie lekcje w sekcji Analiza danych z pandas
4Analiza danych z Pandas
Statystyki opisoweGrupowanie i agregowanie danychRóżne sposoby agregacjiŁączenie i konkatenacja2Praca z DataFrame
Poznawanie DataFrameDostęp do danychCzyszczenie danych — brakujące daneCzyszczenie danych — dodatkowe narzędzia3Manipulowanie danymi za pomocą Pandas
Zwracanie żądanego wynikuFiltrowanie danychDodawanie i usuwanieModyfikowanie danychModyfikowanie ciągów znakówWłasne modyfikacjePoćwicz samodzielnie: Kompilator Python online