Menu
Coddy logo textTech

Czyszczenie danych — dodatkowe narzędzia

Lekcja 7 z 19 w kursie Analiza danych z pandas w Coddy.

Usuń zduplikowane wartości

Zduplikowane wiersze są dokładnie takie same. Jeśli występuje choć jedna różnica, wiersz nie zostanie uznany za duplikat.

df = df.drop_duplicates()

Zmień nazwy kolumn

Zazwyczaj chcemy stosować jedną konwencję nazewnictwa kolumn. W tym celu możemy ręcznie zmienić nazwy kolumn:

df = df.rename(columns={"old_name": "new_name"})

Zmień typy danych

df["column name"] = df["column name"].astype(bool)
df["column name"] = df["column name"].astype(int)
challenge icon

Wyzwanie

Łatwy

Plik CSV missing.csv jest nieuporządkowany.

Oto pierwsze 5 wierszy pliku:

ID,COUNTRY,COLOR,SKILL,SKILL_POINTS,UTILIZATION,IS_VALID
1,France,Signal violet,marksmanship,14,0.1924,1
1,France,Signal violet,marksmanship,14,0.1924,1
2,Solomon Islands,Pearl violet,,4,,1
3,Germany,,calligraphy,12,0.88646,0

Oczyść dane:

  • Usuń zduplikowane wiersze.
  • Zmień nazwy wszystkich kolumn na zapisane małymi literami.
  • Zamień kolumny zawierające jedynki i zera (sprawdź ramkę danych, aby znaleźć odpowiednie kolumny) na kolumny typu Boolean.

Aby iterować po wszystkich kolumnach, możesz użyć właściwości .colunms:

for column in columns:
    # your code here

Aby śledzić postępy, wyświetl df:  print(df)

Zapisz końcowy wynik w zmiennej df.
Nie wyświetlaj df, aby zaliczyć test!

Spróbuj swoich sił

# pandas jako pd jest już zaimportowany
df = pd.read_csv("./missing.csv")
# Napisz swój kod poniżej

Wszystkie lekcje w sekcji Analiza danych z pandas

Poćwicz samodzielnie: Kompilator Python online