Menu
Coddy logo textTech

Pulizia dei dati - Altri strumenti

Lezione 7 di 19 del corso Analisi dei dati con Pandas di Coddy.

Rimuovere i valori duplicati

Le righe duplicate sono esattamente uguali. Se c'è anche una sola differenza, non verrà considerata un duplicato.

df = df.drop_duplicates()

Rinominare le colonne

Di solito, vorremmo adottare un'unica convenzione per i nomi delle colonne. Per farlo, possiamo rinominare manualmente le colonne:

df = df.rename(columns={"old_name": "new_name"})

Modificare i tipi di dati

df["column name"] = df["column name"].astype(bool)
df["column name"] = df["column name"].astype(int)
challenge icon

Sfida

Facile

Il file CSV missing.csv è disordinato.

Ecco le prime 5 righe del file:

ID,COUNTRY,COLOR,SKILL,SKILL_POINTS,UTILIZATION,IS_VALID
1,France,Signal violet,marksmanship,14,0.1924,1
1,France,Signal violet,marksmanship,14,0.1924,1
2,Solomon Islands,Pearl violet,,4,,1
3,Germany,,calligraphy,12,0.88646,0

Pulisci i dati:

  • Rimuovi le righe duplicate.
  • Rinomina tutte le colonne usando lettere minuscole.
  • Converti in colonne booleane le colonne con uno e zero (esamina il dataframe per trovare le colonne corrette).

Per scorrere tutte le colonne, puoi usare la proprietà .colunms:

for column in columns:
    # your code here

Per monitorare i tuoi progressi, stampa il df:  print(df)

Memorizza il risultato finale nella variabile df.
Non stampare il df per superare il test!

Provalo tu

# pandas as pd è già importato
df = pd.read_csv("./missing.csv")
# Scrivi il tuo codice qui sotto

Tutte le lezioni di Analisi dei dati con Pandas

Esercitati da solo: Compilatore Python online