Pulizia dei dati - Altri strumenti
Lezione 7 di 19 del corso Analisi dei dati con Pandas di Coddy.
Rimuovere i valori duplicati
Le righe duplicate sono esattamente uguali. Se c'è anche una sola differenza, non verrà considerata un duplicato.
df = df.drop_duplicates()Rinominare le colonne
Di solito, vorremmo adottare un'unica convenzione per i nomi delle colonne. Per farlo, possiamo rinominare manualmente le colonne:
df = df.rename(columns={"old_name": "new_name"})Modificare i tipi di dati
df["column name"] = df["column name"].astype(bool)
df["column name"] = df["column name"].astype(int)Sfida
FacileIl file CSV missing.csv è disordinato.
Ecco le prime 5 righe del file:
ID,COUNTRY,COLOR,SKILL,SKILL_POINTS,UTILIZATION,IS_VALID
1,France,Signal violet,marksmanship,14,0.1924,1
1,France,Signal violet,marksmanship,14,0.1924,1
2,Solomon Islands,Pearl violet,,4,,1
3,Germany,,calligraphy,12,0.88646,0Pulisci i dati:
- Rimuovi le righe duplicate.
- Rinomina tutte le colonne usando lettere minuscole.
- Converti in colonne booleane le colonne con uno e zero (esamina il dataframe per trovare le colonne corrette).
Per scorrere tutte le colonne, puoi usare la proprietà .colunms:
for column in columns:
# your code herePer monitorare i tuoi progressi, stampa il df: print(df)
Memorizza il risultato finale nella variabile df.
Non stampare il df per superare il test!
Provalo tu
# pandas as pd è già importato
df = pd.read_csv("./missing.csv")
# Scrivi il tuo codice qui sotto
Tutte le lezioni di Analisi dei dati con Pandas
4Analisi dei dati con Pandas
Statistiche descrittiveRaggruppamento e aggregazione dei datiAggregazioni diverseMerge e Concat2Lavorare con il DataFrame
Comprendere i DataFrameAccedere ai datiPulizia dei dati - Dati mancantiPulizia dei dati - Altri strumenti3Manipolazione dei dati con Pandas
Restituire il risultato richiestoFiltrare i datiAggiungere ed eliminareModificare i datiModificare le stringheModifiche personalizzateEsercitati da solo: Compilatore Python online