Menu
Coddy logo textTech

Merge e Concat

Lezione 17 di 19 del corso Analisi dei dati con Pandas di Coddy.

Nel mondo reale, i dati provengono spesso da più tabelle o file. Per collegare e analizzare questi dati, dobbiamo poter combinare i dataset. Per combinare i dataframe, possiamo usare .merge(), .join() e .concat().

.merge() è simile all'operazione JOIN di SQL; collega colonne o indici in un dataframe in base a una o più chiavi:

merged_df = df1.merge(df2, on='common_column')

Per esempio, queste due tabelle:

IDVALUE
1"val1"
2"val2"
IDPOINTS
19

Diventeranno:

IDVALUEPOINTS
1"val1"9

La funzione .concat() viene usata per aggiungere le righe di un dataframe alla fine di un altro dataframe e restituire un nuovo dataframe. Questa operazione è simile all'operazione 'UNION' in SQL:

concatenated_df = pd.concat([df1, df2])
challenge icon

Sfida

Facile

Il file CSV visits.csv contiene informazioni sul numero di visite effettuate in una determinata posizione in un determinato momento.

Ecco le prime 5 righe del file:

location_id,visits,timestamp
8,1771,27498
9,4187,79919
0,4959,54228
6,7721,41588

Calcola min, max, mean, std, sum e median per ogni ID di posizione e combinali in un unico dataframe. Rinomina le colonne in:

sum_visits, min_visits, max_visits, mean_visits, std_visits e median_visits.

Il dataframe finale dovrebbe apparire così:

location_idsum_visitsmin_visitsmax_visitsmean_visitsstd_visitsmedian_visits
.....................

Salva il risultato in df.

Provalo tu

# pandas as pd è già stato importato
df = pd.read_csv("./visits.csv")
sum_visits = df.groupby("location_id").sum()
min_visits = df.groupby("location_id").min()
max_visits = df.groupby("location_id").max()
mean_visits = df.groupby("location_id").mean()
std_visits = df.groupby("location_id").std()
median_visits = df.groupby("location_id").median()
# Scrivi il tuo codice qui sotto

Tutte le lezioni di Analisi dei dati con Pandas

Esercitati da solo: Compilatore Python online