Menu
Coddy logo textTech

Łączenie i konkatenacja

Lekcja 17 z 19 w kursie Analiza danych z pandas w Coddy.

W rzeczywistym świecie dane często pochodzą z wielu tabel lub plików. Aby połączyć i analizować te dane, musimy umieć łączyć zbiory danych. Do łączenia ramek danych możemy użyć .merge(), .join() i .concat().

.merge() działa podobnie do operacji JOIN w SQL; łączy kolumny lub indeksy w ramce danych na podstawie jednego lub większej liczby kluczy:

merged_df = df1.merge(df2, on='common_column')

Na przykład te dwie tabele:

IDVALUE
1"val1"
2"val2"
IDPOINTS
19

Połączą się w:

IDVALUEPOINTS
1"val1"9

Funkcja .concat() służy do dołączania wierszy jednej ramki danych na końcu innej ramki danych, zwracając nową ramkę danych. Ta operacja jest podobna do operacji 'UNION' w SQL:

concatenated_df = pd.concat([df1, df2])
challenge icon

Wyzwanie

Łatwy

Plik CSV visits.csv zawiera informacje o liczbie wizyt w danej lokalizacji i o określonej porze.

Oto pierwsze 5 wierszy pliku:

location_id,visits,timestamp
8,1771,27498
9,4187,79919
0,4959,54228
6,7721,41588

Oblicz min, max, mean, std, sum i median dla każdego identyfikatora lokalizacji i połącz je w jedną ramkę danych. Zmień nazwy kolumn na:

sum_visits, min_visits, max_visits, mean_visits, std_visits i median_visits.

Końcowa ramka danych powinna wyglądać tak:

location_idsum_visitsmin_visitsmax_visitsmean_visitsstd_visitsmedian_visits
.....................

Zapisz wynik w df.

Spróbuj swoich sił

# pandas as pd jest już zaimportowany
df = pd.read_csv("./visits.csv")
sum_visits = df.groupby("location_id").sum()
min_visits = df.groupby("location_id").min()
max_visits = df.groupby("location_id").max()
mean_visits = df.groupby("location_id").mean()
std_visits = df.groupby("location_id").std()
median_visits = df.groupby("location_id").median()
# Napisz swój kod poniżej

Wszystkie lekcje w sekcji Analiza danych z pandas

Poćwicz samodzielnie: Kompilator Python online