Dane wejściowe dla modelu
Lekcja 2 z 19 w kursie Wprowadzenie do uczenia maszynowego w Coddy.
W uczeniu maszynowym dane odgrywają kluczową rolę w trenowaniu i rozwijaniu modeli. Aby przekazać dane do modelu, zazwyczaj organizuje się je w ustrukturyzowanym formacie znanym jako zbiór danych (DataFrame w pandas).
Zbiór danych składa się z dwóch głównych części:
- Cechy - Zestaw kolumn reprezentujących dane
- Zmienna docelowa - Reprezentuje wynik lub wartość, którą model ma przewidzieć albo oszacować.
Na przykład, oto tabela pogody
| id | stopnie (C) | wilgotność (%) | wiatr (KM/H) | is_rain |
| 1 | 23 | 5 | 14 | True |
| 2 | 30 | 10 | 17 | False |
| 3 | 15 | 3 | 12 | False |
| 4 | 20 | 12 | 5 | False |
| 5 | 26 | 57 | 23 | True |
Załóżmy, że chcemy wiedzieć, czy będzie padać. Cechami są degrees, humidity, wind, a zmienną docelową jest is_rain.
Cechy oznacza się jako <strong>X</strong>, a zmienną docelową jako <strong>y</strong>.
Zmienna docelowa (<strong>y</strong>) może zawierać dane dowolnego typu — liczbę, wartość logiczną, ciąg znaków itp.
Podczas procesu trenowania model wykorzystuje cechy jako dane wejściowe, a zmienną docelową jako wartość referencyjną lub prawidłowy wynik.
Bez zmiennej docelowej model nie miałby możliwości sprawdzenia, czy jego przewidywania są poprawne.
Struktura zbiorów danych może przyjmować wiele różnych form:
- Wiele cech, jedna zmienna docelowa
- Jedna cecha, jedna zmienna docelowa
- Wiele cech, wiele zmiennych docelowych
- Mało cech, jedna lub wiele zmiennych docelowych
- Brak zmiennej docelowej
- Dane szeregów czasowych
- itd.
Uczenie nadzorowane wykorzystuje zbiory danych zawierające pary wejście-wyjście, na podstawie których algorytm uczy się mapować dane wejściowe na odpowiadające im zmienne docelowe.
Uczenie nienadzorowane nie wykorzystuje zmiennych docelowych; zamiast tego wyszukuje wzorce lub strukturę w danych wejściowych, nie korzystając z przykładów z etykietami.
Kluczowe jest upewnienie się, że zmienna docelowa jest niezależna od pozostałych kolumn, ponieważ wszelkie zależności mogą prowadzić do wycieku danych i skutkować myląco wysoką skutecznością podczas trenowania. Model, który rzeczywiście potrafi przewidywać, musi uczyć się na podstawie cech niezwiązanych bezpośrednio ze zmienną docelową, co pozwala zachować rzetelność i możliwość uogólniania jego przewidywań.
Niezależnej zmiennej docelowej nie można bezpośrednio obliczyć ani wyprowadzić z pozostałych kolumn w zbiorze danych; to właśnie ją chcesz przewidzieć.
Ta lekcja zawiera krótki quiz. Zacznij lekcję, żeby na niego odpowiedzieć i śledzić swoje postępy.
Ta lekcja zawiera krótki quiz. Zacznij lekcję, żeby na niego odpowiedzieć i śledzić swoje postępy.
Ta lekcja zawiera krótki quiz. Zacznij lekcję, żeby na niego odpowiedzieć i śledzić swoje postępy.
Wyzwanie
ŁatwyOtrzymujesz plik CSV o nazwie galactic_zoo_no_target.csv. Ten zbiór danych nie ma zmiennej docelowej.
W tym wyzwaniu utworzysz własną zmienną docelową. Utwórz kolumnę o nazwie ComplexityIndex na podstawie wzoru: WaterCoverage * HabitatDiversity / PlanetMass. Następnie usuń kolumny WaterCoverage, HabitatDiversity i PlanetMass, ponieważ są teraz reprezentowane przez ComplexityIndex.
Aby zaliczyć wyzwanie, niczego nie wyświetlaj; wewnętrznie sprawdzimy zmienną df.
Spróbuj swoich sił
# pandas jako pd jest już zaimportowany
df = pd.read_csv("galactic_zoo_no_target.csv")
# Napisz swój kod poniżej
Wszystkie lekcje w sekcji Wprowadzenie do uczenia maszynowego
Poćwicz samodzielnie: Kompilator Python online