Menu
Coddy logo textTech

Dane wejściowe dla modelu

Lekcja 2 z 19 w kursie Wprowadzenie do uczenia maszynowego w Coddy.

W uczeniu maszynowym dane odgrywają kluczową rolę w trenowaniu i rozwijaniu modeli. Aby przekazać dane do modelu, zazwyczaj organizuje się je w ustrukturyzowanym formacie znanym jako zbiór danych (DataFrame w pandas).

Zbiór danych składa się z dwóch głównych części: 

  • Cechy - Zestaw kolumn reprezentujących dane
  • Zmienna docelowa - Reprezentuje wynik lub wartość, którą model ma przewidzieć albo oszacować.

Na przykład, oto tabela pogody

idstopnie (C)wilgotność (%)wiatr (KM/H)is_rain
123514True
2301017False
315312False
420125False
5265723True

Załóżmy, że chcemy wiedzieć, czy będzie padać. Cechami są degrees, humidity, wind, a zmienną docelową jest is_rain.

Cechy oznacza się jako <strong>X</strong>, a zmienną docelową jako <strong>y</strong>.
Zmienna docelowa (<strong>y</strong>) może zawierać dane dowolnego typu — liczbę, wartość logiczną, ciąg znaków itp.

 

Podczas procesu trenowania model wykorzystuje cechy jako dane wejściowe, a zmienną docelową jako wartość referencyjną lub prawidłowy wynik.

Bez zmiennej docelowej model nie miałby możliwości sprawdzenia, czy jego przewidywania są poprawne.

Struktura zbiorów danych może przyjmować wiele różnych form:

  • Wiele cech, jedna zmienna docelowa
  • Jedna cecha, jedna zmienna docelowa
  • Wiele cech, wiele zmiennych docelowych
  • Mało cech, jedna lub wiele zmiennych docelowych
  • Brak zmiennej docelowej
  • Dane szeregów czasowych
  • itd.

Uczenie nadzorowane wykorzystuje zbiory danych zawierające pary wejście-wyjście, na podstawie których algorytm uczy się mapować dane wejściowe na odpowiadające im zmienne docelowe.

Uczenie nienadzorowane nie wykorzystuje zmiennych docelowych; zamiast tego wyszukuje wzorce lub strukturę w danych wejściowych, nie korzystając z przykładów z etykietami.

Kluczowe jest upewnienie się, że zmienna docelowa jest niezależna od pozostałych kolumn, ponieważ wszelkie zależności mogą prowadzić do wycieku danych i skutkować myląco wysoką skutecznością podczas trenowania. Model, który rzeczywiście potrafi przewidywać, musi uczyć się na podstawie cech niezwiązanych bezpośrednio ze zmienną docelową, co pozwala zachować rzetelność i możliwość uogólniania jego przewidywań.

Niezależnej zmiennej docelowej nie można bezpośrednio obliczyć ani wyprowadzić z pozostałych kolumn w zbiorze danych; to właśnie ją chcesz przewidzieć.

quiz iconSprawdź się

Ta lekcja zawiera krótki quiz. Zacznij lekcję, żeby na niego odpowiedzieć i śledzić swoje postępy.

quiz iconSprawdź się

Ta lekcja zawiera krótki quiz. Zacznij lekcję, żeby na niego odpowiedzieć i śledzić swoje postępy.

quiz iconSprawdź się

Ta lekcja zawiera krótki quiz. Zacznij lekcję, żeby na niego odpowiedzieć i śledzić swoje postępy.

challenge icon

Wyzwanie

Łatwy

Otrzymujesz plik CSV o nazwie galactic_zoo_no_target.csv. Ten zbiór danych nie ma zmiennej docelowej.

W tym wyzwaniu utworzysz własną zmienną docelową. Utwórz kolumnę o nazwie ComplexityIndex na podstawie wzoru: WaterCoverage * HabitatDiversity / PlanetMass. Następnie usuń kolumny WaterCoverage, HabitatDiversity i PlanetMass, ponieważ są teraz reprezentowane przez ComplexityIndex.

Aby zaliczyć wyzwanie, niczego nie wyświetlaj; wewnętrznie sprawdzimy zmienną df.

Spróbuj swoich sił

# pandas jako pd jest już zaimportowany
df = pd.read_csv("galactic_zoo_no_target.csv")
# Napisz swój kod poniżej

Wszystkie lekcje w sekcji Wprowadzenie do uczenia maszynowego

Poćwicz samodzielnie: Kompilator Python online