Menu
Coddy logo textTech

Dati da fornire a un modello

Lezione 2 di 19 del corso Introduzione all’apprendimento automatico di Coddy.

Nel Machine Learning, i dati svolgono un ruolo cruciale nell’addestramento e nello sviluppo dei modelli. Per fornire dati a un modello, in genere li si organizza in un formato strutturato noto come dataset (un DataFrame in pandas).

Un dataset è composto da due parti principali: 

  • Caratteristiche - Un insieme di colonne che rappresentano un set di dati
  • Variabile target - Rappresenta l’output o il valore che il modello mira a prevedere o stimare.

Ad esempio, ecco una tabella Meteo

idgradi (C)umidità (%)vento (KM/H)is_rain
123514True
2301017False
315312False
420125False
5265723True

Supponendo di voler sapere se pioverà, le caratteristiche sono degrees, humidity, wind e la variabile target è is_rain.

Le caratteristiche sono indicate con <strong>X</strong> e il target è indicato con <strong>y</strong>.
La variabile target (<strong>y</strong>) può contenere qualsiasi tipo di dato: numero, booleano, stringa ecc.

 

Durante il processo di addestramento, il modello usa le caratteristiche come input e la variabile target come verità di base, ovvero l’output corretto.

Senza una variabile target, il modello non avrebbe modo di sapere se le sue previsioni sono corrette oppure no.

Esistono molte varianti nella struttura dei dataset:

  • Molte caratteristiche, una sola variabile target
  • Una sola caratteristica, una sola variabile target
  • Molte caratteristiche, molte variabili target
  • Poche caratteristiche, una o più variabili target
  • Nessuna variabile target
  • Dati di serie temporali
  • ecc.

L’apprendimento supervisionato prevede dataset con coppie input-output, in cui l’algoritmo impara ad associare gli input alle variabili target corrispondenti.

L’apprendimento non supervisionato non prevede variabili target; cerca invece schemi o strutture nei dati di input senza esempi etichettati.

È fondamentale assicurarsi che la variabile target sia indipendente dalle altre colonne, poiché qualsiasi dipendenza potrebbe causare una fuga di dati e portare a prestazioni ingannevolmente elevate durante l’addestramento. Un modello realmente predittivo deve imparare da caratteristiche che non sono direttamente correlate al target, preservando così l’integrità e la generalizzabilità delle previsioni del modello.

Una variabile target indipendente non può essere calcolata o ricavata direttamente dalle altre colonne del dataset; è ciò che si intende prevedere.

quiz iconMettiti alla prova

Questa lezione include un breve quiz. Inizia la lezione per rispondere e tenere traccia dei tuoi progressi.

quiz iconMettiti alla prova

Questa lezione include un breve quiz. Inizia la lezione per rispondere e tenere traccia dei tuoi progressi.

quiz iconMettiti alla prova

Questa lezione include un breve quiz. Inizia la lezione per rispondere e tenere traccia dei tuoi progressi.

challenge icon

Sfida

Facile

Ti viene fornito un file CSV chiamato galactic_zoo_no_target.csv. Questo set di dati non ha una variabile target.

In questa sfida, creerai la tua variabile target. Crea una colonna denominata ComplexityIndex derivata dalla formula: WaterCoverage * HabitatDiversity / PlanetMass. Quindi, rimuovi le colonne WaterCoverage, HabitatDiversity e PlanetMass, poiché ora sono rappresentate da ComplexityIndex.

Per superare la sfida, non stampare nulla: controlliamo internamente la variabile df.

Provalo tu

# pandas as pd è già importato
df = pd.read_csv("galactic_zoo_no_target.csv")
# Scrivi il tuo codice qui sotto

Tutte le lezioni di Introduzione all’apprendimento automatico

Esercitati da solo: Compilatore Python online