)
Serie 1 · Fondamenti del Machine Learning

I tre tipi di Machine Learning

Il machine learning si può ricondurre a tre grandi famiglie — apprendimento supervisionato, non supervisionato e per rinforzo — distinti da come sono i dati di training: etichettati, non etichettati o sostituiti da ricompense.

← Tutti gli argomenti
Tabella che confronta apprendimento supervisionato, non supervisionato e per rinforzo con definizioni ed esempi.

Il machine learning si divide di solito in tre paradigmi, e la differenza tra loro è semplicemente da cosa impara il modello.

Apprendimento supervisionato. Impara da dati etichettati — coppie input/output in cui la risposta corretta è fornita. Il compito del modello è imparare la mappatura da input a output abbastanza bene da predire casi nuovi, mai visti in fase di addestramento. Gli esempi visti in precedenza, come la predizione del reddito medio data l’età, sono classici esempi di apprendimento supervisionato: ogni record del training set contiene la risposta osservata nel mondo reale (età di una persona reale, suo reddito). Più in generale, task come classificazione di immagini, rilevamento dello spam, predizione dei prezzi delle case, traduzione automatica sono tutti supervisionati.

Apprendimento non supervisionato. Impara da dati non etichettati — nessuna risposta fornita. Il modello deve trovare la struttura da solo: raggruppare cose simili, ridurre la complessità, individuare anomalie. Clustering dei clienti per comportamento d’acquisto, riduzione della dimensionalità, rilevamento di anomalie e topic modeling vivono qui. Nessuno dice al modello cos’è “giusto”; è lui a scoprire gli schemi e le connessioni tra i record del training set.

Apprendimento per rinforzo. Impara dall’interazione. Un agente compie azioni in un ambiente e riceve ricompense o penalità e, col tempo, apprende una policy — un modo di agire — che massimizza la ricompensa raccolta. È così che le AI imparano a giocare a scacchi o a Go, che i robot imparano a muoversi e che i sistemi di raccomandazione si tarano sul tuo feedback.

Le tre fasi di addestramento di un LLM in sequenza — pre-training auto-supervisionato, fine-tuning supervisionato e allineamento per rinforzo — con in basso l'esempio di come il testo grezzo diventa coppie input/output.
I tre paradigmi come tre fasi in sequenza: il pre-training auto-supervisionato produce il modello base; il fine-tuning supervisionato e l'allineamento per rinforzo lo trasformano in un modello istruito. In basso il trucco del self-supervised: il testo grezzo si trasforma da solo in coppie input→output.

Ed ecco la parte che mi ha sorpreso, e che lega tutta la Serie 1 a ciò che segue: un moderno large language model viene allenato con tutti e tre i paradigmi, in sequenza. E man mano che la ricerca avanza, gli schemi di addestramento si fanno sempre più articolati e misteriosi, spesso coperti da segreto industriale. In termini generali, lo schema di addestramento “tradizionale” è il seguente.

Quindi i tre paradigmi non sono fazioni rivali; sono fasi. Lo stesso modello attraversa apprendimento non supervisionato, poi supervisionato, poi per rinforzo nel suo percorso dal testo grezzo a qualcosa con cui puoi davvero parlare. Con questo, le fondamenta sono complete — e la serie passa all’architettura che fa funzionare tutto: la rete neurale.