
Embeddings e rappresentazione semantica
Usare embeddings per rappresentare clienti, prodotti e contenuti in spazi vettoriali.
Cosa imparerai
- Costruire vettori densi per prodotti e testi e misurare la similarità coseno
- Confrontare one-hot encoding e embeddings su dimensionalità e struttura semantica
- Validare ricerca e raccomandazione con precision, recall e CTR per segmento
Collegamenti
Embeddings e rappresentazione semantica
La promessa della rappresentazione semantica è ambiziosa: far capire a una macchina che una scarpa da corsa assomiglia più a un’altra scarpa da corsa che a un frullatore. Gli embeddings che vediamo qui sono vettori numerici su tabelle, non reti neurali generative, e la loro vicinanza geometrica guida ricerca, raggruppamento e raccomandazione. In questa lezione impari a costruirli, misurarli e validarli.
Che cosa sono gli embeddings
Gli embeddings traducono clienti, prodotti e testi in vettori densi dove la vicinanza geometrica guida ricerca, raggruppamento e raccomandazione.
La procedura in cinque passaggi
Ecco la sequenza che seguiamo per portare gli embeddings in un flusso decisionale.
- Fissa la decisione tra ricerca, raccomandazione, clustering o analisi qualitativa.
- Costruisci la baseline one-hot per mostrare dimensionalità e assenza di similarità.
- Addestra o riusa vettori densi tra 50 e 1024 dimensioni su dati tabellari e testuali.
- Misura similarità coseno e valida su precision, recall e CTR per segmento.
- Monitora deriva del vocabolario e degrado della rilevanza dopo il lancio.
Il problema che gli embeddings risolvono
Per apprezzare la potenza degli embeddings serve prima vedere il problema che risolvono. Prendi un catalogo e-commerce con 50000 prodotti. L’approccio ingenuo, il one-hot encoding, crea un vettore lungo quanto l’intero catalogo, fatto di zeri tranne un 1 nella posizione del prodotto. Questo metodo ha due difetti gravi. Primo, la dimensionalità è esagerata: ogni prodotto è un punto in uno spazio a 50000 dimensioni. Questo fenomeno, noto come maledizione della dimensionalità, rende i calcoli inefficienti e richiede una quantità di dati proibitiva per trovare pattern significativi. Secondo, e più grave, questo spazio non ha alcuna struttura semantica. Il vettore per scarpa da corsa Nike Air Zoom è ortogonale e distante esattamente quanto quello per frullatore a immersione e per scarpa da corsa Adidas Ultraboost. Per il modello, questi tre oggetti sono entità distinte e non correlate.
Verdetto: one-hot per chiavi esaustive e conteggi esatti, vettori densi per similarità, ricerca e personalizzazione.
Spazi densi e similarità geometrica
Gli embeddings ribaltano questo paradigma. Invece di un vettore sparso e ad alta dimensionalità, rappresentano ogni entità con un vettore denso, in cui quasi tutti i valori sono non nulli, e a bassa dimensionalità, tipicamente tra 50 e 1024 dimensioni. Il punto chiave è che questo spazio è progettato perché la distanza geometrica tra i vettori rifletta la similarità semantica tra le entità. Nello spazio degli embeddings il vettore di Nike Air Zoom sarà vicino a quello di Adidas Ultraboost, entrambe scarpe da corsa, e lontano da quello del frullatore a immersione.
Questa vicinanza si misura tipicamente con la similarità del coseno, che valuta l’angolo tra due vettori. Un angolo piccolo, con coseno vicino a 1, indica alta similarità. Un angolo di 90 gradi, con coseno 0, indica nessuna similarità. Il principio nasce nel Natural Language Processing con algoritmi come Word2Vec, che hanno reso possibile la famosa analogia vettoriale vettore('Re') - vettore('Uomo') + vettore('Donna') ≈ vettore('Regina'). L’operazione cattura la relazione di genere e regalità. Nel marketing le analogie diventano vettore('iPhone 14 Pro') - vettore('Apple') + vettore('Samsung') ≈ vettore('Galaxy S23 Ultra').
Una sequenza di lavoro
Prima di adottare gli embeddings in un flusso decisionale, segui una sequenza che impedisce di trasformare la tecnica in un rituale vuoto. Ogni passaggio dovrebbe rendere più chiaro il costo di una decisione sbagliata.
| Passaggio | Domanda da fare | Output atteso |
|---|---|---|
| Decisione | Che cosa cambia se rappresentiamo meglio testo e prodotti? | Scelta esplicita |
| Segnale | Quale dato osservabile riduce l’incertezza? | Metrica o evento |
| Baseline | Rispetto a cosa interpretiamo il risultato? | Confronto credibile |
| Vincolo | Che cosa può falsare la lettura? | Assunzione da dichiarare |
| Azione | Quale passo operativo segue? | Raccomandazione controllabile |
Rendere visibili le assunzioni
Un embedding utile è quello che migliora ricerca, segmentazione, personalizzazione o analisi qualitativa. Altrimenti resta una rappresentazione elegante senza impatto. Per tenere la rotta, formalizza il lavoro come relazione tra decisione, evidenza e rischio. Così rendi discutibili le assunzioni invece di fidarti del risultato per autorità.
| Elemento | Definizione operativa | Controllo minimo |
|---|---|---|
| Unità di analisi | Oggetto su cui misuri il fenomeno | Utente, account, evento, ordine o periodo |
| Variabile osservata | Segnale che rappresenta il comportamento | Definizione stabile e tracciabile |
| Baseline | Stato contro cui confronti il segnale | Periodo, segmento, controllo o benchmark |
| Soglia decisionale | Punto in cui cambia l’azione | Criterio scritto prima della lettura |
| Rischio residuo | Errore che può restare anche dopo l’analisi | Sensitivity check o revisione qualitativa |
Lettura prudente dei segnali
La domanda non è qual è la definizione corretta ma quale scelta diventa meno rischiosa se questa rappresentazione è fatta bene.
| Situazione | Lettura prudente | Decisione |
|---|---|---|
| Il dato migliora ma la baseline è debole | Il segnale potrebbe dipendere dal campione | Rafforzare il confronto prima di scalare |
| La metrica cambia in un solo segmento | L’effetto medio nasconde eterogeneità | Separare coorti o casi d’uso |
| Il costo operativo aumenta | Il beneficio va valutato sul margine | Applicare una soglia economica esplicita |
| Il sistema produce numeri incoerenti | La fiducia nel dato è parte della decisione | Correggere ownership e controlli |
L’errore tipico da evitare
L’errore più comune è usare gli embeddings come etichetta tecnica invece che come criterio di scelta. Succede quando il team presenta un numero senza dire quale decisione cambia, quale baseline lo rende interpretabile e quale rischio resta aperto. In quel caso il dato sembra preciso, ma non guida l’azione. Prima di presentare un risultato, chiarisci quale decisione dovrebbe migliorare. Definisci quale unità di analisi rende il problema misurabile e quale controllo presenteresti prima di raccomandare un’azione.
Un caso che fa riflettere: Word2Vec
Nel 2013 il team di Tomas Mikolov a Google pubblicò Word2Vec, con modelli addestrati su circa 100 miliardi di parole di Google News in vettori a 300 dimensioni. Il modello rese operativa l’analogia Re meno Uomo più Donna uguale Regina nello spazio vettoriale. La stessa geometria portò nel marketing analogie prodotto-marca come iPhone meno Apple più Samsung verso Galaxy di fascia alta. Il caso fissò lo standard tabellare: contesto di co-occorrenza, dimensionalità contenuta e valutazione su similarità prima dell’attivazione.
Domande per l’autoverifica
- Quale limite del one-hot rende inutile la distanza tra prodotti simili?
- Quale similarità geometrica ordina i candidati in ricerca e raccomandazione?
- Quale baseline dimostra che i vettori migliorano CTR o rilevanza?
- Quale deriva del vocabolario segnala che gli embeddings vanno riaddestrati?
Bloccato su questo argomento o vuoi applicarlo al tuo caso? Prenota una call di 15 minuti con un analista esperto.
Percorso collegato
Lezioni da leggere insieme
Questi collegamenti portano la lezione dentro il resto del corso: basi da riprendere, passaggi successivi e connessioni tematiche tra moduli.