
Epistemologia dei dati: cosa puoi davvero sapere
I limiti della conoscenza ottenibile dai dati e come distinguere ciò che sai da ciò che credi di sapere.
Cosa imparerai
- Ricostruire la storia di costruzione di un dato risalendo dalla metrica alla fonte
- Verificare copertura e selezione confrontando il campione con la popolazione bersaglio
- Dichiarare per iscritto cosa il dato non può dire prima di usarlo per decidere
Epistemologia dei dati: cosa puoi davvero sapere
Sul binario tabellare passiamo le giornate a guardare tabelle e dashboard, e lì i numeri sembrano oggettivi: arrivano da log, sensori, pipeline e modelli di pulizia. Per questo li trattiamo come se fossero la realtà stessa. Ogni dato invece nasce da scelte: come lo abbiamo raccolto, come lo abbiamo definito e quali trasformazioni gli abbiamo applicato. L’epistemologia dei dati tratta il dato per quello che è, cioè un’evidenza costruita e non una finestra trasparente sul mondo.
Non è un attacco alla professione. È il suo fondamento: chi sa che il dato è costruito sa anche dove cercare le crepe. Chi lo dimentica, scopre le crepe solo quando la dashboard ha già preso una decisione al suo posto.
La tesi fondamentale
Ogni dato nasce da scelte di raccolta, definizione e trasformazione, quindi una dashboard mostra un’evidenza condizionata e mai la realtà senza filtri. Leggere quel dato senza conoscerne le condizioni è una forma di autoinganno.
La procedura di ricostruzione
- Risali dalla metrica alla fonte e nomina ogni trasformazione intermedia.
- Leggi definizioni, filtri e criteri di inclusione che hanno creato il dataset.
- Verifica copertura e selezione confrontando il campione con la popolazione bersaglio.
- Replica il risultato con un taglio indipendente di dati o di periodo.
- Dichiara per iscritto cosa il dato non può dire prima di usarlo per decidere.
Il dato è costruito
Ogni scelta lungo la pipeline lascia una traccia. La tabella dice dove cercarla, perché il problema non è avere scelte ma non saperle riconoscere.
| Scelta | Domanda da fare | Traccia da lasciare |
|---|---|---|
| Raccolta | Chi resta fuori dal campione? | Copertura e criteri di inclusione |
| Definizione | Cosa conta come evento? | Dizionario metriche con esempi limite |
| Trasformazione | Quali filtri e join creano la tabella? | Query versionata e riproducibile |
| Selezione | Quale periodo e quale popolazione? | Finestra temporale e popolazione bersaglio |
Verdetto: un numero senza storia della sua costruzione non è evidenza ma voce di corridoio con una dashboard intorno.
Evidenza, interpretazione, decisione
Un comitato legge una crescita di retention come prova che la nuova iniziativa ha funzionato. Chi applica l’epistemologia dei dati separa osservazione, spiegazione, assunzione e decisione, perché ogni piano sbagliato in modo diverso.
| Evidenza | Interpretazione prudente | Decisione conseguente |
|---|---|---|
| Segnale positivo ma non isolato | Il fenomeno esiste, ma la causa è incerta | Cercare baseline o holdout |
| Segmento con risposta diversa | L’effetto medio nasconde eterogeneità | Analizzare coorti o sottogruppi |
| Costo operativo crescente | Il risultato va valutato sul margine | Applicare soglie economiche |
La regola è semplice: una misura serve solo se riduce l’incertezza su una decisione specifica.
L’errore che svuota tutto
L’errore più comune è trattare l’epistemologia dei dati come una definizione da mandare a memoria invece che come un protocollo decisionale: metriche senza baseline, grafici senza ipotesi e raccomandazioni senza costo dell’errore. Il controllo che lo smaschera è una domanda sola: se questo risultato fosse falso, quale decisione sbaglierei.
Riferimenti essenziali
- Stevens, S. S. (1946). On the Theory of Scales of Measurement. Science.
- Squire, P. (1988). Why the 1936 Literary Digest Poll Failed. Public Opinion Quarterly.
- Hume, D. (1748). An Enquiry Concerning Human Understanding.
Due milioni di voti, un campione sbagliato
Nel 1936 il Literary Digest raccolse oltre due milioni di schede e pronosticò la vittoria di Landon su Roosevelt alle presidenziali americane. Roosevelt vinse invece 46 stati su 48 e la rivista non si riprese mai dallo smacco. L’errore non era nella quantità ma nella costruzione: schede spedite ad abbonati ed elenchi telefonici selezionavano un’America più ricca e più repubblicana. Gallup, con un campione molto più piccolo ma costruito per quote rappresentative, azzeccò il risultato. È la lezione epistemologica in forma pura: milioni di righe distorte sanno meno di poche migliaia ben scelte.
Domande di verifica sull’evidenza
- Da quale fonte nasce il dato e quali trasformazioni ha subito?
- Chi resta fuori dal campione e come distorce la lettura?
- Quale taglio indipendente conferma il risultato?
- Cosa dichiari che questo dato non può dire?
Bloccato su questo argomento o vuoi applicarlo al tuo caso? Prenota una call di 15 minuti con un analista esperto.
Percorso collegato
Lezioni da leggere insieme
Questi collegamenti portano la lezione dentro il resto del corso: basi da riprendere, passaggi successivi e connessioni tematiche tra moduli.