
Simpson's paradox and confounding
Why aggregated and disaggregated data tell opposite stories.
What you will learn
- Riconoscere il paradosso di Simpson quando aggregato e segmenti raccontano storie opposte
- Individuare la variabile confondente che distribuisce i casi tra i segmenti
- Calcolare i tassi per segmento e decidere il livello di lettura con il criterio causale
Simpson’s paradox e confounding: decidere quando i dati si contraddicono
Nel binario ml-tabellare, il paradosso di Simpson e il confounding mettono in guardia da chi legge i dati aggregati senza guardare la composizione delle popolazioni che ci stanno dentro. Quando un tasso di conversione migliora nel complesso ma peggiora in ogni singolo segmento importante, non sei davanti a un errore di calcolo. Non è nemmeno una stranezza statistica. Stai vedendo la composizione e i fattori confondenti che distorcono la lettura del fenomeno.
Il paradosso in una frase
Il paradosso di Simpson scatta quando una variabile nascosta ribalta il risultato: l’aggregato dice una cosa e ogni segmento omogeneo dice l’opposto. La media non mente, ma mescola storie diverse.
Quando un dato regge davvero una decisione
Il problema centrale è capire quando un dato sostiene davvero una decisione e quando nasconde assunzioni sbagliate, bias o nessi causali fragili. La domanda che conta non è se il numero è salito o sceso. È quale decisione cambia grazie a questo numero. Simpson e il confounding servono proprio a frenare le conclusioni affrettate che portano a scelte sbagliate.
Il paradosso di Simpson non è un difetto dei dati né un gioco di laboratorio: è il segnale che manca una terza variabile capace di ribaltare la lettura. Il lavoro non è difendere il numero che hai calcolato, ma trovare la variabile che lo spiega davvero. Se la presentazione del dato non contiene questa ricerca, la decisione che ne segue regge su fondamenta non verificate.
Aggregato contro segmenti: come nasce il ribaltamento
Il ribaltamento nasce quando una terza variabile distribuisce i casi in modo diseguale tra i segmenti e influenza anche l’esito. La terza variabile si chiama confondente. L’aggregato mescola composizione ed effetto, e la composizione vince. La difesa è una sola: calcola il tasso su ogni segmento omogeneo, confronta il verso dei risultati e cerca la variabile che assegna i casi ai segmenti prima di fidarti della media.
Il tasso aggregato non è una media semplice dei tassi dei segmenti: è una media pesata per il numero di casi di ciascun segmento. Se il novanta per cento dei casi appartiene a un segmento con tasso basso e il dieci per cento a un segmento con tasso alto, l’aggregato assomiglia al segmento che contribuisce più casi, non a quello che ha l’esito migliore. I volumi diversi tra segmenti sono la norma nel mondo reale: pochi clienti grandi e molti piccoli, pochi casi gravi e molti lievi.
Verdetto: quando aggregato e segmenti litigano, fidati dei segmenti con la causa corretta, mai della media che li mescola.
Cinque passi per non cadere nel paradosso
- Calcola il tasso sull’aggregato e separatamente su ogni segmento rilevante.
- Confronta i versi: se divergono, cerca la variabile che distribuisce i casi tra i segmenti.
- Disegna le frecce tra variabile nascosta, esposizione ed esito prima di scegliere.
- Decidi il livello corretto con il criterio causale, non con la numerosità.
- Riporta entrambi i livelli e dichiara su quali basi la decisione.
L’errore più comune
L’errore tipico è trattare Simpson e il confounding come una definizione da memorizzare invece che come un protocollo per decidere. Presentare metriche senza baseline, grafici senza ipotesi o raccomandazioni che ignorano il costo dell’errore porta dritti a conclusioni fragili. Il controllo da fare è chiedersi: se questo risultato fosse falso, quale decisione sbaglieresti. Se non hai una risposta chiara, l’analisi non è finita.
Il secondo errore è fermarsi all’indizio: vedere il ribaltamento e non cercare la variabile che lo causa. Rivelare che aggregato e segmenti divergono non basta, perché esistono casi in cui la lettura corretta sta proprio nell’aggregato, per esempio quando il confondente è la severità del caso e non l’esposizione in esame. Il terzo errore è aggiustare il risultato a valle, cambiando metrica o togliendo un segmento, invece di risalire all’assegnazione dei casi.
Riconoscere che stai sbagliando
- Hai cambiato la conclusione aggiungendo una colonna al report: è il segnale che la colonna era il confondente.
- Il titolo usa il tasso aggregato e i segmenti finiscono in appendice.
- Confronti due tassi senza dichiarare quanti casi sta dietro a ciascuno.
- Scegli il livello di lettura, aggregato o segmenti, dopo aver visto i risultati: prima decidi la domanda e la causa, poi guardi i numeri.
- Nessun segmento ha la numerosità per reggere il confronto, ma la decisione procede comunque.
References
References: Bickel, P. J., Hammel, E. A. e O’Connell, J. W. (1975). Sex Bias in Graduate Admissions: Data from Berkeley. Science. Julious, S. A. e Mullee, M. A. (1994). Confounding and Simpson’s paradox. BMJ.
Il caso Berkeley del 1973
Nel 1973 l’Università di Berkeley fu accusata di discriminare le donne nelle ammissioni: risultavano ammessi il 44% dei candidati uomini contro il 35% delle donne. Bickel, Hammel e O’Connell scomposero i dati per dipartimento e trovarono il ribaltamento: a parità di corso le donne erano ammesse più spesso, ma si candidavano in massa ai corsi più selettivi. Pubblicato su Science nel 1975, il caso resta il più insegnato di paradosso di Simpson. L’aggregato accusava e il disaggregato assolveva, e la variabile mancante, la selettività dei dipartimenti, decideva il verdetto.
La scomposizione dei sei dipartimenti più grandi mostra la stessa fotografia in cifre: nel dipartimento A le donne erano ammesse all’82% contro il 62% degli uomini; nel dipartimento B 68% contro il 63%; persino nel F, il più selettivo con il 6% di ammissioni totali, il tasso femminile era 7% contro il 6% maschile. L’aggregato di quelle sei facoltà raccontava però il 45% per gli uomini e il 30% per le donne, perché le donne presentavano domanda in proporzione molto maggiore ai dipartimenti C, E e F, quelli con i tassi più bassi. Senza la scomposizione per corso, la lettura causale era impossibile; con la scomposizione, l’accusa cadeva.
Lo stesso ribaltamento in medicina: i calcoli renali del 1986
Il paradosso non riguarda solo i test d’ammissione. Nel 1986 Charig e colleghi pubblicarono sul BMJ un confronto tra due trattamenti per i calcoli renali: la chirurgia aperta (A) e una chirurgia chiusa (B). I dati, resi celebri dal successivo articolo di Julious e Mullee su BMJ nel 1994, sono questi.
| Tipo di calcolo | Trattamento A | Trattamento B |
|---|---|---|
| Calcoli piccoli | 93% (81 su 87) | 87% (234 su 270) |
| Calcoli grandi | 73% (192 su 263) | 69% (55 su 80) |
| Total | 78% (273 su 350) | 83% (289 su 350) |
Sui calcoli piccoli e su quelli grandi il trattamento A vince; sul totale vince il B. Il confondente è la gravità del caso: i medici assegnavano i calcoli grandi, più difficili, al trattamento A, che si portava dietro i casi peggiori, mentre il B raccoglieva in massa i calcoli piccoli. Il livello di lettura corretto è quello dei segmenti omogenei per gravità: la fiducia nell’aggregato non dipende da quanto il numero è alto, ma da quale variabile ha deciso chi finisce in che gruppo.
Domande per chiudere la lezione
- Aggregato e segmenti raccontano la stessa storia o due opposte?
- Quale variabile nascosta distribuisce i casi tra i segmenti?
- Quale livello di lettura useresti per decidere e perché?
- Quale controllo ripeteresti a ogni aggiornamento dei dati?
- Di quale variabile hai misurato la distribuzione dei casi prima di fidarti del totale?
Bloccato su questo argomento o vuoi applicarlo al tuo caso? Prenota una call di 15 minuti con un analista esperto.
Related Path
Lessons to read together
Questi collegamenti portano la lezione dentro il resto del corso: basi da riprendere, passaggi successivi e connessioni tematiche tra moduli.