
Judea Pearl, DAG, and the causal revolution
How Pearl transformed statistics from descriptive to causal and what it means for the analyst.
What you will learn
- Understand the analytical problem and the decision-making context
- Apply examples, metrics, and controls to real cases
Judea Pearl, DAG, and the causal revolution
Per decidere sotto incertezza non basta osservare correlazioni: serve un metodo per distinguere associazione e causalità. Il lavoro di Judea Pearl, con i DAG e quella che lui chiama la rivoluzione causale, dà gli strumenti per rendere esplicite le assunzioni, riconoscere i confondenti e ragionare sugli interventi.
Real-world problem
Mettiamo che tu voglia capire se uno sconto aumenta la retention dei clienti. I clienti più fedeli ricevono offerte diverse e comprano già di più, quindi una semplice tabella non basta. Ti serve una mappa delle relazioni causali per non leggere male i numeri. Questa lezione serve proprio a capire quando i dati sostengono davvero una decisione e quando invece nascondono un bias o una domanda formulata male.
Conceptual model
flowchart LR
A["Observation"]
B["Assumption"]
C["Model"]
D["Evidence"]
E["Decision"]
A --> B
B --> C
C --> D
D --> E
Il processo corretto parte da una domanda concreta, definisce variabili osservabili e assunzioni, valuta la qualità del dato e arriva a una decisione. Quando si salta un passaggio si ottengono analisi eleganti ma fragili.
| Step | Guiding question | Expected output |
|---|---|---|
| Framing | Which decision needs to change? | A concrete choice, not a curiosity |
| Measure | Which signal represents the phenomenon? | Metric, source, and granularity |
| Comparison | Compared to which baseline do I interpret the result? | Benchmark or plausible counterfactual |
| Action | What do I do if the signal exceeds the threshold? | Decision, owner, and next check |
Gli elementi della causalità
La causalità qui si legge come relazione tra unità di analisi, segnale, baseline e decisione:
| Element | Operational Definition |
|---|---|
| Unit | observation, hypothesis, variable, causal mechanism, or evidence criterion |
| Signal | strength of evidence, causal consistency, robustness of assumptions, cost of decision error |
| Baseline | alternative explanation, counterfactual, comparable group, or no-intervention scenario |
| Decision | accept, reject, or reformulate an explanation before using it |
| Risk | confusing correlation, data quality, and causal decision-making |
Una misura serve a qualcosa solo se riduce l’incertezza su una decisione precisa. Se non cambia la scelta è decorativa. Se cambia la scelta senza controlli a monte, è rischiosa.
Pearl’s three levels of causality
| Level | Name | Question | Tool |
|---|---|---|---|
| L1 | Association | What do I see? | Conditional probability, correlation, regression |
| L2 | Intervention | What happens if I do X? | DAG + do-calculus, randomized experiments |
| L3 | Counterfactual | What would have happened if I had done Y instead of X? | Structural causal models (SCM) |
You can’t answer L2 or L3 questions using only L1 tools. A regression model tells you associations only. To move to “what happens if I do X?” you need an explicit causal model.
DAGs: Directed Acyclic Graphs
A DAG is a directed acyclic graph representing causal relationships between variables. An arrow indicates direct causality; the absence of an arrow is an equally important assumption of no causality.
Example: ice cream and drownings
flowchart TD
A["Summer Temperature"] --> B["Ice Cream Sales"]
A --> C["Drownings"]
Summer temperature causes both ice cream sales and drownings. There’s no arrow between ice cream and drownings: we assume no direct causality. Controlling for temperature, the correlation disappears.
Example: app onboarding
flowchart LR
A["Onboarding quality"] --> B["Day 0 activation"]
B --> C["Day 7 retention"]
A --> C
Two causal paths from onboarding to retention: one mediated by activation, one direct. The DAG shows which variables to control to isolate the effect.
The do-operator: distinguishing “seeing” from “doing”
P(Y | X) is the probability of Y given that I have observed X (L1). P(Y | do(X)) is the probability of Y if I force X (L2).
Esempio: chi usa la feature search ha retention più alta. P(retention | search) è alta, ma P(retention | do(search)), cioè cosa succede se forzi un utente a usare la search, potrebbe essere tutt’altra cosa. Forzare è esattamente ciò che fa un A/B test. Senza esperimenti puoi approssimare do(X) con la backdoor adjustment formula, ma ti serve conoscere il DAG.
Example or case study
Amazon observes that products with more reviews sell better. The question is: if you force a product to have more reviews, do sales increase?
The DAG reveals a confounder:
flowchart TD
A["Product quality"] --> B["Reviews"]
A --> C["Sales"]
B --> C
La qualità del prodotto causa sia le recensioni sia le vendite. Controllando per la qualità, l’effetto delle recensioni sulle vendite si rivela molto più piccolo di quanto lasci credere la correlazione grezza. Amazon ha fatto degli esperimenti e ha calibrato il budget delle campagne su questo effetto reale, non su quello apparente.
How to apply Pearl today
Disegna il DAG prima di modellare, anche solo con carta e penna, e chiediti quali variabili causano quali e cosa confonde cosa. Poi individua il livello della tua analisi: se la domanda è di tipo L2 ma stai usando strumenti L1, stai rispondendo male alla domanda sbagliata. Infine applica il criterio della backdoor: per stimare l’effetto causale di X su Y, controlla tutte le variabili che causano sia X sia Y.
Lab / exercise
Basic level
Write in five lines: objective, primary metric, baseline, main risk, and planned action for a real decision related to this lesson.
Intermediate level
Build a table with at least three segments or scenarios. For each indicate signal, possible alternative explanation, and necessary check before deciding.
Research-grade level
Design a validation plan: hypothesis, required data, exclusion criteria, decision threshold, and post-decision check. Specify what would make you change your mind.
Recommended datasets and materials
Use decision case studies, product metrics, experiment results, simple DAGs, analytical reports, and simulated time series. If you lack real data, create a synthetic dataset with at least 200 rows, one time column, one segment column, one outcome metric, and one exposure variable.
Typical mistake to avoid
Questa lezione non è una definizione da ricordare, è un protocollo decisionale. Evita di presentare metriche senza baseline, grafici senza ipotesi o raccomandazioni senza stimare il costo dell’errore. Chiediti sempre: se questo risultato fosse falso, quale decisione sbaglierei? Se non sai rispondere, devi approfondire prima di decidere.
Quiz or checkpoint
- What is the concrete decision this lesson should improve?
- Which baseline makes the result interpretable?
- Which assumption, if wrong, would change the conclusion?
- What minimum check would you use before presenting the recommendation?
Operational Summary
Il metodo di Pearl, con i DAG e il do-calculus, serve a collegare concetto, dato e decisione. Si parte da un problema reale, si formalizza il segnale, si cerca una baseline credibile, si costruisce un esempio e si chiude con un controllo pratico. Quando lavori così, i dati diventano decisioni su cui puoi davvero contare sotto incertezza.
References:
- Pearl, J. (2000). Causality: Models, Reasoning, and Inference. Cambridge University Press.
- Pearl, J. & Mackenzie, D. (2018). The Book of Why: The New Science of Cause and Effect. Basic Books.
- Pearl, J., Glymour, M. & Jewell, N.P. (2016). Causal Inference in Statistics: A Primer. Wiley.
Related Path
Lessons to read together
Questi collegamenti portano la lezione dentro il resto del corso: basi da riprendere, passaggi successivi e connessioni tematiche tra moduli.