Go to main content
Judea Pearl, DAG e rivoluzione causale - immagine ufficiale della lezione su GinnyTech, creata da AD

Judea Pearl, DAG, and the causal revolution

How Pearl transformed statistics from descriptive to causal and what it means for the analyst.

AD
Created byAndrii Dyshkantiuk
Lesson 204 / 236Level: AdvancedDuration: 18 minPrerequisites: 1

What you will learn

  • Understand the analytical problem and the decision-making context
  • Apply examples, metrics, and controls to real cases

Judea Pearl, DAG, and the causal revolution

Per decidere sotto incertezza non basta osservare correlazioni: serve un metodo per distinguere associazione e causalità. Il lavoro di Judea Pearl, con i DAG e quella che lui chiama la rivoluzione causale, dà gli strumenti per rendere esplicite le assunzioni, riconoscere i confondenti e ragionare sugli interventi.

Real-world problem

Mettiamo che tu voglia capire se uno sconto aumenta la retention dei clienti. I clienti più fedeli ricevono offerte diverse e comprano già di più, quindi una semplice tabella non basta. Ti serve una mappa delle relazioni causali per non leggere male i numeri. Questa lezione serve proprio a capire quando i dati sostengono davvero una decisione e quando invece nascondono un bias o una domanda formulata male.

Conceptual model

flowchart LR
    A["Observation"]
    B["Assumption"]
    C["Model"]
    D["Evidence"]
    E["Decision"]
    A --> B
    B --> C
    C --> D
    D --> E

Il processo corretto parte da una domanda concreta, definisce variabili osservabili e assunzioni, valuta la qualità del dato e arriva a una decisione. Quando si salta un passaggio si ottengono analisi eleganti ma fragili.

StepGuiding questionExpected output
FramingWhich decision needs to change?A concrete choice, not a curiosity
MeasureWhich signal represents the phenomenon?Metric, source, and granularity
ComparisonCompared to which baseline do I interpret the result?Benchmark or plausible counterfactual
ActionWhat do I do if the signal exceeds the threshold?Decision, owner, and next check

Gli elementi della causalità

La causalità qui si legge come relazione tra unità di analisi, segnale, baseline e decisione:

ElementOperational Definition
Unitobservation, hypothesis, variable, causal mechanism, or evidence criterion
Signalstrength of evidence, causal consistency, robustness of assumptions, cost of decision error
Baselinealternative explanation, counterfactual, comparable group, or no-intervention scenario
Decisionaccept, reject, or reformulate an explanation before using it
Riskconfusing correlation, data quality, and causal decision-making

Una misura serve a qualcosa solo se riduce l’incertezza su una decisione precisa. Se non cambia la scelta è decorativa. Se cambia la scelta senza controlli a monte, è rischiosa.

Pearl’s three levels of causality

LevelNameQuestionTool
L1AssociationWhat do I see?Conditional probability, correlation, regression
L2InterventionWhat happens if I do X?DAG + do-calculus, randomized experiments
L3CounterfactualWhat would have happened if I had done Y instead of X?Structural causal models (SCM)

You can’t answer L2 or L3 questions using only L1 tools. A regression model tells you associations only. To move to “what happens if I do X?” you need an explicit causal model.

DAGs: Directed Acyclic Graphs

A DAG is a directed acyclic graph representing causal relationships between variables. An arrow indicates direct causality; the absence of an arrow is an equally important assumption of no causality.

Example: ice cream and drownings

flowchart TD
  A["Summer Temperature"] --> B["Ice Cream Sales"]
  A --> C["Drownings"]

Summer temperature causes both ice cream sales and drownings. There’s no arrow between ice cream and drownings: we assume no direct causality. Controlling for temperature, the correlation disappears.

Example: app onboarding

flowchart LR
  A["Onboarding quality"] --> B["Day 0 activation"]
  B --> C["Day 7 retention"]
  A --> C

Two causal paths from onboarding to retention: one mediated by activation, one direct. The DAG shows which variables to control to isolate the effect.

The do-operator: distinguishing “seeing” from “doing”

P(Y | X) is the probability of Y given that I have observed X (L1). P(Y | do(X)) is the probability of Y if I force X (L2).

Esempio: chi usa la feature search ha retention più alta. P(retention | search) è alta, ma P(retention | do(search)), cioè cosa succede se forzi un utente a usare la search, potrebbe essere tutt’altra cosa. Forzare è esattamente ciò che fa un A/B test. Senza esperimenti puoi approssimare do(X) con la backdoor adjustment formula, ma ti serve conoscere il DAG.

Example or case study

Amazon observes that products with more reviews sell better. The question is: if you force a product to have more reviews, do sales increase?

The DAG reveals a confounder:

flowchart TD
  A["Product quality"] --> B["Reviews"]
  A --> C["Sales"]
  B --> C

La qualità del prodotto causa sia le recensioni sia le vendite. Controllando per la qualità, l’effetto delle recensioni sulle vendite si rivela molto più piccolo di quanto lasci credere la correlazione grezza. Amazon ha fatto degli esperimenti e ha calibrato il budget delle campagne su questo effetto reale, non su quello apparente.

How to apply Pearl today

Disegna il DAG prima di modellare, anche solo con carta e penna, e chiediti quali variabili causano quali e cosa confonde cosa. Poi individua il livello della tua analisi: se la domanda è di tipo L2 ma stai usando strumenti L1, stai rispondendo male alla domanda sbagliata. Infine applica il criterio della backdoor: per stimare l’effetto causale di X su Y, controlla tutte le variabili che causano sia X sia Y.

Lab / exercise

Basic level

Write in five lines: objective, primary metric, baseline, main risk, and planned action for a real decision related to this lesson.

Intermediate level

Build a table with at least three segments or scenarios. For each indicate signal, possible alternative explanation, and necessary check before deciding.

Research-grade level

Design a validation plan: hypothesis, required data, exclusion criteria, decision threshold, and post-decision check. Specify what would make you change your mind.

Recommended datasets and materials

Use decision case studies, product metrics, experiment results, simple DAGs, analytical reports, and simulated time series. If you lack real data, create a synthetic dataset with at least 200 rows, one time column, one segment column, one outcome metric, and one exposure variable.

Typical mistake to avoid

Questa lezione non è una definizione da ricordare, è un protocollo decisionale. Evita di presentare metriche senza baseline, grafici senza ipotesi o raccomandazioni senza stimare il costo dell’errore. Chiediti sempre: se questo risultato fosse falso, quale decisione sbaglierei? Se non sai rispondere, devi approfondire prima di decidere.

Quiz or checkpoint

  1. What is the concrete decision this lesson should improve?
  2. Which baseline makes the result interpretable?
  3. Which assumption, if wrong, would change the conclusion?
  4. What minimum check would you use before presenting the recommendation?

Operational Summary

Il metodo di Pearl, con i DAG e il do-calculus, serve a collegare concetto, dato e decisione. Si parte da un problema reale, si formalizza il segnale, si cerca una baseline credibile, si costruisce un esempio e si chiude con un controllo pratico. Quando lavori così, i dati diventano decisioni su cui puoi davvero contare sotto incertezza.


References:

  • Pearl, J. (2000). Causality: Models, Reasoning, and Inference. Cambridge University Press.
  • Pearl, J. & Mackenzie, D. (2018). The Book of Why: The New Science of Cause and Effect. Basic Books.
  • Pearl, J., Glymour, M. & Jewell, N.P. (2016). Causal Inference in Statistics: A Primer. Wiley.