Go to main content
Cheat Sheet: Foundations and Metrics - official lesson image on GinnyTech, created by AD

Correlation, proxy metric, and causal reading of KPIs

How to avoid improper causal readings when KPIs, proxy metrics, and correlations seem to tell a stronger relationship than actually demonstrated.

AD
Created byAndrii Dyshkantiuk
Lesson 21 / 236Level: BeginnerDuration: 18 minPrerequisites: 1

What you will learn

  • Understand the analytical problem and the decision-making context
  • Apply examples, metrics, and controls to real cases

Correlation, proxy metric, and causal reading of KPIs

Una proxy metric può essere utilissima e pericolosa nello stesso momento. Click, visite, tempo speso: spesso anticipano il valore reale, ma a volte lo sostituiscono in modo pigro, e il team finisce per inseguire il numero invece dell’effetto che il numero dovrebbe rappresentare. Questa lezione serve a capire quando un indicatore è un ponte verso l’outcome e quando è solo una scorciatoia comoda.

Quando una proxy smette di rappresentare il valore

Nel nostro lavoro l’affermazione “correlazione non implica causalità” è ripetuta talmente spesso da rischiare di perdere la sua forza. Ignorarla, però, resta la via più rapida per prendere decisioni disastrose basate sui dati.

Una correlazione statistica, in termini formali, indica solo che due o più variabili si muovono insieme secondo uno schema riconoscibile. Se la variabile A aumenta, anche B tende ad aumentare (correlazione positiva) o a diminuire (correlazione negativa). Il coefficiente di correlazione di Pearson restituisce un valore tra -1 e +1 che quantifica forza e direzione di questa relazione linear. Un valore di +0.8 indica un’associazione positiva molto forte. Il problema nasce quando il nostro cervello, costruito per riconoscere pattern e fabbricare narrazioni causa-effetto, osserva quel +0.8 e conclude subito che A causes B.

Tre ragioni per cui la correlazione inganna

La realtà è quasi sempre più complessa. La prima ragione è la pura coincidenza, soprattutto in dataset con migliaia di variabili: su un numero abbastanza grande di confronti è statisticamente garantito trovare correlazioni spurie e assurde, come quella celebre tra il consumo pro capite di formaggio negli Stati Uniti e il numero di persone morte aggrovigliate nelle lenzuola.

La seconda è più insidiosa: la causalità inversa. Potremmo osservare che i clienti che usano la feature X hanno una retention più alta e concludere che X aumenta la retention. Potrebbe essere vero il contrario. I clienti più fidelizzati e soddisfatti sono quelli che esplorano di più il prodotto e finiscono per scoprire e usare la feature X. In questo caso non è la feature a tenerli legati, è il loro legame a portarli alla feature.

La terza è una variabile nascosta che muove entrambe. Quando due numeri salgono insieme, prima di disegnare una freccia conviene chiedersi se non ci sia un terzo fattore che li spinge tutti e due.

Come leggere un KPI prima di fidarti

Conviene leggere ogni indicatore come una serie di controlli rapidi. Qual è l’outcome reale che vuoi muovere. Quale proxy lo rappresenta. Quale comportamento indesiderato quella proxy può incentivare. Quale prova ti servirebbe per fidarti del collegamento. La causalità non si improvvisa guardando due linee che salgono insieme.

StepQuestion to askExpected output
DecisionChe cosa cambia se capiamo meglio la relazione tra proxy e outcome?Scelta esplicita
SignalQuale dato osservabile riduce l’incertezza?Metrica o evento
BaselineRispetto a cosa interpretiamo il risultato?Credible comparison
VincoloChe cosa può falsare la lettura?Assunzione da dichiarare
ActionQuale passo operativo segue?Raccomandazione controllabile

Ogni riga deve rendere più chiaro il costo di una decisione sbagliata, altrimenti diventa un rituale vuoto.

Rendere visibili le assunzioni

Formalizzare non significa complicare. Significa scrivere nero su bianco le ipotesi, così uno stakeholder può discutere il criterio decisionale invece di fidarsi del risultato per autorità. Conviene fissare cinque elementi prima di leggere il dato.

ElementOperational DefinitionControllo minimo
Unit of analysisOggetto su cui misuri il fenomenoUtente, account, evento, ordine o periodo
Variabile osservataSegnale che rappresenta il comportamentoDefinizione stabile e tracciabile
BaselineStato contro cui confronti il segnalePeriodo, segmento, controllo o benchmark
Soglia decisionalePunto in cui cambia l’azioneCriterio scritto prima della lettura
Rischio residuoErrore che può restare anche dopo l’analisiSensitivity check o revisione qualitativa

Un caso concreto

Immagina un team che deve decidere se cambiare una pipeline, una metrica, un investimento o una dashboard sulla base di una correlazione osservata. La domanda non è “qual è la definizione corretta?” ma “quale scelta diventa meno rischiosa se questa analisi è fatta bene?”.

SituationCautious interpretationDecision
Il dato migliora ma la baseline è deboleIl segnale potrebbe essere reale o dipendere dal campioneRafforzare il confronto prima di scalare
La metrica cambia in un solo segmentoThe average effect hides heterogeneitySeparate cohorts or use cases
Il costo operativo aumentaIl beneficio va valutato sul margineApplicare una soglia economica esplicita
Il sistema produce numeri incoerentiLa fiducia nel dato è parte della decisioneCorreggere ownership e controlli

Esercizio

Parti da un livello base. Scrivi in cinque righe quale decisione concreta dovrebbe migliorare grazie a una lettura corretta della correlazione tra proxy e outcome. Indica metrica, unità di analisi, baseline e rischio principale. Se non riesci a nominare la decisione, il problema è ancora troppo astratto.

Al livello intermedio costruisci una tabella con quattro colonne: segnale osservato, interpretazione prudente, controllo necessario, azione consigliata. Usa almeno un caso in cui il segnale non basta per decidere.

Al livello research-grade trasforma l’esercizio in un memo decisionale che includa assunzioni, criteri di esclusione, soglia di intervento, sensitivity check e una proposta di monitoraggio dopo la decisione. Per i dati ti basta un export reale, una tabella sintetica, una dashboard interna o un notebook di studio, purché contenga almeno una dimensione di segmento, una metrica osservabile e un periodo di confronto.

L’errore tipico

L’errore più comune è usare la correlazione come etichetta tecnica invece che come criterio di scelta. Succede quando il team presenta un numero senza dire quale decisione cambia, quale baseline lo rende interpretabile e quale rischio resta aperto. In quel caso il dato sembra preciso, ma non guida nessuna azione. Per controllarti puoi rispondere a poche domande: quale decisione dovrebbe cambiare, quale unità di analisi rende il problema misurabile, quale baseline eviti di leggere il numero isolato, quale assunzione se falsa ribalterebbe la conclusione, quale controllo presenteresti prima di raccomandare un’azione.

La correlazione è utile quando riduce l’incertezza su una scelta reale, non quando decora una slide. La forma corretta del ragionamento resta sempre la stessa: decisione, segnale, baseline, rischio e azione. Un esempio, una formula o un frammento tecnico vale la pena tenerlo solo se rende più affidabile uno di questi passaggi.