Go to main content
Experimental Design, Randomization, and Metrics - official lesson image on GinnyTech, created by AD

Experimental design, randomization, and unit of analysis

Experimental design, randomization, and unit of analysis. Core lesson of the module Statistical Significance, A/B Testing, and Experimentation Science with a real problem, conceptual model, rigorous formalization, applied case, 3-level lab, and final checkpoint.

AD
Created byAndrii Dyshkantiuk
Lesson 175 / 236Level: AdvancedDuration: 18 minPrerequisites: 1

What you will learn

  • Understand the analytical problem and the decision-making context
  • Apply examples, metrics, and controls to real cases

Experimental design, randomization, and unit of analysis

Il disegno sperimentale è il punto in cui un’idea di business diventa una prova controllabile. Questa lezione appartiene alla categoria Decisione, quindi non serve accumulare definizioni: serve capire quale scelta cambia quando il dato diventa più affidabile. Un test può essere calcolato in modo statisticamente impeccabile e restare comunque mal disegnato, ad esempio quando randomizzi la sessione ma prendi decisioni sull’utente, oppure misuri conversioni mentre l’effetto atteso riguarda la retention. Mettere ordine tra unità di randomizzazione, metrica primaria e guardrail viene prima del calcolo.

Il problema prima del calcolo

Il problema non è conoscere il disegno sperimentale in astratto, ma decidere cosa fare quando il team lavora con dati incompleti, metriche ambigue o vincoli tecnici che rendono fragile la lettura del fenomeno. Una lezione utile deve separare il segnale dal rumore, indicare quale baseline usare e mostrare quale azione diventa più difendibile dopo l’analisi.

Il fallimento più comune nasce quando tutti riconoscono che il disegno conta, ma nessuno sa dire quale decisione dipenda davvero da questo tema. Si aprono dashboard, si leggono report, si discutono strumenti, e intanto la domanda operativa resta implicita: ogni stakeholder usa parole simili con significati diversi. Nel lavoro reale questo costa subito caro. Le priorità cambiano al rumore del momento, le letture non sono confrontabili nel tempo e la responsabilità si sposta appena il risultato delude. Per questo conviene partire da una domanda concreta: come formulare il disegno in modo che il team prenda una decisione migliore, non solo una discussione più elegante.

Il modello di lavoro

Conviene leggere il disegno come un ponte tra contesto, misura e azione, separando quattro blocchi: la decisione da supportare, i segnali osservabili, il meccanismo che collega segnali e decisione, e i guardrail che limitano gli errori di interpretazione. La domanda corretta non è solo “cosa misuro?”, ma anche quale ipotesi sto assumendo, quale rischio sto introducendo e quale output mi aspetto di produrre alla fine.

Una sequenza operativa aiuta a non trasformare una nozione tecnica in un rituale vuoto. Ogni passaggio dovrebbe rendere più chiaro il costo di una decisione sbagliata.

StepQuestion to askExpected output
DecisionChe cosa cambia se capiamo meglio il disegno sperimentale?Scelta esplicita
SignalQuale dato osservabile riduce l’incertezza?Metrica o evento
BaselineRispetto a cosa interpretiamo il risultato?Credible comparison
VincoloChe cosa può falsare la lettura?Assunzione da dichiarare
ActionQuale passo operativo segue?Raccomandazione controllabile

La formalizzazione

Formalizzare non significa complicare. Serve a rendere visibili le assunzioni, così uno stakeholder può discutere il criterio decisionale invece di fidarsi del risultato per autorità. Una buona formalizzazione esplicita definizioni, unità di analisi, denominatori, segmentazioni rilevanti, condizioni di validità e failure mode. Il criterio resta semplice: se due persone esperte leggono la stessa definizione e guardano lo stesso materiale, devono arrivare a conclusioni comparabili sugli stessi trade-off. Quando questo non succede, il problema non è lo strumento ma la formalizzazione.

ElementOperational DefinitionControllo minimo
Unit of analysisOggetto su cui misuri il fenomenoUtente, account, evento, ordine o periodo
Variabile osservataSegnale che rappresenta il comportamentoDefinizione stabile e tracciabile
BaselineStato contro cui confronti il segnalePeriodo, segmento, controllo o benchmark
Soglia decisionalePunto in cui cambia l’azioneCriterio scritto prima della lettura
Rischio residuoErrore che può restare anche dopo l’analisiSensitivity check o revisione qualitativa

Il caso del test mal allineato

Prendi un team che randomizza le sessioni ma misura la retention degli utenti a 30 giorni. Il caso mostra perché unità di randomizzazione, unità di analisi e metrica devono allinearsi: se non lo fanno, l’esperimento può sembrare valido e produrre comunque inferenza sbagliata. Il valore non sta nel singolo numero, ma nella catena logica che collega contesto, misura e decisione. Allenare questo passaggio significa trasformare una situazione opaca in un output che si può discutere, correggere e difendere.

Per leggere un caso conviene tenere a mente alcune situazioni ricorrenti e la decisione che ciascuna suggerisce.

SituationCautious interpretationDecision
Il dato migliora ma la baseline è deboleIl segnale potrebbe essere reale o dipendere dal campioneRafforzare il confronto prima di scalare
La metrica cambia in un solo segmentoThe average effect hides heterogeneitySeparate cohorts or use cases
Il costo operativo aumentaIl beneficio va valutato sul margineApplicare una soglia economica esplicita
Il sistema produce numeri incoerentiLa fiducia nel dato è parte della decisioneCorreggere ownership e controlli

Per analizzare un caso conviene seguire quattro passaggi: chiarire quale decisione vogliamo migliorare, individuare definizioni e variabili che contano davvero, cercare dove il modello potrebbe ingannare e infine scegliere cosa fare e perché.

Lab a tre livelli

Al livello base, scrivi in cinque righe quale decisione concreta il disegno dovrebbe migliorare. Indica metrica, unità di analisi, baseline e rischio principale. Se non riesci a nominare la decisione, la lezione è ancora troppo astratta.

Al livello intermedio, usa il dataset pack del modulo per costruire una mini analisi con quattro colonne: segnale osservato, interpretazione prudente, controllo necessario, azione consigliata. Inserisci almeno un caso in cui il segnale da solo non basta per decidere.

Al livello research-grade, trasforma l’esercizio in un memo decisionale. Il memo deve includere assunzioni, criteri di esclusione, soglia di intervento, sensitivity check e una proposta di monitoraggio dopo la decisione, confrontando due modi diversi di trattare il disegno per vedere quale formulazione regge meglio davanti a una review rigorosa.

Per i materiali puoi usare un export reale, una tabella sintetica, una dashboard interna o un notebook di studio. Il dataset deve contenere almeno una dimensione di segmento, una metrica osservabile e un periodo o baseline di confronto. Il pacchetto del modulo aggiunge un dataset realistico, query SQL, un notebook commentato e una soluzione guidata con checklist e rubric, utile per allenare il modulo senza restare nel solo piano teorico.

L’errore tipico da evitare

L’errore più frequente è scambiare familiarità con comprensione. Quando un tema viene citato spesso, il team tende a crederlo già definito abbastanza bene, mentre proprio i concetti più usati richiedono più rigore perché muovono più decisioni e più risorse. Il secondo errore è trattare il framework come una risposta invece che come uno strumento: se la formalizzazione non lascia spazio a ipotesi, eccezioni, limiti e possibili rotture del modello, stai costruendo un rituale invece di una pratica analitica. Concretamente, l’errore appare quando il team presenta un numero senza dire quale decisione cambia, quale baseline lo rende interpretabile e quale rischio resta aperto. In quel caso il dato sembra preciso ma non guida l’azione.

Checkpoint

  1. Quale decisione cambia davvero quando il disegno viene formalizzato meglio?
  2. Which unit of analysis makes the problem measurable?
  3. Quale baseline useresti per evitare una lettura isolata?
  4. Quale assunzione, se falsa, cambierebbe la conclusione?
  5. Which guardrails prevent reading noisy signals as if they were proof?

Practice deep dive

Per consolidare il disegno, trattalo come una piccola prova di lavoro dentro una decisione sperimentale in cui effetto, rumore, potenza e rischio business vanno letti insieme. Non basta dire di aver capito la lezione: devi produrre un piano o un memo di esperimento con ipotesi, MDE, guardrail, lettura e limite dichiarato. Questo obbliga a separare contesto, misura, azione e limite, e rende la conoscenza trasferibile.

Parti da una domanda semplice: quale scelta diventerebbe migliore se applicassi bene questa lezione? La risposta deve sempre collegare un problema reale a un output osservabile. Un esempio valido non deve essere grande. Può essere una tabella con una baseline e due segmenti, una query che verifica una definizione, un disegno di esperimento o un memo di dieci righe. La qualità non dipende dalla complessità tecnica, ma dalla tracciabilità del ragionamento: chi legge deve capire perché hai scelto quella metrica, quale alternativa hai scartato e quale evidenza ti farebbe cambiare idea.

Per il checkpoint di lavoro, scrivi la decisione che la lezione dovrebbe migliorare usando un verbo operativo come allocare, fermare, correggere, lanciare, misurare o investigare. Definisci poi il segnale principale e almeno un guardrail: il segnale dice dove guardi, il guardrail evita che una scelta localmente buona rovini il sistema. Aggiungi una baseline, perché senza non sai se il numero è alto, basso, stabile o solo raccontato male. Esplicita il rischio più probabile, cioè trasformare un p-value, una soglia o una curva di potenza in una sentenza più forte del disegno, e scrivilo prima della raccomandazione. Chiudi con un output consegnabile che un reviewer possa aprire e criticare.

Il disegno sperimentale è il punto in cui un’idea di business diventa una prova controllabile. Randomizzazione, unità di analisi e metrica primaria devono stare insieme: se una sola di queste scelte è fragile, il risultato finale sarà difficile da difendere. Prima di lanciare un test chiediti sempre chi viene assegnato, cosa viene misurato e quale comportamento vuoi davvero influenzare. La forma corretta della lezione resta decisione, segnale, baseline, rischio e azione, e tutto il resto serve solo se rende più affidabile uno di questi passaggi. Hai assimilato il tema quando riesci a spiegarlo senza gergo inutile, applicarlo a un caso piccolo ma realistico e difendere una raccomandazione includendo limiti e prossimi controlli.