Vai al contenuto principale
Disegno Sperimentale, Randomizzazione e Metriche - immagine ufficiale della lezione su GinnyTech, creata da AD

Disegno sperimentale, randomizzazione e unità di analisi

Allineare unità di randomizzazione, unità di analisi e metrica primaria, con randomizzazione bilanciata e guardrail che intercettano i danni collaterali.

AD
Creato daAndrii Dyshkantiuk
Lezione 175 / 236Livello: AvanzatoDurata: 18 minPrerequisiti: 1

Cosa imparerai

  • Allineare unità di randomizzazione, unità di analisi e metrica primaria
  • Assegnare le unità con randomizzazione bilanciata e stabile nel tempo
  • Aggiungere guardrail che intercettano danni collaterali anche quando la primaria migliora

Disegno sperimentale, randomizzazione e unità di analisi

Sul binario ml-tabellare il disegno è la prima riga del foglio di lavoro: chi viene assegnato a cosa, e che cosa misuriamo, si decide qui, prima di qualsiasi calcolo.

L’idea in una frase

Il disegno sperimentale decide chi viene assegnato a cosa e che cosa viene misurato, prima che qualsiasi calcolo abbia senso.

La procedura in cinque passi

  1. Definisci l’unità su cui deciderai, ad esempio utente, account o ordine, e usala come unità di randomizzazione.
  2. Assegna le unità a controllo e trattamento con una randomizzazione bilanciata e stabile nel tempo.
  3. Scegli una metrica primaria allineata al comportamento che vuoi davvero spostare.
  4. Aggiungi guardrail che intercettano danni collaterali anche quando la primaria migliora.
  5. Congela unità, metrica, durata e regola di lettura prima del lancio.

Il problema prima del calcolo

Il disegno è il punto in cui un’idea di business diventa una prova controllabile. Un test può essere calcolato in modo impeccabile e restare mal disegnato. Succede quando randomizzi la sessione ma decidi sull’utente. Succede quando misuri conversioni mentre l’effetto atteso riguarda la retention.

Mettere ordine tra unità di randomizzazione, metrica primaria e guardrail viene prima del calcolo. Senza allineamento, l’esperimento risponde a una domanda che nessuno aveva posto.

Il fallimento tipico è condiviso: tutti dicono che il disegno conta, ma nessuno lega il disegno a una decisione. Le priorità seguono il rumore del momento, le letture non sono confrontabili e la responsabilità si sposta appena il risultato delude.

Il modello di lavoro

Conviene leggere il disegno come un ponte tra contesto, misura e azione. Separa quattro blocchi: la decisione da supportare, i segnali osservabili, il meccanismo che collega segnali e decisione e i guardrail che limitano gli errori di lettura.

Questa separazione mostra subito i disallineamenti. Se l’unità di assegnazione non coincide con l’unità di decisione, l’indipendenza si rompe prima ancora di calcolare la significatività.

Parti dalla decisione: che cosa cambia se capiamo meglio il disegno sperimentale? Poi individua il segnale osservabile, la baseline di confronto, i vincoli che possono falsare la lettura e l’azione che segue. Ogni blocco deve avere una risposta scritta prima del lancio.

La formalizzazione

Formalizzare rende visibili le assunzioni. Così uno stakeholder discute il criterio decisionale invece di accettare il risultato per autorità. Il criterio resta semplice.

Se due esperti leggono la stessa definizione e guardano lo stesso materiale, devono arrivare a conclusioni comparabili sugli stessi trade-off. Senza definizioni stabili, la stessa metrica significa cose diverse in team diversi.

Serve definire l’unità di analisi, la variabile osservata, la baseline, la soglia decisionale e il rischio residuo. Ogni elemento ha un controllo minimo: una definizione stabile e tracciabile, un criterio scritto prima della lettura, una verifica di sensibilità.

Il caso del test mal allineato

Prendi un team che randomizza le sessioni ma misura la retention degli utenti a 30 giorni. Unità di randomizzazione, unità di analisi e metrica non sono allineate. Lo stesso utente compare in entrambi i rami e rompe l’indipendenza.

Il caso mostra perché i tre elementi vanno decisi insieme. Una metrica scollegata dal comportamento atteso risponde alla domanda sbagliata. L’esperimento può sembrare valido e produrre comunque inferenza sbagliata.

Pensa alle situazioni tipiche. Se il dato migliora ma la baseline è debole, il segnale potrebbe essere reale o dipendere dal campione: rafforza il confronto prima di scalare. Se la metrica cambia in un solo segmento, l’effetto medio nasconde eterogeneità: separa coorti o casi d’uso. Se il costo operativo aumenta, valuta il beneficio sul margine. Se il sistema produce numeri incoerenti, correggi ownership e controlli prima di decidere.

L’errore tipico da evitare

L’errore più frequente è scambiare familiarità con comprensione. I concetti più citati richiedono più rigore proprio perché muovono più decisioni e più risorse. In pratica l’errore appare quando il team presenta un numero senza contesto decisionale.

Manca la decisione che cambia, manca la baseline che rende il numero interpretabile e manca il rischio residuo. Il dato sembra preciso ma non guida l’azione.

Verdetto: unità di randomizzazione, unità di analisi e metrica primaria si decidono insieme prima del lancio; tutto il resto è correzione a posteriori.

Il caso Berkeley: il paradosso di Simpson

Nel 1973 le ammissioni ai corsi di dottorato di Berkeley mostrarono, sui totali aggregati, un tasso di ammissione più alto per gli uomini che per le donne. L’analisi di Bickel, Hammel e O’Connell, pubblicata su Science nel 1975, smontò la lettura aggregata: le donne si candidavano in misura maggiore ai dipartimenti più selettivi, e dentro i singoli dipartimenti la differenza spariva o si rovesciava. È il paradosso di Simpson applicato alle decisioni: l’unità di analisi sbagliata produce una conclusione opposta a quella corretta. La lezione per il disegno sperimentale è diretta: aggregare senza rispettare la struttura di assegnazione trasforma un confronto in un inganno.

Domande per verificare la lezione

  1. Perché unità di randomizzazione e unità di analisi devono coincidere?
  2. Che cosa succede se randomizzi la sessione ma decidi sull’utente?
  3. Quale guardrail aggiungeresti a un test che sposta la conversione?
  4. Che cosa congeli prima del lancio e perché?
Serve una mano concreta?

Bloccato su questo argomento o vuoi applicarlo al tuo caso? Prenota una call di 15 minuti con un analista esperto.

Prenota una call