
Fondamenti della significativita statistica
Ipotesi nulla e alternativa, distribuzione campionaria, statistica test e p-value. Dalla lezione del tè di Ronald Fisher (1925) al test A/A numerico, con limiti del testing frequentista e template di validazione operativa.
Cosa imparerai
- Definire ipotesi nulla e alternativa e calcolare la statistica test sotto H₀
- Interpretare la distribuzione campionaria e l'errore standard di una differenza tra proporzioni
- Calibrare il sistema con un test A/A e verificare la checklist di validità del test
Fondamenti della significativita statistica
Questa lezione viaggia sul binario ml-tabellare: ogni concetto si appoggia a una regola, a una tabella o a un numero da controllare, e alla fine saprai riconoscere quando un risultato è davvero affidabile.
Che cosa significa, in una frase
La significatività statistica misura se una differenza osservata è troppo grande per essere spiegata dal caso sotto l’ipotesi nulla.
La procedura in cinque passi
- Definisci ipotesi nulla e alternativa prima di osservare i dati.
- Fissa la soglia di errore di primo tipo in base al costo di un falso positivo.
- Calcola la statistica test come distanza standardizzata tra dato osservato e ipotesi nulla.
- Ricava il
p-valuecome probabilità di uno scostamento almeno così estremo sotto ipotesi nulla. - Rifiuta l’ipotesi nulla solo se il
p-valueè sotto la soglia, poi leggi effetto e intervallo prima di decidere.
Il problema prima del calcolo
Un esperimento mostra una differenza tra variante A e variante B. Il team deve capire se osserva un segnale affidabile oppure una variazione compatibile con il caso. I fondamenti introducono il linguaggio minimo per ragionare su rumore, ipotesi nulla, errore e decisione.
La significatività non decide da sola. Separa rumore, evidenza e impatto pratico. Trattala come strumento per migliorare una decisione concreta, con assunzioni esplicite e controlli minimi.
Decidere con esperimenti robusti significa non abusare di p-value, peeking o letture casuali del rumore. Se alla fine non sai dire quale decisione cambia, quale dato osservi e quale errore vuoi evitare, la lezione non è ancora diventata competenza applicata.
Ipotesi nulla e ipotesi alternativa
Ogni test parte da due affermazioni in competizione.
Ipotesi nulla (H₀): è lo status quo, l’affermazione che non c’è effetto, differenza o relazione. È l’ipotesi che il test cerca di falsificare. Esempi:
- La media del gruppo trattamento è uguale alla media del gruppo controllo:
- La conversione non cambia:
- Il coefficiente di regressione è zero:
Ipotesi alternativa (H₁ o Ha): è ciò che vogliamo dimostrare, la presenza di un effetto. Esempi:
- (bilaterale)
- (unilaterale, direzionale)
La scelta tra test unilaterale e bilaterale cambia la potenza. Con un’aspettativa direzionale chiara, il test unilaterale offre più potenza. Se l’effetto può anche peggiorare la metrica, serve il test bilaterale. Per prudenza, la maggior parte dei test A/B in produzione usa test bilaterali.
La regola operativa è semplice: H₀ è l’ipotesi da rigettare; H₁ è l’ipotesi da supportare. Il test non dimostra H₁. Valuta se i dati sono incompatibili con H₀ al punto da giustificarne il rifiuto.
La distribuzione campionaria
Il concetto più difficile e più importante è la distribuzione campionaria.
Se potessi ripetere lo stesso esperimento infinite volte, calcoleresti ogni volta una statistica diversa. Un esempio è la differenza tra medie. La distribuzione di tutte queste statistiche, al variare dei campioni, è la distribuzione campionaria.
Ecco la proprietà chiave: sotto H₀, conosciamo la forma di questa distribuzione. Per una media campionaria, il Teorema del Limite Centrale ci dice che la distribuzione campionaria è approssimativamente normale con media pari alla media della popolazione e deviazione standard pari all’errore standard (\sigma / \sqrt{n}).
Per una differenza tra due proporzioni (come in un A/B test), sotto H₀ la distribuzione campionaria della differenza è normale con media 0 e deviazione standard data da:
SE = \sqrt{p(1-p)\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}
dove è la proporzione pooled sotto H₀.
La distribuzione campionaria è il ponte tra osservazione ed attesa. L’osservazione è un singolo numero, come la differenza nel tuo esperimento. L’attesa è ciò che prevede H₀. Se la differenza cade nelle code estreme, dove la probabilità è bassa, hai evidenza contro H₀.
Il test d’ipotesi in sintesi
Ecco la sequenza operativa da usare in ogni test di significatività.
| Passo | Azione | Esempio (A/B test) |
|---|---|---|
| 1 | Definisci H₀ e H₁ | H₀: ; H₁: |
| 2 | Scegli α (livello di significatività) | α = 0,05 (errore di I tipo accettabile al 5%) |
| 3 | Calcola la statistica test | z = \frac{\hat{p}_T - \hat{p}_C}{SE} |
| 4 | Calcola il p-value | Probabilità di osservare una z almeno così estrema sotto H₀ |
| 5 | Confronta p-value con α | Se p < α, rifiuta H₀; altrimenti, non rifiutare H₀ |
I passi 3 e 4 sono tecnici, ma il ragionamento resta uno solo. Misuri la distanza tra dati e ipotesi nulla e chiedi quanto è raro questo scostamento se H₀ fosse vera.
Esempio concreto: test A/A numerico
Un test A/A assegna a entrambi i gruppi esattamente lo stesso trattamento. Non esiste differenza reale: H₀ è vera per costruzione.
Perché fare un test A/A? Per calibrare il sistema. Se il test funziona bene, dovresti osservare un risultato significativo in una proporzione α dei casi. Con α pari a 0,05, circa un test A/A su 20 mostra un falso positivo per puro caso.
Prendi un prodotto con conversione base del 10%. Assegni 10.000 utenti a ciascuno di due gruppi identici (A e A). Entrambi vedono la stessa esperienza. Calcoli differenza e p-value, poi ripeti l’esperimento 1.000 volte.
| Iterazione | Conv. Gruppo A | Conv. Gruppo A’ | Differenza | p-value | Significativo? |
|---|---|---|---|---|---|
| 1 | 10,12% | 9,88% | +0,24% | 0,57 | No |
| 2 | 9,95% | 10,05% | -0,10% | 0,81 | No |
| 3 | 10,45% | 9,55% | +0,90% | 0,04 | Sì (falso positivo) |
| 4 | 10,01% | 9,99% | +0,02% | 0,96 | No |
| 5 | 9,80% | 10,20% | -0,40% | 0,35 | No |
| … | … | … | … | … | … |
| 1.000 | 10,03% | 9,97% | +0,06% | 0,89 | No |
Risultato: su 1.000 test A/A, 52 hanno dato p < 0,05, una proporzione del 5,2%, coerente con α = 0,05.
Questa simulazione insegna tre cose.
- Il sistema funziona: il tasso di falsi positivi è vicino al livello nominale α.
- I falsi positivi sono inevitabili: anche con un test calibrato, circa un esperimento su 20 produce un risultato significativo per puro caso.
- L’interpretazione è contestuale: se vedi p = 0,04 in un test reale, non sai se è un effetto vero oppure uno dei circa 5% di falsi positivi attesi. Servono repliche, potenza adeguata e validazione esterna.
Cosa fare se il test A/A dà troppi falsi positivi
Se il sistema produce significatività molto più spesso di α nei test A/A (ad esempio 15% invece di 5%), esiste un problema strutturale. Le cause possibili:
- Sistema di randomizzazione difettoso: la divisione tra gruppi non è bilanciata su variabili confondenti.
- Metrica non indipendente: la metrica primaria ha autocorrelazione o dipende da eventi condivisi (es. un utente in entrambi i gruppi per errore di tracciamento).
- Peeking (sbirciamento): guardi il risultato prima che il campione sia completo e decidi di fermarti quando vedi un p basso. Questo gonfia il tasso di errore di I tipo in modo drammatico (fino al 20-30%).
- Segmentazione post-hoc: cerchi significatività in sotto-gruppi (per dispositivo, per paese) finché non trovi qualcosa di “significativo”.
Un test A/A regolare è la migliore calibrazione disponibile. Senza test A/A, non sai se il sistema di misura è affidabile.
Limiti del testing frequentista
Il framework della significatività è potente ma ha tre limiti strutturali. Ogni analista deve conoscerli prima di decidere.
Limite 1: Il p-value non dice quanto è probabile H₁
Il p-value risponde a: “Se H₀ fosse vera, che probabilità avrei di osservare dati almeno così estremi?”
Non risponde a: “Qual è la probabilità che H₁ sia vera?” o “Qual è la probabilità che H₀ sia falsa?”
Questa confusione è pervasiva. In un sondaggio del 2019 condotto su 1.500 ricercatori (Nature, 2019), il 58% interpretava erroneamente p < 0,05 come “c’è meno del 5% di probabilità che i risultati siano dovuti al caso”, che è la definizione sbagliata. Il p-value è condizionato a H₀, non a H₁.
Limite 2: Dipendenza dalla dimensione del campione
Con campioni enormi, qualsiasi effetto diventa significativo, anche se irrilevante. Con campioni piccoli, anche effetti importanti possono restare non significativi.
Esempio: su 10 milioni di utenti, una differenza di conversione dello 0,01% produrrà quasi certamente p < 0,001. L’effetto è reale, ma vale il rollout? Probabilmente no, se il costo d’implementazione supera il beneficio.
Al contrario, un aumento del 15% della conversione su 200 utenti per gruppo potrebbe dare p = 0,12. Il risultato è non significativo per α = 0,05, ma merita attenzione se estendi il test.
Il testing frequentista non incorpora la rilevanza pratica. Per questo ogni test richiede effect size e intervallo di confidenza accanto al p-value.
Limite 3: Il problema dei confronti multipli
Ogni test ha una probabilità α di falso positivo. Se esegui K test indipendenti, la probabilità di almeno un falso positivo sale a:
P(\text{almeno 1 falso positivo}) = 1 - (1 - \alpha)^K
Con α = 0,05 e K = 20 test, la probabilità di vedere almeno un risultato significativo spurio è circa il 64%. Con K = 100, sfiora il 99,4%.
Nel lavoro reale questo accade in tre modi.
- Test multipli simultanei: analizzi 10 metriche e trovi una “vincitrice”. È un effetto reale oppure un falso positivo?
- Segmentazione post-hoc: suddividi per dispositivo, browser e paese finché un segmento diventa significativo.
- Peeking sequenziale: guardi il risultato ogni giorno e decidi di fermarti quando vedi
p < 0,05. Questo equivale a eseguire decine di test sullo stesso dato.
Esistono correzioni (Bonferroni, Holm, Benjamini-Hochberg) ma non risolvono la radice del problema. La significatività è una misura di evidenza, non un certificato di verità.
La checklist di validità del test
Prima di dichiarare un risultato significativo, verifica questi sette punti. Se anche uno solo fallisce, il test non è affidabile.
| # | Domanda | Cosa controllare | Esito |
|---|---|---|---|
| 1 | Randomizzazione valida? | La divisione tra gruppi è casuale e bilanciata su variabili note (dispositivo, fonte traffico)? | ✅ / ❌ |
| 2 | Indipendenza delle osservazioni? | Ogni unità è assegnata a un solo gruppo? Non c’è spillover tra gruppi? | ✅ / ❌ |
| 3 | α definito ex-ante? | Il livello di significatività è stato scelto prima di guardare i dati? | ✅ / ❌ |
| 4 | Campione determinato ex-ante? | La numerosità (o la durata) era fissata prima dell’esperimento? | ✅ / ❌ |
| 5 | Test bilaterale o unilaterale motivato? | La scelta è giustificata dalla domanda di business, non dal risultato? | ✅ / ❌ |
| 6 | Effect size riportato? | Il risultato include la grandezza dell’effetto e il suo intervallo di confidenza? | ✅ / ❌ |
| 7 | Guardrail stabili? | Le metriche secondarie (ricavi, bounce rate, errori) non sono peggiorate significativamente? | ✅ / ❌ |
Se rispondi ❌ a uno o più punti, il test non è valido o le conclusioni vanno riviste.
Interpretazione delle soglie
La significatività a p < 0,05 è lo standard più comune, ma non è universale. Ecco come scegliere α in base al contesto decisionale.
| Contesto | α consigliato | Ratio |
|---|---|---|
| Esplorazione / idea generation | 0,10 | Costo del falso positivo basso, meglio esplorare |
| Test A/B standard (UX, marketing) | 0,05 | Standard accettato; bilancia falsi positivi e falsi negativi |
| Lancio prodotto critico (checkout, pagamenti) | 0,01 | Costo del falso positivo altissimo (ricavi in calo, churn) |
| Test clinico / regolatorio | 0,001 o meno | La vita delle persone dipende dalla decisione |
Avvertenza: abbassare α riduce i falsi positivi, ma aumenta i falsi negativi (non rilevi un effetto reale). La scelta di α è un trade-off, non una verità assoluta.
Il caso Fisher: il tè con latte
Nel 1925 Ronald Fisher pubblica Statistical Methods for Research Workers, il libro che cristallizza l’approccio moderno alla verifica delle ipotesi, ma il meccanismo logico nasce dal celebre esperimento del tè con latte. Una signora sosteneva di distinguere se il latte fosse stato versato prima o dopo il tè: Fisher prepara otto tazze, quattro per tipo, le presenta in ordine casuale e le chiede di classificarle tutte. Sotto l’ipotesi nulla di nessuna capacità discriminante, indovinarle tutte e otto ha probabilità pari a 1 su 70, circa 0,014. Fisher rifiuta l’ipotesi nulla sotto quella soglia e introduce così il meccanismo ancora in uso: ipotesi scettica di default, misura di evidenza contro di essa, soglia decisionale. La formalizzazione rigida arriva dopo, con Neyman e Pearson e la distinzione tra errore di primo e secondo tipo.
Verdetto: la significatività non decide da sola: scegli α in base al costo del falso positivo, rifiuta H₀ solo se il p-value è sotto soglia e leggi sempre effetto e intervallo accanto al p-value, perché la significatività è una misura di evidenza, non un certificato di verità.
Domande per verificare la lezione
- Che cosa afferma l’ipotesi nulla in un test
A/Bsulle conversioni? - Perché un test
A/Aben calibrato produce comunque circa un falso positivo ogni venti lanci? - Che cosa devi controllare prima di fidarti di un risultato con
p-valuesotto soglia? - Quando un effetto statisticamente significativo non merita il
rollout?
Bloccato su questo argomento o vuoi applicarlo al tuo caso? Prenota una call di 15 minuti con un analista esperto.
Percorso collegato
Lezioni da leggere insieme
Questi collegamenti portano la lezione dentro il resto del corso: basi da riprendere, passaggi successivi e connessioni tematiche tra moduli.