
Modelli, assunzioni e misspecification
Le assunzioni nascoste nei modelli statistici e come riconoscerle prima che facciano danni.
Cosa imparerai
- Riconoscere la misspecification come scarto tra domanda del business e domanda del modello
- Verificare le assunzioni della regressione leggendo residui e stabilità dei coefficienti
- Impostare il monitoraggio di data drift e concept drift con soglie di allarme
Collegamenti
Modelli, assunzioni e misspecification
Nel binario tabellare i modelli sono strumenti quotidiani, e proprio per questo vale la pena ricordare che un modello può sbagliare in silenzio, ed è il caso più pericoloso. Una regressione che prevede bene le vendite medie ma fallisce nei weekend, durante le promozioni o sui clienti nuovi non è solo imprecisa: risponde a una domanda più ristretta di quella che interessa al business. Questo scarto si chiama misspecification e va riconosciuto prima che diventi una decisione sbagliata.
Il guaio è che il modello non urla mai. Continua a produrre numeri, con la stessa faccia seria di quelli giusti, e sta allo studioso scoprire che sta rispondendo a un’altra domanda. La buona notizia è che il riconoscimento si impara e si mette in pratica con un controllo sistematico.
Il nucleo della lezione
Un modello risponde sempre a una domanda più stretta di quella del business, e la misspecification è lo scarto tra le due, da misurare prima che diventi una decisione sbagliata. Il resto della lezione è un insieme di modi pratici per scoprire questo scarto in tempo.
La sequenza di controllo
- Scrivi la domanda del business e le assunzioni del modello fianco a fianco.
- Valida con uno split temporale che non mostri mai il futuro al modello in addestramento.
- Leggi i residui e la stabilità dei coefficienti in cerca di pattern e multicollinearità.
- Confronta performance offline e online per intercettare deriva di dati e concetti.
- Fissa soglie di allarme con un test statistico e un responsabile del monitoraggio.
Le assunzioni che reggono la regressione
Ogni modello è una semplificazione che poggia su assunzioni esplicite o implicite. La regressione lineare OLS si regge sulle proprietà BLUE, definite dal teorema di Gauss-Markov. Nel machine learning le assunzioni più violate sono dati indipendenti e identicamente distribuiti e stazionarietà. Da qui nasce il model drift: il mondo cambia mentre il modello resta fermo.
| Assunzione | Cosa chiede | Segnale di violazione |
|---|---|---|
| Linearità | Relazione lineare tra predittori ed effetto | Pattern sistematici nei residui |
| Indipendenza degli errori | Errori non correlati tra loro | Autocorrelazione nei residui |
| Omoschedasticità | Varianza costante degli errori | Ventagli o imbuti nei residui |
| Normalità degli errori | Errori distribuiti normalmente | Code anomale e intervalli inaffidabili |
| IID e stazionarietà nel ML | Dati scambiabili e mondo stabile | Deriva e crollo in produzione |
I sintomi prima del danno
La misspecification raramente arriva con un fallimento clamoroso. Di solito manda segnali discreti: divario tra metriche di fit e performance su dati nuovi, coefficienti instabili per multicollinearità, pattern nei residui che violano il rumore bianco e divergenza tra performance offline e online. Leggere questi indizi separa un modello monitorato da uno che si rompe in silenzio.
Verdetto: un modello senza assunzioni dichiarate e senza monitoraggio non è uno strumento ma una scommessa cieca.
Due casi di assunzioni che saltano
Netflix convive con la non stazionarietà dei gusti. La risposta combina decadimento temporale verso i dati recenti, ensemble di modelli specializzati ed esplorazione attiva con contextual bandits. Stripe Radar affronta la multicollinearità nelle frodi con modelli robusti come il Gradient Boosting e un feature engineering accurato. In entrambi i casi il punto non è il modello ma la consapevolezza dell’assunzione che potrebbe cedere.
La validazione non si esaurisce nello split tra training e test. Sulle serie temporali serve uno split temporale. In produzione servono test come quello di Kolmogorov-Smirnov per intercettare il data drift e monitoraggio delle performance per intercettare il concept drift.
| Passaggio | Domanda | Decisione |
|---|---|---|
| Campione storico | Quale distribuzione rappresenta il comportamento atteso? | Definire il riferimento |
| Campione recente | La produzione si comporta ancora allo stesso modo? | Misurare lo scarto |
| Test statistico | Lo scarto è compatibile con rumore normale? | Aprire o chiudere l’allarme |
| Impatto business | Lo scarto cambia la decisione o solo una metrica tecnica? | Intervenire, monitorare o ignorare |
L’errore che svuota il metodo
L’errore tipico è trattare modelli e assunzioni come definizioni astratte invece che come protocolli da usare. Presentare metriche senza baseline e raccomandazioni che ignorano il costo dell’errore rende fragile ogni conclusione. La domanda da tenere in tasca è semplice: se questo risultato fosse falso, quale decisione sbaglierei.
Riferimenti essenziali
- Gauss, C. F. (1809). Theoria motus corporum coelestium.
- Box, G. E. P. (1976). Science and Statistics. Journal of the American Statistical Association.
- Herndon, T., Ash, M. e Pollin, R. (2013). Does High Public Debt Consistently Stifle Economic Growth.
L’errore di foglio di calcolo che diventò politica
Nel 2010 Reinhart e Rogoff sostennero che oltre la soglia del 90% di debito sul PIL la crescita crolla, e quella tesi orientò politiche di austerità in mezzo mondo. Nel 2013 Herndon, Ash e Pollin replicarono i conti e trovarono un errore di foglio di calcolo, esclusioni selettive di paesi e pesi non convenzionali. Corretti gli errori, la soglia drammatica spariva e il risultato diventava fragile. È la misspecification nella sua forma più costosa: assunzioni e scelte di calcolo nascoste che reggono una decisione finché nessuno le riesamina. La lezione è operativa: ogni modello che guida soldi veri va replicato da occhi indipendenti prima di diventare policy.
Domande per l’esame di coscienza del modello
- A quale domanda del business risponde davvero il tuo modello?
- Quale assunzione, se violata, invalida le sue conclusioni?
- Quale segnale di deriva monitori e con quale soglia?
- Quando hai replicato l’ultima volta i risultati con dati nuovi?
Bloccato su questo argomento o vuoi applicarlo al tuo caso? Prenota una call di 15 minuti con un analista esperto.
Percorso collegato
Lezioni da leggere insieme
Questi collegamenti portano la lezione dentro il resto del corso: basi da riprendere, passaggi successivi e connessioni tematiche tra moduli.