
Evaluation: leakage, drift, metrics, and limits
Evaluation: leakage, drift, metrics, and limits on GinnyTech: decide if a model can enter the process or must remain a controlled experiment with controls, ownership, and reviewable outputs.
What you will learn
- Design AI workflows for data with controls, owners, and reviewable outputs
- Apply AI, AutoML or agentic AI to business analytics cases without losing rigor
- Recognize risks of leakage, drift, cost, privacy, and ungoverned automation
Evaluation: leakage, drift, metrics, and limits
Lavorando con dati e modelli, il rischio più grande non è far fare all’AI “analisi”, ma perdere il controllo su cosa sappiamo davvero, cosa stiamo verificando e come arriviamo a decidere. Questa lezione affronta proprio quel punto: costruire un flusso di lavoro che renda esplicite domande, dati, controlli e decisioni, così da non consegnare risposte fragili o impossibili da verificare.
A starting scene
Immagina la riunione settimanale tra marketing, prodotto e data team. Devono scegliere cosa correggere prima, tra funnel, tracking, campagna, modello o pipeline. Senza AI, l’analista rischia di bruciare ore in passaggi ripetitivi; con l’AI usata senza disciplina, rischia di portare spiegazioni convincenti ma instabili.
La differenza la fa il disegno operativo. L’AI deve aiutare a formulare ipotesi, creare checklist, proporre controlli, sintetizzare risultati e preparare gli output. Non può sostituire la verifica del dato, la responsabilità sulla metrica o la scelta di business. Ogni passaggio deve lasciare una traccia leggibile, che un revisore possa contestare.
| Moment | Useful use | Necessary control |
|---|---|---|
| Before analysis | Clarify question, constraints, and expected output | Confirm owner, metric, and baseline |
| During analysis | Suggest controls, segments, and alternative explanations | Verificare dati, granularità, filtri e casi limite |
| After the analysis | Prepare memos, trade-offs, and next steps | Separate evidence, hypothesis, and recommendation |
Perché conta nel lavoro sui dati
Il collo di bottiglia non è scrivere codice, ma capire quale domanda ha senso porsi, quali dati sono affidabili, quale metrica sposta davvero la decisione e quale rischio resta in piedi dopo la raccomandazione. Questo processo rende espliciti quei passaggi.
Un buon workflow con AI ha quattro proprietà:
- Parte da una decisione, non da uno strumento.
- Dichiara input, vincoli e output atteso.
- Produce artefatti revisionabili, non solo testo finale.
- Include un criterio di stop per quando dati o modello non reggono.
Senza queste proprietà il lavoro sembra moderno ma resta fragile. L’AI aumenta la produttività solo se aumenta anche la qualità della domanda e la disciplina sui controlli.
Cinque passaggi per orientarsi
Cinque passaggi guidano il processo:
| Step | Guiding question | Minimum Output |
|---|---|---|
| Decision | Which choice needs to improve? | Operating Verb and Owner |
| Context | Cosa sappiamo dei dati? | Fonti, granularità, periodo, limiti |
| AI Support | Quale parte può essere accelerata? | Prompt, tool or checklist |
| Verification | Quale errore può cambiare la conclusione? | Control, guardrail, baseline |
| Handoff | Who decides and by what criteria? | Memo, ticket, model or dashboard |
Lo schema vale per l’analisi esplorativa, per SQL, per il data engineering, per l’AutoML e per i workflow agentici. Cambiano gli strumenti, non il principio: nessun output è evidenza finché non è collegato a fonte, controllo e decisione.
Il problema da cui partire
Nel dominio dell’AI per l’analisi dati, il data engineering e l’AutoML, il problema è decidere se un modello può entrare nel processo o deve restare un esperimento controllato. Non è teoria isolata: si tratta di migliorare una scelta concreta con dati, assunzioni esplicite e controlli minimi.
Il problema nasce quando un team vuole velocizzare il lavoro ma non distingue i compiti delegabili dalle responsabilità che non lo sono. L’AI può generare ipotesi, query, documentazione, test, feature candidate o sintesi. La decisione invece resta umana ogni volta che tocca budget, roadmap, clienti, compliance, accessi o modelli in produzione.
L’obiettivo è produrre un artefatto revisionabile. Se non sai indicare quale decisione cambia, quale dato osservi e quale errore vuoi evitare, la lezione non è ancora competenza applicata.
Come ragionare sulla valutazione
Quattro livelli definiscono il modo di ragionare:
| Level | What to clarify | Example in data work |
|---|---|---|
| Task | Quale parte del lavoro accelera l’AI? | Query draft, data profile, AutoML checklist, memo |
| Context | Quali informazioni rendono utile l’output? | Schema, metric, period, segment, policy |
| Control | Come scoprire se l’output è sbagliato? | Test granularità, baseline, leakage, review owner |
| Decision | What action follows if the control holds? | Fix pipeline, experiment, deploy, recommendation |
Questo schema evita i due errori opposti: usare l’AI solo come autocomplete testuale oppure darle autonomia su decisioni che richiedono giudizio di business. La competenza professionale sta proprio nel disegnare quel confine.
Rendere la valutazione analizzabile
Per rendere analizzabile la valutazione, definisci l’unità di lavoro: uno split, una metrica, un segmento, un modello, una soglia decisionale o il monitoraggio. Collega quell’unità a segnali osservabili come il gap train-test, il drift delle feature, la performance per segmento, la calibration e la stabilità nel tempo. Infine dichiara la decisione attesa, cioè se il modello può entrare nel processo o deve restare un esperimento controllato.
| Element | Requested specification |
|---|---|
| Unit of analysis | split, metric, segment, model, decision threshold, or monitoring |
| Primary signal | gap train-test, drift feature, performance per segmento, calibration e stabilità nel tempo |
| Baseline | Manual process, previous period, comparable group or current model |
| Decision | entra nel processo o resta esperimento controllato |
| Guardrail | Privacy, costo, qualità dati, interpretabilità, ownership, rischio operativo |
| Main risk | valutare solo metrica media ignorando segmenti dove il modello fallisce |
La formalizzazione regge se un revisore può riprodurre la logica, criticare le assunzioni e arrivare alla stessa decisione partendo dagli stessi dati. Se il risultato dipende da conversazioni non tracciate, il workflow non è ancora maturo.
Un caso pratico di lead scoring
Un modello di lead scoring migliora la conversione media ma peggiora sulle PMI ad alto valore. Il team cambia la soglia e aggiunge un monitoraggio per segmento.
Il caso mostra che l’AI non è il centro del lavoro: il centro è il ciclo decisionale fatto di domanda, dato, controllo, raccomandazione e monitoraggio. L’AI riduce l’attrito tra i passaggi, ma ogni passaggio resta controllabile.
| Observed evidence | Cautious interpretation | Recommended action |
|---|---|---|
| Output più rapido | Velocità utile solo se non abbassa qualità e controllo | Compare with manual baseline and independent review |
| Spiegazioni plausibili | Plausibilità linguistica non è prova empirica | Translate every explanation into data or process control |
| Migliora metrica | Potrebbe esserci effetto composizione, leakage o stagionalità | Segment, verify guardrails and monitor over time |
Un buon caso studio non si chiude con “l’AI ha funzionato”, ma con una decisione difendibile: cosa automatizzare, cosa tenere manuale, quale metrica monitorare e quale condizione fermerebbe il processo.
Esercitarsi sulla valutazione
Si comincia da una scheda di una pagina sulla valutazione di leakage, drift, metriche e limiti, dove indichi la decisione da supportare, gli input richiesti, l’output atteso, il controllo minimo e il rischio principale, partendo da un caso semplice come una variazione di conversione, una pipeline in ritardo o un modello di forecast da valutare. Il passo successivo è una tabella con tre scenari, il workflow manuale, quello assistito dall’AI e quello con automazione spinta, dove per ciascuno annoti tempo stimato, qualità attesa, rischio operativo, controllo necessario e owner finale.
Il livello più avanzato è un decision memo revisionabile con ipotesi, dati richiesti, criteri di esclusione, controlli di qualità, soglia decisionale, rischio residuo e piano di monitoraggio dopo la decisione, più una sezione su cosa farebbe cambiare idea al team. Come materiale conviene usare report di valutazione, confusion matrix, backtest, monitoraggio del drift, metriche per segmento e decision policy; in mancanza di dati reali basta un dataset sintetico di almeno 200 righe con dimensione temporale, segmento, metrica primaria e un campo per gli errori di qualità.
L’errore tipico da evitare
L’errore più comune è usare la valutazione di leakage, drift, metriche e limiti come etichetta invece che come processo, cosa che accade quando si mostra un output senza spiegare dati, controlli e decisione. Il secondo è confondere la produttività del singolo con l’affidabilità dell’organizzazione. Il terzo è non avere deciso prima quali azioni sono permesse, quali richiedono approvazione e quali sono vietate.
La correzione pratica è scrivere tre righe prima di iniziare:
| Line | Content |
|---|---|
| Decision | Which concrete choice do we want to improve |
| Evidence | Quale dato o controllo può sostenere la scelta |
| Stop | Which risk would make us stop or ask for review |
Se ne manca una sola, il workflow non è pronto. L’AI può essere supporto esplorativo, ma non parte stabile del processo decisionale.
Domande per mettersi alla prova
Conviene rispondere a poche domande prima di proseguire. Quale decisione concreta dovrebbe migliorare questa lezione? Quale parte del workflow puoi delegare all’AI e quale deve restare sotto un owner umano? Quale baseline useresti per capire se il nuovo processo migliora davvero? Quale failure mode potrebbe rendere pericoloso un output che sembra corretto? E quale artefatto consegneresti a uno stakeholder, tra memo, dashboard, query review, model card, runbook o checklist?
Se non riesci a rispondere in modo specifico, torna al problema iniziale prima di andare avanti. Una risposta generica spesso segnala un’automazione partita troppo presto.
Essential technical references
Questi riferimenti aiutano a orientare scelte tecniche che cambiano nel tempo, non sono ricette da copiare:
- OpenAI Agents SDK: https://developers.openai.com/api/docs/guides/agents
- Vertex AI AutoML forecasting: https://docs.cloud.google.com/gemini-enterprise-agent-platform/machine-learning/tabular-data/forecasting/overview
- Azure AutoML: https://learn.microsoft.com/en-us/azure/machine-learning/concept-automated-ml?view=azureml-api-2
- SageMaker Autopilot: https://docs.aws.amazon.com/sagemaker/latest/dg/autopilot-automate-model-development.html
- Databricks AutoML: https://docs.databricks.com/aws/en/machine-learning/automl/
Operational Summary
La valutazione di leakage, drift, metriche e limiti serve solo se produce una decisione chiara, non solo termini nuovi. Usa il ciclo che lega decisione, contesto, supporto dell’AI, verifica e handoff per trasformare la lezione in pratica verificabile.
La regola finale è semplice: più il workflow si appoggia a prompt, controlli, metriche e revisione umana, più deve restare osservabile. Un output che non puoi ricostruire, revisionare o fermare non è automazione professionale, è solo velocità senza governance.
Related Path
Lessons to read together
Questi collegamenti portano la lezione dentro il resto del corso: basi da riprendere, passaggi successivi e connessioni tematiche tra moduli.