Statistical methods for the environmental research
A.A. 2026/2027
Obiettivi formativi
The course aims to complete and deepen the knowledge already acquired by students in the field of statistics during the three-year degree course, providing concepts and methodologies useful for environmental sciences, with particular attention to univariate statistics, and mentions of multivariate statistics and geostatistics.
The contents of the course will allow students to:
- improve the knowledge of univariate statistics applied to environmental analysis;
- understand which tools are available for the analysis of multivariate phenomena and for spatial analysis;
- understand the fundamental elements of statistical-probabilistic methodologies and their application in the field of spatial and environmental statistics;
- together with the Data Management course, acquire the techniques for surveying, acquiring and managing environmental data and information.
The contents of the course will allow students to:
- improve the knowledge of univariate statistics applied to environmental analysis;
- understand which tools are available for the analysis of multivariate phenomena and for spatial analysis;
- understand the fundamental elements of statistical-probabilistic methodologies and their application in the field of spatial and environmental statistics;
- together with the Data Management course, acquire the techniques for surveying, acquiring and managing environmental data and information.
Risultati apprendimento attesi
Knowledge and understanding. At the end of the course the students should know:
o univariate statistics applied to spatial analysis: multiple way ANOVA, ANCOVA and regression, with particular attention to the variable selection methods;
o the fundamental elements of multivariate statistics and geostatistics;
o the basic principles of machine learning, with particular attention to neural networks and random forest.
Applying knowledge and understanding. At the end of the course the students should be able to:
o Apply ANOVA and regression to experimental and spatial data, using statistical software;
o correctly choose the most appropriate instruments for their own analysis, based on the possibility and limits of the various approaches available;
o carry out simple multivariate or geostatistical analyses.
o univariate statistics applied to spatial analysis: multiple way ANOVA, ANCOVA and regression, with particular attention to the variable selection methods;
o the fundamental elements of multivariate statistics and geostatistics;
o the basic principles of machine learning, with particular attention to neural networks and random forest.
Applying knowledge and understanding. At the end of the course the students should be able to:
o Apply ANOVA and regression to experimental and spatial data, using statistical software;
o correctly choose the most appropriate instruments for their own analysis, based on the possibility and limits of the various approaches available;
o carry out simple multivariate or geostatistical analyses.
Periodo: Secondo semestre
Modalità di valutazione: Esame
Giudizio di valutazione: voto verbalizzato in trentesimi
Corso singolo
Questo insegnamento può essere seguito come corso singolo.
Programma e organizzazione didattica
Edizione unica
Responsabile
Periodo
Secondo semestre
Programma
1) Basi di statistica — CFU 0,5 lezioni teoriche + CFU 0,25 attività pratiche
Statistica descrittiva e distribuzioni campionarie. Richiamo dei principali indici di posizione, con particolare attenzione a media e mediana, e degli indici di variabilità, inclusi somma dei quadrati, quadrato medio, deviazione standard e coefficiente di variazione. Distribuzione normale e distribuzione normale standardizzata. Interpretazione di base della variabilità dei dati in dataset ambientali e agrari.
2) Basi di inferenza statistica — CFU 0,5 lezioni teoriche + CFU 0,25 attività pratiche
Principi fondamentali dell'inferenza statistica. Concetti di verifica di ipotesi, ipotesi nulla e alternativa, livello di significatività, p-value, errori di primo e secondo tipo e potenza statistica. Introduzione all'interpretazione dei test statistici nella ricerca ambientale applicata.
3) Analisi della varianza e confronto tra medie — CFU 0,75 lezioni teoriche + CFU 0,50 attività pratiche
Analisi della varianza a una via e a due vie. Fonti di variazione, somme dei quadrati, gradi di libertà, quadrati medi e rapporti F. Interpretazione delle tabelle di ANOVA. Confronti multipli e interpretazione delle differenze tra trattamenti o gruppi. Applicazione dell'ANOVA a dataset ambientali e agrari mediante software statistico.
4) Correlazione, regressione lineare e regressione multipla — CFU 0,75 lezioni teoriche + CFU 0,50 attività pratiche
Regressione lineare semplice e interpretazione di intercetta, coefficiente di regressione, coefficiente di determinazione e R² corretto. ANOVA della regressione. Regressione multipla e interpretazione degli effetti delle variabili esplicative. Selezione delle variabili, importanza delle variabili e valutazione della multicollinearità mediante variance inflation factor. Applicazione di modelli di regressione a dataset con variabili esplicative continue e/o categoriche.
5) Modelli lineari con variabili continue e categoriche — CFU 0,50 lezioni teoriche + CFU 0,25 attività pratiche
Uso dei modelli lineari per l'analisi di dati ambientali e agrari. Utilizzo congiunto di variabili esplicative continue e discrete. Relazione tra ANOVA, regressione e modelli lineari generali. Interpretazione degli output del modello e dei limiti metodologici dei diversi approcci.
6) Introduzione all'analisi multivariata — CFU 0,50 lezioni teoriche + CFU 0,25 attività pratiche
Principi di base dell'analisi delle componenti principali e dell'analisi dei cluster. Standardizzazione delle variabili. Interpretazione di scores, loadings e grafici biplot. Misure di distanza, clustering gerarchico, k-means clustering e criteri per la scelta del numero di cluster, con particolare attenzione al grafico silhouette.
7) Introduzione al machine learning applicato a dati ambientali — CFU 0,50 lezioni teoriche + CFU 0,25 attività pratiche
Principi di base del machine learning. Dataset di training, validation e test. Suddivisione dei dati e prevenzione del data leakage. Identificazione degli outlier, delle variabili rilevanti, delle variabili correlate e delle variabili che introducono rumore. Modelli lineari come riferimento di base per gli approcci di machine learning. Introduzione a random forest e XGBoost, con concetti di base relativi agli iperparametri e al loro tuning.
8) Workflow pratico di analisi di dataset ambientali — CFU 0,00 lezioni teoriche + CFU 0,50 attività pratiche
Preparazione di un percorso strutturato di analisi per un dataset contenente variabili indipendenti continue e/o categoriche e una variabile dipendente. Scelta e giustificazione dei metodi statistici e di machine learning. Sviluppo di uno schema sintetico dell'analisi e applicazione di alcune procedure selezionate mediante Python o, in modo più limitato, Excel.
Non sono previste differenze tra studenti frequentanti e non frequentanti.
Statistica descrittiva e distribuzioni campionarie. Richiamo dei principali indici di posizione, con particolare attenzione a media e mediana, e degli indici di variabilità, inclusi somma dei quadrati, quadrato medio, deviazione standard e coefficiente di variazione. Distribuzione normale e distribuzione normale standardizzata. Interpretazione di base della variabilità dei dati in dataset ambientali e agrari.
2) Basi di inferenza statistica — CFU 0,5 lezioni teoriche + CFU 0,25 attività pratiche
Principi fondamentali dell'inferenza statistica. Concetti di verifica di ipotesi, ipotesi nulla e alternativa, livello di significatività, p-value, errori di primo e secondo tipo e potenza statistica. Introduzione all'interpretazione dei test statistici nella ricerca ambientale applicata.
3) Analisi della varianza e confronto tra medie — CFU 0,75 lezioni teoriche + CFU 0,50 attività pratiche
Analisi della varianza a una via e a due vie. Fonti di variazione, somme dei quadrati, gradi di libertà, quadrati medi e rapporti F. Interpretazione delle tabelle di ANOVA. Confronti multipli e interpretazione delle differenze tra trattamenti o gruppi. Applicazione dell'ANOVA a dataset ambientali e agrari mediante software statistico.
4) Correlazione, regressione lineare e regressione multipla — CFU 0,75 lezioni teoriche + CFU 0,50 attività pratiche
Regressione lineare semplice e interpretazione di intercetta, coefficiente di regressione, coefficiente di determinazione e R² corretto. ANOVA della regressione. Regressione multipla e interpretazione degli effetti delle variabili esplicative. Selezione delle variabili, importanza delle variabili e valutazione della multicollinearità mediante variance inflation factor. Applicazione di modelli di regressione a dataset con variabili esplicative continue e/o categoriche.
5) Modelli lineari con variabili continue e categoriche — CFU 0,50 lezioni teoriche + CFU 0,25 attività pratiche
Uso dei modelli lineari per l'analisi di dati ambientali e agrari. Utilizzo congiunto di variabili esplicative continue e discrete. Relazione tra ANOVA, regressione e modelli lineari generali. Interpretazione degli output del modello e dei limiti metodologici dei diversi approcci.
6) Introduzione all'analisi multivariata — CFU 0,50 lezioni teoriche + CFU 0,25 attività pratiche
Principi di base dell'analisi delle componenti principali e dell'analisi dei cluster. Standardizzazione delle variabili. Interpretazione di scores, loadings e grafici biplot. Misure di distanza, clustering gerarchico, k-means clustering e criteri per la scelta del numero di cluster, con particolare attenzione al grafico silhouette.
7) Introduzione al machine learning applicato a dati ambientali — CFU 0,50 lezioni teoriche + CFU 0,25 attività pratiche
Principi di base del machine learning. Dataset di training, validation e test. Suddivisione dei dati e prevenzione del data leakage. Identificazione degli outlier, delle variabili rilevanti, delle variabili correlate e delle variabili che introducono rumore. Modelli lineari come riferimento di base per gli approcci di machine learning. Introduzione a random forest e XGBoost, con concetti di base relativi agli iperparametri e al loro tuning.
8) Workflow pratico di analisi di dataset ambientali — CFU 0,00 lezioni teoriche + CFU 0,50 attività pratiche
Preparazione di un percorso strutturato di analisi per un dataset contenente variabili indipendenti continue e/o categoriche e una variabile dipendente. Scelta e giustificazione dei metodi statistici e di machine learning. Sviluppo di uno schema sintetico dell'analisi e applicazione di alcune procedure selezionate mediante Python o, in modo più limitato, Excel.
Non sono previste differenze tra studenti frequentanti e non frequentanti.
Prerequisiti
Conoscenze di matematica, utilizzo foglio di calcolo Excel, elementi di base di statistica
Metodi didattici
Il corso si compone di una parte di lezioni frontali di 40 ore e di 24 ore di attività pratica al calcolatore usando script in Python, anche con il supporto dellAI (oltre al foglio di calcolo Excel).
Materiale di riferimento
Il corso è erogato in lingua inglese, per cui il materiale di riferimento (slide, articoli, libri) è unicamente in lingua inglese. Tale materiale è fornito durante il corso.
Modalità di verifica dell’apprendimento e criteri di valutazione
**Modalità di verifica dell'apprendimento**
La verifica dell'apprendimento si svolge mediante esame in presenza.
Allo studente verrà fornito un dataset relativo ad ambiti naturali o agrari, contenente diverse variabili indipendenti, continue e/o discrete, e una variabile dipendente. L'obiettivo sarà analizzare la variabile dipendente in funzione delle variabili indipendenti, utilizzando almeno un approccio statistico frequentista, come l'ANOVA o la regressione lineare, e un approccio di machine learning.
Lo studente dovrà predisporre uno schema testuale dettagliato del lavoro, in grado di dimostrare la conoscenza dei diversi strumenti appresi durante il corso. Lo schema dovrà essere organizzato preferibilmente per punti e contenuto, indicativamente, entro due pagine di testo. Tale schema rappresenterà il riferimento concettuale dell'elaborato e avrà un peso rilevante nella valutazione finale.
Lo studente dovrà inoltre applicare, a titolo di esempio, alcune procedure pertinenti ai diversi punti dello schema proposto. Non è richiesto lo svolgimento di un'analisi completa, ma la dimostrazione della capacità di impostare correttamente un'analisi reale, che potrebbe poi essere sviluppata in modo più completo disponendo di più tempo.
La parte scritta/computazionale dell'esame avrà una durata di 1 ora e 30 minuti e sarà seguita da una breve discussione orale, della durata di circa 5-10 minuti, su quanto svolto durante la prova scritta. Il docente si riserva la possibilità di visionare il lavoro dello studente anche durante lo svolgimento della prova.
Il software di riferimento è Python; è possibile utilizzare qualsiasi ambiente di sviluppo, ad esempio Spyder, Visual Studio Code, Colab o altri. Gli studenti che hanno competenze in R possono svolgere la prova anche in tale ambiente.
È possibile utilizzare esclusivamente Excel; tuttavia, in questo caso, è evidente che solo una parte limitata degli aspetti precedentemente indicati potrà essere sviluppata. Potrà essere considerato sufficiente un approccio svolto in Excel in cui vengano applicate ANOVA, regressione lineare e regressione multipla. Tuttavia, nel caso di utilizzo esclusivo di Excel, il voto massimo conseguibile sarà 20/30.
L'uso dell'intelligenza artificiale è consentito per sviluppare e correggere script. Qualora lo studente utilizzi in modo intensivo strumenti di intelligenza artificiale, sarà richiesta la capacità di spiegare perché siano state adottate determinate procedure e perché esse siano preferibili, o equivalenti, rispetto ad altre possibili scelte.
La verifica dell'apprendimento si svolge mediante esame in presenza.
Allo studente verrà fornito un dataset relativo ad ambiti naturali o agrari, contenente diverse variabili indipendenti, continue e/o discrete, e una variabile dipendente. L'obiettivo sarà analizzare la variabile dipendente in funzione delle variabili indipendenti, utilizzando almeno un approccio statistico frequentista, come l'ANOVA o la regressione lineare, e un approccio di machine learning.
Lo studente dovrà predisporre uno schema testuale dettagliato del lavoro, in grado di dimostrare la conoscenza dei diversi strumenti appresi durante il corso. Lo schema dovrà essere organizzato preferibilmente per punti e contenuto, indicativamente, entro due pagine di testo. Tale schema rappresenterà il riferimento concettuale dell'elaborato e avrà un peso rilevante nella valutazione finale.
Lo studente dovrà inoltre applicare, a titolo di esempio, alcune procedure pertinenti ai diversi punti dello schema proposto. Non è richiesto lo svolgimento di un'analisi completa, ma la dimostrazione della capacità di impostare correttamente un'analisi reale, che potrebbe poi essere sviluppata in modo più completo disponendo di più tempo.
La parte scritta/computazionale dell'esame avrà una durata di 1 ora e 30 minuti e sarà seguita da una breve discussione orale, della durata di circa 5-10 minuti, su quanto svolto durante la prova scritta. Il docente si riserva la possibilità di visionare il lavoro dello studente anche durante lo svolgimento della prova.
Il software di riferimento è Python; è possibile utilizzare qualsiasi ambiente di sviluppo, ad esempio Spyder, Visual Studio Code, Colab o altri. Gli studenti che hanno competenze in R possono svolgere la prova anche in tale ambiente.
È possibile utilizzare esclusivamente Excel; tuttavia, in questo caso, è evidente che solo una parte limitata degli aspetti precedentemente indicati potrà essere sviluppata. Potrà essere considerato sufficiente un approccio svolto in Excel in cui vengano applicate ANOVA, regressione lineare e regressione multipla. Tuttavia, nel caso di utilizzo esclusivo di Excel, il voto massimo conseguibile sarà 20/30.
L'uso dell'intelligenza artificiale è consentito per sviluppare e correggere script. Qualora lo studente utilizzi in modo intensivo strumenti di intelligenza artificiale, sarà richiesta la capacità di spiegare perché siano state adottate determinate procedure e perché esse siano preferibili, o equivalenti, rispetto ad altre possibili scelte.
AGRI-02/A - Agronomia e coltivazioni erbacee - CFU: 6
Esercitazioni: 32 ore
Lezioni: 32 ore
Lezioni: 32 ore
Docente:
Acutis Marco
Turni:
Turno
Docente:
Acutis MarcoDocente/i