EN
IT
Obiettivi Formativi
OBIETTIVI FORMATIVI:
Il corso di Metodi Statistici e Data Analytics per il Management fornisce allo studente un'introduzione alla modellizzazione delle variabili economiche e gestionali utilizzando metodi di regressione e tecniche multivariate, sia parametriche che non parametriche; l'accento è posto sulle applicazioni commerciali, di marketing e industriali (ad es. controllo della qualità, analisi delle vendite, customer satisfaction, analisi di mercato). Il programma riguarda i modelli di supervised statistical learning correntemente utilizzati per l'analisi della dipendenza (regressione lineare, ANOVA, modello autoregressivo, modelli logit e probit, decision trees) e le tecniche di unsupervised statistical learning utilizzate per l’esplorazione e la riduzione dei dati (analisi in componenti principali e analisi dei gruppi).
CONOSCENZA E CAPACITÀ DI COMPRENSIONE:
Conoscenza e comprensione di tecniche statistiche parametriche e non parametriche applicate a problemi di marketing, previsione delle vendite e problemi finanziari. Alla fine del corso gli studenti dovrebbero essere in grado di comprendere: (i) come applicare modelli statistici in un approccio supervisionato e non supervisionato; (ii) conoscere le assunzioni e saper formulare ipotesi in merito ad un modello insieme alla conoscenza/comprensione degli strumenti necessari per verificare queste ipotesi; (iii) comprendere le tecniche di selezione del modello e le misure della capacità di previsione del modello. In particolare, gli studenti sapranno dominare:
• Il Modello di regressione lineare
• Il Modello Logit e Probit
• L’ Analisi della varianza (ANOVA)
• Il Modello autoregressivo AR (1)
• Decision Trees
• L’Analisi dei gruppi
• L’Analisi delle componenti principali
CAPACITÀ DI APPLICARE CONOSCENZA E COMPRENSIONE:
Attraverso esempi su insiemi di dati reali e strumenti di Data Analytics come STATA e SAS, verranno mostrate diverse applicazioni dei concetti illustrati a lezione. Agli studenti verrà richiesto di esercitarsi, sia in classe sia a casa, applicando le metodologie statistiche a insiemi di dati e fornendo un commento e una interpretazione dei risultati ottenuti.
AUTONOMIA DI GIUDIZIO:
Gli studenti saranno in grado di scegliere le tecniche statistiche più appropriate e di selezionare il giusto set di variabili esplicative. Sulla base dei risultati ottenuti, saranno in grado di fornire un'interpretazione sulla relazione tra le variabili oggetto di studio. Gli studenti aumenteranno la capacità di analizzare in modo critico e oggettivo situazioni concrete, fenomeni reali e casi di studio.
ABILITÀ COMUNICATIVE:
Gli studenti saranno in grado di preparare report statistici utilizzando grafici, tabelle, figure e più in generale output di software statistico e di corredarli con commenti appropriati.
CAPACITÀ DI APPRENDIMENTO:
Gli studenti potranno accedere alla lettura e alla comprensione di articoli scientifici che utilizzano i metodi multivariati considerati nel programma del corso. Saranno in grado di individuare i metodi più appropriati per rispondere a delle specifiche domande di ricerca. Saranno capaci di utilizzare in modo autonomo strumenti di Data Analytics.
Learning Objectives
LEARNING OUTCOMES:
The course in Statistical Methods and Data Analytics for management provides an introduction to the modelling of economic and management variables using regression and multivariate methods, both in a parametric than a nonparametric framework; the emphasis is on business, marketing and industrial applications. The program will cover models for the analysis of dependence (linear regression, ANOVA, autoregressive model, logit and probit models, decision trees) and exploratory techniques for data reduction (principal component analysis and clustering analysis).
KNOWLEDGE AND UNDERSTANDING:
Knowledge and understanding of parametric and nonparametric statistical techniques applied to marketing, sales and financial problems. At the end of the course students should be able to understand: (i) how to apply statistical models in a supervised and unsupervised approach; (ii) perfectly know the model’s assumptions and understanding of the tools needed to verify these hypotheses; (iii) understand the model selection techniques and measures of the model prediction capability. In particular, students will manage:
• Linear regression model
• Logit and Probit model
• Analysis of Variance
• Autoregressive model AR(1)
• Decision Trees
• Cluster Analysis
• Principal Component Analysis
APPLYING KNOWLEDGE AND UNDERSTANDING:
Practical evidence of the concepts will be given with examples using Data Analytics tools such as STATA and SAS applied on real datasets. The students will have to practice both in class that with homeworks on the use of specific software so to be able to comment and understand the output.
MAKING JUDGEMENTS:
Students will be able to choose the more appropriate statistical techniques and to select the right set of explanatory variables. On the basis of results obtained, they will be able to give an interpretation about the relationship between the variables under study.
COMMUNICATION SKILLS:
Students will be able to prepare statistical reports using graphs, tables, figures and commenting them.
LEARNING SKILLS:
Students will have access to reading and understanding scientific articles using the multivariate methods considered in the course program. They will be able to identify the most appropriate methods to answer specific research questions.
They will be able to leverage Data Analytics tools independently.
Prerequisiti
Conoscenza di base della statistica descrittiva, del calcolo delle probabilità, delle variabili casuali (definizione, funzione di ripartizione, valore atteso e varianza, v.c. notevoli) e dell’'inferenza statistica (stima puntuale, proprietà degli stimatori, metodi di costruzione, verifica delle ipotesi: definizioni, test Z, intervallo di confidenza: definizioni, intervallo di confidenza Z). Durante le lezioni saranno richiamate alcune delle sopra citate nozioni base.
Prerequisites
Basic knowledge of descriptive statistics, elements of probability, random variables (Probability density function, Cumulative density function, expected value and variance) and statistical inference (point estimation, properties of estimators, estimation methods, statistical test, confidence interval).
Programma
Modelli statistici per l'analisi della dipendenza (supervised statistical learning)
1. Definizione di modello statistico
2. Modelli di dipendenza lineari e non lineari
3. Regressione lineare semplice: ipotesi, interpretazione, stima dei parametri con il metodo dei minimi quadrati, indice bontà di adattamento R-quadrato, test t, interpretazione dei risultati
4. Regressione lineare multipla: ipotesi, stima dei parametri, indice bontà di adattamento R-quadrato aggiustato, test t ed F, metodi di selezione delle variabili (backward, forward, stepwise); coefficienti standardizzati, multicollinearità, VIF.
5. Modello ANOVA: variabili esplicative qualitative, ipotesi del modello, interpretazione.
6. Modello Logit: ipotesi del modello, stima di Massima verosimiglianza per i parametri, test Z e di Wald, Devianza del Modello, LR test, BIC e AIC.
7. bontà di classificazione, curva SS e curva ROC, AUC.
8. Modello Probit: ipotesi e interpretazione.
9. Classification Trees: CART
Tecniche statistiche per l'analisi della interdipendenza (unsupervised statistical learning)
1. Analisi in Componenti Principali: definizione degli obiettivi, soluzione, proprietà delle componenti, selezione delle componenti, interpretazione dei risultati, cerchio delle correlazioni.
2. Analisi dei Gruppi: Obiettivi e dati, devianza Within e Between.
3. Metodo non gerarchico: K-medie.
4. Metodi gerarchici: Ward, del legame singolo, medio, completo.
5. Strumenti per identificare soluzioni: dendogramma, pseudo-F, pseudo-Tquadrato, interpretazione.
Modelli per dati longitudinali
1. Ricerca del trend.
2. Regressione lineare per dati temporali: modello AR(1), diagnostica Durbin-Watson, confronto tra modelli (AIC, BIC).
Program
Statistical Model for dependence (supervised statistical learning)
1. Definition of statistical model
2. Linear and nonlinear models
3. Simple linear regression: Hypothesis, interpretation, parameters estimation by MLS, goodness of fit index R-squared, t test.
4. Multiple linear regression: Hypothesis, interpretation, parameters estimation by MLS, Adjusted R-squared, t test and F test, variables selection methods (backward, forward, stepwise); standardized coefficients, multicollinearity, VIF.
5. ANOVA model: qualitative predictors, model assumptions, interpretation.
6. Logit model: Hypothesis, Maximum Likelihood estimators, Z test and Wald’s test, Model deviance, LR test, BIC and AIC.
7. Classification performance, SS curve, ROC curve, AUC.
8. Probit model: Hypotheses and interpretation.
9. Classification Trees: CART
Multivariate methods: Interdependence analysis (unsupervised statistical learning)
1. Principal Component Analysis: Introduction, spectral decomposition, properties of components, components selection, interpretation of results, correlation circle.
2. Cluster Analysis: Introduction, deviance Within and Between.
3. Non hierarchical method: K-means.
4. Hierarchical methods: Ward, single link, complete link, average link.
5. Tools to identify good solutions: dendrogram, pseudo T2 and pseudo F.
Time series models
1. Trend analysis.
2. Linear regression for time series: AR(1) model, Durbin-Watson test, comparison between models (AIC, BIC).
Testi Adottati
Dispense a cura del docente
• L. Biggeri, M. Bini, A. Coli, L. Grassini, M. Maltagliati. Statistica per le decisioni aziendali. Pearson, 2012
• De Lillo, G. Argentin, M. Lucchini, S. Sarti, M. Terraneo. Analisi multivariata per le scienze sociali. Pearson Education, 2007
• Cerioli, S. Zani. Analisi dei dati e data mining per le decisioni aziendali, Giuffrè, 2007
Books
• Teacher's materials
• L. Biggeri, M. Bini, A. Coli, L. Grassini, M. Maltagliati. Statistica per le decisioni aziendali. Pearson, 2012
• De Lillo, G. Argentin, M. Lucchini, S. Sarti, M. Terraneo. Analisi multivariata per le scienze sociali. Pearson Education, 2007
• Cerioli, S. Zani. Analisi dei dati e data mining per le decisioni aziendali, Giuffrè, 2007
Modalità di svolgimento
Le lezioni frontali si avvalgono dei lucidi. Vengono mostrati esempi di applicazioni utilizzando i software statistici STATA e SAS. Gli studenti possono replicare a casa gli esempi utilizzando il software free SAS University Edition e scaricando dal sito web del corso numerosi dataset. Per verificare la preparazione si possono scaricare dal sito web del corso dei testi di autovalutazione e delle simulazioni di esame.
Durante le lezioni si svolgeranno dei quiz tramite kahoot.
Teaching methods
Frontal lessons use slides. Examples of applications are shown using STATA and SAS statistical software. Students can replicate the examples at home using the free SAS University Edition software and download numerous datasets from the course website. To check the preparation, the course of self-assessment texts and exam simulations can be downloaded from the website.
Quizzes will be given via kahoots during class.
Regolamento Esame
Si verificherà la preparazione dello studente attraverso un esame finale consistente in un test composto da domande a risposta multipla e domande a risposta aperta. Le domande verteranno principalmente sulle ipotesi alla base dei modelli statistici, sull’interpretazione degli output, sulle proprietà di alcuni indici statistici. Per ciascuna domanda a risposta chiusa sarà dato come punteggio 1 se corretta, 0 se errata; a ciascuna domanda a risposta aperta sarà dato un punteggio tra 0 e 2; la valutazione finale sarà proporzionalmente riportata in trentesimi. Lo studente potrà/dovrà rivedere/commentare il suo compito con il professore e al termine di questo sarà formulata la valutazione finale.
La prova di esame sarà valutata secondo i seguenti criteri:
Non idoneo: importanti carenze e/o inaccuratezze nella conoscenza e comprensione degli argomenti; limitate capacità di analisi e sintesi, frequenti generalizzazioni e limitate capacità critiche e di giudizio, gli argomenti sono esposti in modo non coerente e con linguaggio inappropriato;
18-20: conoscenza e comprensione degli argomenti appena sufficiente con possibili generalizzazioni e imperfezioni; capacità di analisi sintesi e autonomia di giudizio sufficienti, gli argomenti sono esposti in modo frequentemente poco coerente e con un linguaggio poco appropriato/tecnico;
21-23: Conoscenza e comprensione degli argomenti routinaria; Capacità di analisi e sintesi corrette con argomentazione logica sufficientemente coerente e linguaggio appropriato/tecnico
24-26: Discreta conoscenza e comprensione degli argomenti; buone capacità di analisi e sintesi con argomentazioni espresse in modo rigoroso ma con un linguaggio non sempre appropriato/tecnico.
27-29: Conoscenza e comprensione degli argomenti completa; notevoli capacità di analisi e sintesi. Buona autonomia di giudizio. Argomenti esposti in modo rigoroso e con linguaggio appropriato/tecnico
30-30L: Ottimo livello di conoscenza e comprensione approfondita degli argomenti. Ottime capacità di analisi, di sintesi e di autonomia di giudizio. Argomentazioni espresse in modo originale e con linguaggio tecnico appropriato.
Durante le lezioni si svolgeranno dei quiz tramite kahoot
Exam Rules
The preparation will be verified through a final exam consisting of a test with multiple-choice questions and open-ended questions. The questions will mainly focus on the hypotheses underlying the statistical models, on the interpretation of the outputs, on the properties of some statistical indexes. For each question with a closed answer it will be given as a score 1 if correct, 0 if incorrect; each open question will be given a score between 0 and 2; the final evaluation will be proportionally reported in thirtieths. The student can / must review / comment on his / her task with the professor and at the end of this the final evaluation will be formulated.
The exam will be assessed according to the following criteria:
Not suitable: important deficiencies and / or inaccuracies in the knowledge and understanding of the topics; limited capacity for analysis and synthesis, frequent generalizations and limited critical and judgment skills, the arguments are presented in an inconsistent way and with inappropriate language;
18-20: just sufficient knowledge and understanding of the topics with possible generalizations and imperfections; sufficient capacity for analysis, synthesis and autonomy of judgment, the topics are frequently exposed in an inconsistent way and with inappropriate / technical language;
21-23: Routine knowledge and understanding of topics; Ability to correct analysis and synthesis with sufficiently coherent logical argument and appropriate / technical language.
24-26: Fair knowledge and understanding of the topics; good analysis and synthesis skills with rigorously expressed arguments but with a language that is not always appropriate / technical.
27-29: Complete knowledge and understanding of the topics; remarkable abilities of analysis and synthesis. Good autonomy of judgment. Topics exposed rigorously and with appropriate / technical language.
30-30L: Excellent level of knowledge and in-depth understanding of the topics. Excellent skills of analysis, synthesis and autonomy of judgment. Arguments expressed in an original way and with appropriate technical language.
Quizzes will be given via kahoots during class.