Een cursus op gevorderd niveau die zich richt op moderne statistische en machine learning-technieken voor economisch onderzoek. Studenten passen methoden zoals ARIMA, logistische regressie, PCA, random forests en SHAP toe op praktijkgegevens en ontwikkelen zo de vaardigheden om tijdsafhankelijke en hoogdimensionale datasets te analyseren met behulp van Python.
Deze cursus bouwt voort op basiskennis van statistiek, waaronder belangrijke begrippen zoals kansrekening, verdelingen, steekproeven, hypothesetests, variantieanalyse en regressieanalyse. De cursus is bedoeld voor studenten die al ervaring hebben opgedaan met het toepassen van deze basistechnieken op economische vraagstukken. In deze cursus op het tweede niveau maken de studenten de overstap naar hedendaagse analytische methoden die worden gebruikt in modern economisch onderzoek en datawetenschap, waarbij de nadruk ligt op complexere, hoogdimensionale en tijdsafhankelijke gegevens.
De cursus is bedoeld om studenten praktische ervaring met Python bij te brengen en tegelijkertijd hun begrip van statistisch redeneren en machine learning te verdiepen. Studenten werken met echte datasets om tijdreeksmodellen (bijv. ARIMA) te bouwen, logistische regressie en gegeneraliseerde lineaire modellering met regularisatie (lasso, ridge) uit te voeren, technieken voor dimensiereductie zoals PCA en factoranalyse toe te passen, en te experimenteren met clustering en modellen voor begeleid leren, zoals random forests en gradient boosting.
In plaats van theorie en praktijk van elkaar te scheiden, volgen alle sessies een geïntegreerde opzet waarbij studenten concepten onmiddellijk toepassen door middel van coderen en groepsanalyse. Het doel is studenten in staat te stellen zelfstandige, robuuste en communiceerbare economische analyses uit te voeren die voldoen aan zowel academische als toegepaste onderzoeksnormen.
Aan het einde van de cursus zal de cursist in staat zijn om:
• Tijdreeksmodellen toe te passen en te interpreteren voor het voorspellen van economische gegevens
• Classificatiemodellen op te stellen en te evalueren met behulp van logistische regressie en regularisatie
• Dimensionaliteitsreductie uit te voeren met behulp van PCA en factoranalyse
• Clustering en onbegeleide leertechnieken te gebruiken voor het ontdekken van patronen
• Begeleide algoritmen voor machine learning (bijv. random forest, SVM) te implementeren en te vergelijken
• Interpreteer modelresultaten en communiceer bevindingen op een effectieve manier
Studenten moeten een inleidende cursus statistiek hebben afgerond of over gelijkwaardige voorkennis beschikken. Vereiste vaardigheden zijn onder meer inzicht in fundamentele statistische principes (bijv. gemiddelde, variantie), kansrekening, verdelingen, steekproeven en schattingen, hypothesetests, variantieanalyse (ANOVA) en lineaire regressie. Studenten moeten bovendien vertrouwd zijn met het interpreteren van statistische resultaten en het redeneren op basis van economische gegevens uit de praktijk. Er wordt geen eerdere programmeerervaring verondersteld, maar de bereidheid om Python te leren en te gebruiken is essentieel.
Verplichte literatuur
• James et al. (2023). An Introduction to Statistical Learning with Applications in Python
• Kenett et al. (2022). Modern Statistics: A Computer-Based Approach with Python
• McClave et al. (2017). Statistiek voor bedrijfskunde en economie
Aanbevolen
• Müller & Guido (2016). Inleiding tot machine learning met Python
• Hyndman & Athanasopoulos (2021). Prognoses: principes en praktijk
• Xiao (2022). Programmeren met kunstmatige intelligentie in Python
• Hoorcolleges
• Groepsopdrachten
• Scriptieproject
• Oefeningen met Python
• Wekelijkse spreekuren
Cijferlijst