De cursus behandelt de basisbegrippen en principes achter de belangrijkste modellen en technieken op het gebied van data science. Beschrijvende technieken, zoals clustering en het opsporen van veelvoorkomende patronen, worden uitgebreider toegelicht, terwijl bij voorspellende technieken de nadruk vooral ligt op de concepten van een model, de parameters en hyperparameters ervan, evenals de kwaliteit en validatie van modellen, met inbegrip van overfitting en underfitting en de afwegingen tussen bias en variantie. Ook worden kwesties rond datakwaliteit en voorbewerking in verband met verschillende gegevenstypen en modelleringsproblemen behandeld. Details van de behandelde onderwerpen:
– Inleiding tot bivariate en multivariate analyse
– Datavisualisatie en verkennende data-analyse
– Dimensionaliteitsreductie en kenmerkselectie
– Clustering: k-means, agglomeratieve clustering, DBSCAN, clustervalidatie;
– Frequent Pattern Mining: itemsets, associatieregels, kwaliteitsmaatstaven;
– Lineaire classificatie en regressie: model, parameters en hyperparameters, validatie, overfitting en underfitting en de afweging tussen bias en variantie;
https://neptun.elte.hu/MobilityCourses?Faculty=&Programme=&AcademicTerm=&Published=&SearchText=Introduction+to+data+science
Aan het einde van de cursus zal de cursist in staat zijn om technieken voor bivariate en multivariate analyse toe te passen, datavisualisatie en verkennende data-analyse te gebruiken om datasets te onderzoeken, methoden voor dimensiereductie en kenmerkselectie te kiezen, clusteringalgoritmen te implementeren en te valideren, frequente itemsets en associatieregels te ontdekken en te beoordelen, en lineaire classificatie- en regressiemodellen te ontwikkelen, af te stemmen en te valideren, waarbij hij rekening houdt met overfitting, underfitting en de afweging tussen bias en variantie.
Van de cursisten wordt verwacht dat zij beschikken over basiskennis van statistiek, lineaire algebra en programmeren, en dat zij al enige ervaring hebben met het omgaan met gegevens en met basisbegrippen op het gebied van machine learning
– Peter Flach (2012). Machine Learning: The Art and Science of Algorithms that Make Sense of Data. Cambridge University Press.
– Jiawei Han, Micheline Kamber, Jian Pei (2011). Data Mining: Concepts and Techniques. Morgan Kaufmann.
– Pang-Ning Tan, Michael Steinbach, Vipin Kumar (2005). Introduction to Data Mining. Addison Wesley.
De cursus bestaat uit een combinatie van hoorcolleges, praktische lab-sessies, begeleide oefeningen, casestudies en projectmatig leren. Tijdens de hoorcolleges worden de theoretische grondslagen van data-analyse en machine learning-methoden behandeld, terwijl de lab-sessies de deelnemers de kans bieden om deze technieken toe te passen op echte of gesimuleerde datasets met behulp van geschikte softwaretools. De studenten werken zowel individueel als in groepen aan het oplossen van analytische problemen, het interpreteren van resultaten en het evalueren van modelprestaties. De cursus omvat tevens discussies, demonstraties en feedbacksessies om kritisch denken en de ontwikkeling van praktische vaardigheden te stimuleren.
Cijferlijst