Kursen ger en översikt över de grundläggande begreppen och principerna bakom de viktigaste modellerna och teknikerna inom datavetenskap. Beskrivande tekniker såsom klusteranalys och utvinning av frekventa mönster förklaras mer ingående, medan fokus när det gäller prediktiva tekniker främst ligger på modellens begrepp, dess parametrar och hyperparametrar samt modellernas kvalitet och validering, inklusive överanpassning och underanpassning samt avvägningen mellan bias och varians. Frågor kring datakvalitet och förbehandling relaterade till olika datatyper samt modelleringsproblem behandlas också. Detaljer om de ämnen som behandlas:
– Introduktion till två- och flervariabelanalys
– Datavisualisering och explorativ dataanalys
– Dimensionsreduktion och val av egenskaper
– Klusteranalys: k-means, agglomerativ klusteranalys, DBSCAN, klustervalidering;
– Utvinning av frekventa mönster: objektuppsättningar, associationsregler, kvalitetsmått;
– Linjär klassificering och regression: modell, parametrar och hyperparametrar, validering, överanpassning och underanpassning samt avvägningen mellan bias och varians;
https://neptun.elte.hu/MobilityCourses?Faculty=&Programme=&AcademicTerm=&Published=&SearchText=Introduction+to+data+science
Vid kursens slut kommer deltagaren att kunna tillämpa tvåvariabel- och flervariabelanalysmetoder, använda datavisualisering och explorativ dataanalys för att undersöka datamängder, välja metoder för dimensionsreduktion och egenskapsurval, implementera och validera klusteralgoritmer, upptäcka och utvärdera frekventa objektmängder och associationsregler samt utveckla, finjustera och validera linjära klassificerings- och regressionsmodeller samtidigt som man hanterar överanpassning, underanpassning och avvägningen mellan bias och varians.
Deltagarna förväntas ha grundläggande kunskaper i statistik, linjär algebra och programmering, samt tidigare erfarenhet av datahantering och grundläggande begrepp inom maskininlärning
– Peter Flach (2012). Machine Learning: The Art and Science of Algorithms that Make Sense of Data. Cambridge University Press.
– Jiawei Han, Micheline Kamber, Jian Pei (2011). Data Mining: Concepts and Techniques. Morgan Kaufmann.
– Pang-Ning Tan, Michael Steinbach, Vipin Kumar (2005). Introduction to Data Mining. Addison Wesley.
Kursen kommer att kombinera föreläsningar, praktiska laborationer, vägledda övningar, fallstudier och projektbaserat lärande. Föreläsningarna kommer att ge en introduktion till de teoretiska grunderna för dataanalys och metoder för maskininlärning, medan laborationerna ger deltagarna möjlighet att tillämpa dessa tekniker på verkliga eller simulerade datamängder med hjälp av lämpliga programvaruverktyg. Deltagarna kommer att arbeta både individuellt och i grupper för att lösa analytiska problem, tolka resultat och utvärdera modellernas prestanda. Kursen kommer även att omfatta diskussioner, demonstrationer och återkopplingssessioner för att främja kritiskt tänkande och utveckling av praktiska färdigheter.
Studieutdrag