Der Kurs führt durch die grundlegenden Konzepte und Prinzipien, die den wichtigsten Modellen und Techniken der Datenwissenschaft zugrunde liegen. Deskriptive Techniken wie Clustering und die Erkennung häufiger Muster werden ausführlicher erläutert, während bei prädiktiven Techniken der Schwerpunkt vor allem auf den Konzepten eines Modells, seinen Parametern und Hyperparametern sowie der Qualität und Validierung von Modellen liegt, einschließlich Überanpassung, Unteranpassung und dem Kompromiss zwischen Verzerrung und Varianz. Außerdem werden Fragen der Datenqualität und der Vorverarbeitung im Zusammenhang mit verschiedenen Datentypen sowie Modellierungsprobleme behandelt. Details zu den behandelten Themen:
– Einführung in die bivariate und multivariate Analyse
– Datenvisualisierung und explorative Datenanalyse
– Dimensionsreduktion und Merkmalsauswahl
– Clusteranalyse: k-Means, agglomerative Verfahren, DBSCAN, Clustervalidierung;
– Frequent Pattern Mining: Item-Sets, Assoziationsregeln, Qualitätsmaße;
– Lineare Klassifikation und Regression: Modell, Parameter und Hyperparameter, Validierung, Überanpassung und Unteranpassung sowie der Bias-Varianz-Kompromiss;
https://neptun.elte.hu/MobilityCourses?Faculty=&Programme=&AcademicTerm=&Published=&SearchText=Introduction+to+data+science
Am Ende des Kurses sind die Teilnehmer in der Lage, bivariate und multivariate Analysetechniken anzuwenden, Datensätze mithilfe von Datenvisualisierung und explorativer Datenanalyse zu untersuchen, Methoden zur Dimensionsreduktion und Merkmalsauswahl auszuwählen, Clustering-Algorithmen zu implementieren und zu validieren, häufige Item-Sets und Assoziationsregeln zu identifizieren und zu bewerten sowie lineare Klassifikations- und Regressionsmodelle zu entwickeln, zu optimieren und zu validieren, wobei sie dabei Überanpassung, Unteranpassung und den Bias-Varianz-Kompromiss berücksichtigen.
Von den Teilnehmern werden Grundkenntnisse in Statistik, linearer Algebra und Programmierung sowie Vorkenntnisse im Umgang mit Daten und in den Grundlagen des maschinellen Lernens erwartet.
– Peter Flach (2012). Machine Learning: Die Kunst und Wissenschaft von Algorithmen, die Daten sinnvoll auswerten. Cambridge University Press.
– Jiawei Han, Micheline Kamber, Jian Pei (2011). Data Mining: Konzepte und Techniken. Morgan Kaufmann.
– Pang-Ning Tan, Michael Steinbach, Vipin Kumar (2005). Einführung in das Data Mining. Addison Wesley.
Der Kurs verbindet Vorlesungen, praktische Laborübungen, angeleitete Übungen, Fallstudien und projektbasiertes Lernen. In den Vorlesungen werden die theoretischen Grundlagen der Datenanalyse und der Methoden des maschinellen Lernens vermittelt, während die Laborübungen den Teilnehmenden die Möglichkeit bieten, diese Techniken mithilfe geeigneter Softwaretools auf reale oder simulierte Datensätze anzuwenden. Die Studierenden arbeiten einzeln und in Gruppen daran, analytische Probleme zu lösen, Ergebnisse zu interpretieren und die Modellleistung zu bewerten. Der Kurs umfasst zudem Diskussionen, Demonstrationen und Feedbackrunden, um kritisches Denken und die Entwicklung praktischer Fähigkeiten zu fördern.
Zeugnis