El curso repasa los conceptos y principios básicos que subyacen a los principales modelos y técnicas de la ciencia de datos. Se explican con mayor detalle las técnicas descriptivas, como la agrupación en clústeres y la minería de patrones frecuentes, mientras que, en el caso de las técnicas predictivas, se hace hincapié principalmente en los conceptos de un modelo, sus parámetros e hiperparámetros, así como en la calidad y la validación de los modelos, incluyendo el sobreajuste y el subajuste, y las compensaciones entre sesgo y varianza. También se abordan cuestiones relacionadas con la calidad de los datos y el preprocesamiento en relación con diversos tipos de datos y problemas de modelización. Detalles de los temas tratados:
– Introducción al análisis bivariado y multivariado
– Visualización de datos y análisis exploratorio de datos
– Reducción de dimensionalidad y selección de características
– Agrupación: k-means, aglomerativa, DBSCAN, validación de clústeres;
– Minería de patrones frecuentes: conjuntos de elementos, reglas de asociación, medidas de calidad;
– Clasificación lineal y regresión: modelo, parámetros e hiperparámetros, validación, sobreajuste y subajuste, y el equilibrio entre sesgo y varianza;
https://neptun.elte.hu/MobilityCourses?Faculty=&Programme=&AcademicTerm=&Published=&SearchText=Introduction+to+data+science
Al finalizar el curso, el alumno será capaz de aplicar técnicas de análisis bivariado y multivariado, utilizar la visualización de datos y el análisis exploratorio de datos para investigar conjuntos de datos, seleccionar métodos de reducción de dimensionalidad y de selección de características, implementar y validar algoritmos de agrupamiento, descubrir y evaluar conjuntos de elementos frecuentes y reglas de asociación, y desarrollar, ajustar y validar modelos lineales de clasificación y regresión, teniendo en cuenta el sobreajuste, el subajuste y el equilibrio entre sesgo y varianza.
Se espera que los alumnos cuenten con conocimientos básicos de estadística, álgebra lineal y programación, así como con experiencia previa en el manejo de datos y en conceptos básicos de aprendizaje automático.
– Peter Flach (2012). Aprendizaje automático: el arte y la ciencia de los algoritmos que dan sentido a los datos. Cambridge University Press.
– Jiawei Han, Micheline Kamber, Jian Pei (2011). Minería de datos: conceptos y técnicas. Morgan Kaufmann.
– Pang-Ning Tan, Michael Steinbach, Vipin Kumar (2005). Introducción a la minería de datos. Addison Wesley.
El curso combinará clases magistrales, sesiones prácticas de laboratorio, ejercicios guiados, casos prácticos y aprendizaje basado en proyectos. Las clases magistrales presentarán los fundamentos teóricos del análisis de datos y los métodos de aprendizaje automático, mientras que las sesiones de laboratorio permitirán a los alumnos aplicar estas técnicas a conjuntos de datos reales o simulados utilizando las herramientas de software adecuadas. Los alumnos trabajarán de forma individual y en grupo para resolver problemas analíticos, interpretar resultados y evaluar el rendimiento de los modelos. El curso también incluirá debates, demostraciones y sesiones de retroalimentación para fomentar el pensamiento crítico y el desarrollo de habilidades prácticas.
Extracto académico