El curs explora els conceptes i principis bàsics que hi ha darrere dels principals models i tècniques de la ciència de dades. Les tècniques descriptives com l'agrupació en clústers i la mineria de patrons freqüents s'expliquen amb més detall, mentre que, en el cas de les tècniques predictives, l'atenció se centra principalment en els conceptes d'un model, els seus paràmetres i hiperparàmetres, així com la qualitat i la validació dels models, incloent-hi el sobreajustament i el subajustament i els compromisos entre biaix i variància. També s'aborden els problemes de qualitat de les dades i de preprocessament relacionats amb diversos tipus de dades i problemes de modelització. Detalls dels temes tractats:
– Introducció a l'anàlisi bivariant i multivariant
– Visualització de dades i anàlisi exploratòria de dades
– Reducció de la dimensionalitat i selecció de característiques
– Agrupació en clústers: k-means, aglomeratiu, DBSCAN, validació de clústers;
– Mineria de patrons freqüents: conjunts d'ítems, regles d'associació, mesures de qualitat;
– Classificació i regressió lineal: model, paràmetres i hiperparàmetres, validació, sobreajustament i subajustament i el compromís entre biaix i variància;
https://neptun.elte.hu/MobilityCourses?Faculty=&Programme=&AcademicTerm=&Published=&SearchText=Introduction+to+data+science
Al final del curs, l'estudiant podrà aplicar tècniques d'anàlisi bivariant i multivariant, utilitzar la visualització de dades i l'anàlisi exploratòria de dades per investigar conjunts de dades, seleccionar mètodes de reducció de la dimensionalitat i selecció de característiques, implementar i validar algoritmes de clústering, descobrir i avaluar conjunts d'ítems freqüents i regles d'associació, i desenvolupar, ajustar i validar models de classificació i regressió lineals, tot abordant el sobreajustament, el subajustament i la compensació entre biaix i variància.
S'espera que els estudiants tinguin coneixements bàsics d'estadística, àlgebra lineal i programació, així com familiaritat prèvia amb el maneig de dades i els conceptes bàsics d'aprenentatge automàtic.
– Peter Flach (2012). Aprenentatge automàtic: l'art i la ciència dels algoritmes que donen sentit a les dades. Cambridge University Press.
– Jiawei Han, Micheline Kamber, Jian Pei (2011). Mineria de dades: conceptes i tècniques. Morgan Kaufmann.
– Pang-Ning Tan, Michael Steinbach, Vipin Kumar (2005). Introducció a la mineria de dades. Addison Wesley.
El curs combinarà classes magistrals, sessions pràctiques de laboratori, exercicis guiats, estudis de casos i aprenentatge basat en projectes. Les classes magistrals introduiran els fonaments teòrics de l'anàlisi de dades i els mètodes d'aprenentatge automàtic, mentre que les sessions de laboratori permetran als estudiants aplicar aquestes tècniques a conjunts de dades reals o simulats utilitzant eines de programari adequades. Els estudiants treballaran individualment i en grup per resoldre problemes analítics, interpretar resultats i avaluar el rendiment del model. El curs també inclourà debats, demostracions i sessions de retroalimentació per donar suport al pensament crític i al desenvolupament d'habilitats pràctiques.
Transcripció de registres