Kurset navigerer gjennom de grunnleggende konseptene og prinsippene bak de viktigste datavitenskapelige modellene og teknikkene. Deskriptive teknikker som klynging og hyppig mønsterutvinning forklares mer detaljert, mens fokuset i tilfelle prediktive teknikker hovedsakelig legges på konseptene bak en modell, dens parametere og hyperparametere, samt kvaliteten og valideringen av modeller, inkludert overfitting-underfitting og avveininger mellom bias og varians. Datakvalitet og forbehandlingsproblemer knyttet til ulike datatyper og modelleringsproblemer blir også tatt opp. Detaljer om emnene som dekkes:
– Introduksjon til bivariat og multivariat analyse
– Datavisualisering og utforskende dataanalyse
– Dimensjonalitetsreduksjon og valg av funksjoner
– Klyngedannelse: k-gjennomsnitt, agglomerativ, DBSCAN, klyngevalidering;
– Hyppig mønsterutvinning: elementsett, assosiasjonsregler, kvalitetsmål;
– Lineær klassifisering og regresjon: modell, parametere og hyperparametere, validering, overtilpasning-undertilpasning og avveiningen mellom bias og varians;
https://neptun.elte.hu/MobilityCourses?Faculty=&Programme=&AcademicTerm=&Published=&SearchText=Introduction+to+data+science
Etter endt kurs vil studenten kunne anvende bivariate og multivariate analyseteknikker, bruke datavisualisering og utforskende dataanalyse for å undersøke datasett, velge metoder for dimensjonalitetsreduksjon og funksjonsutvelgelse, implementere og validere klyngealgoritmer, oppdage og vurdere hyppige elementsett og assosiasjonsregler, og utvikle, finjustere og validere lineære klassifiserings- og regresjonsmodeller samtidig som man tar for seg overtilpasning, undertilpasning og avveiningen mellom bias og varians.
Det forventes at studentene har grunnleggende kunnskap om statistikk, lineær algebra og programmering, samt tidligere kjennskap til datahåndtering og grunnleggende maskinlæringskonsepter.
– Peter Flach (2012). Maskinlæring: Kunsten og vitenskapen bak algoritmer som gir mening til data. Cambridge University Press.
– Jiawei Han, Micheline Kamber, Jian Pei (2011). Datautvinning: Konsepter og teknikker. Morgan Kaufmann.
– Pang-Ning Tan, Michael Steinbach, Vipin Kumar (2005). Introduksjon til datautvinning. Addison Wesley.
Kurset vil kombinere forelesninger, praktiske laboratorieøkter, veiledede øvelser, casestudier og prosjektbasert læring. Forelesningene vil introdusere de teoretiske grunnlagene for dataanalyse og maskinlæringsmetoder, mens laboratorieøktene vil gi studentene mulighet til å anvende disse teknikkene på reelle eller simulerte datasett ved hjelp av passende programvareverktøy. Studentene vil jobbe individuelt og i grupper for å løse analytiske problemer, tolke resultater og evaluere modellytelse. Kurset vil også inkludere diskusjoner, demonstrasjoner og tilbakemeldingsøkter for å støtte kritisk tenkning og praktisk ferdighetsutvikling.
Utskrift av journaler