Målet med kurset er å gi studentene omfattende kunnskap om grunnleggende teknikker og metoder innen naturlig språkbehandling (NLP) og maskinlæring. Gjennom semesteret vil studentene lære programmeringsspråket Python og dets anvendelse i ulike tekstbehandlingsoppgaver, inkludert webskraping, tekstforberedelse, tokenisering og lemmatisering. Kurset dekker vektormodeller, sannsynlighetsmodeller og ulike typer maskinlæringsmodeller, slik at studentene kan oppsummere tekster, klassifisere tekster og anvende ulike språklige modeller og tekstmodelleringsteknikker. I tillegg til teoretisk kunnskap vil studentene utdype sin forståelse gjennom praktiske øvelser, som forbereder dem på å anvende avanserte NLP-løsninger i virkelige kontekster.
Kursemner og timeplan (basert på et 14-ukers semester):
1) Introduksjon til kunstig intelligens og NLP
2) Python I: Grunnleggende operasjoner, variabler, fillesing
3) Python II: If-Else-operasjoner, strenger, samlinger, lister, listefunksjoner, løkker
4) Python III: Nettskraping, samlinger, tupler, ordbøker
5) Vektormodeller: Tekstforberedelse, tokenisering, lemmatisering
6) Vektormodeller: TF-IDF, nevrale ordinnleggelser
7) Probabilistiske modeller: Markov-modell, tekstklassifisering
8) Probabilistiske modeller: Språkmodeller, tekstgenerering, poesiskriving
9) Probabilistiske modeller: N-Gram-basert ordsubstitusjon
10) Maskinlæringsmodeller: Naive Bayes – Hvordan avgjøre om modellen min er tilstrekkelig?
11) Maskinlæringsmodeller: Logistisk regresjon – Sentimentanalyse
12) Maskinlæringsmodeller: Tekstsammendrag
13) Maskinlæringsmodeller: Latent Dirichlet-allokering – emnemodellering, ikke-negativ matrisefaktorisering (NMF)
14) Maskinlæringsmodeller: Latent semantisk analyse (latent semantisk indeksering)
Etter endt kurs vil studenten kunne analysere store tekstdatasett ved hjelp av naturlig språkbehandling (NLP) og maskinlæringsteknikker.
Etter endt kurs vil studenten kunne anvende Python-programmeringsferdigheter til å utføre oppgaver som webskraping, tekstforberedelse, tokenisering og lemmatisering.
Etter endt kurs vil studenten kunne bruke vektormodeller, sannsynlighetsmodeller og maskinlæringsmodeller for å oppsummere, klassifisere og modellere tekster.
Etter endt kurs vil studenten kunne lage språkmodeller for tekstgenerering og utføre sentimentanalyse ved hjelp av logistisk regresjon.
Etter endt kurs vil studenten kunne implementere maskinlæringsteknikker som Naive Bayes, Latent Dirichlet Allocation (LDA) og Topic Modeling for å utforske mønstre i tekstdata.
Etter endt kurs vil studenten kunne evaluere effektiviteten til NLP-modeller ved å tolke resultatene fra maskinlæringsalgoritmer.
Etter endt kurs vil studenten kunne samarbeide i gruppeprosjekter for å utvikle Python-skript, anvende NLP-metoder og presentere funn basert på analyse av data fra den virkelige verden.
Ingen krav.
Obligatorisk lesestoff:
Elhadad, M. (2010). Naturlig språkbehandling med Python, Steven Bird, Ewan Klein og Edward Loper, O'Reilly Media.
Antić, Z. (2021). Kokebok for Python-behandling av naturlig språk. Packt Publishing Ltd.
Wittgenstein, L. (1998). Filosofiske undersøkelser. Atlantis Budapest.
Chomsky, N. (1968). Språklige bidrag til studiet av sinnet: Fremtid. Språk og tenkning.
Gadamer, HG (2003). Sannhet og metode: Oversikt over filosofisk hermeneutikk. Sapientia Humana Osiris.
Anbefalt lesning:
Shannon, C. (2001). En matematisk kommunikasjonsteori. ACM SIGMOBILE Mobile Computing and Communications Review.
Barrios, F., López, F., Argerich, L., og Wachenchauzer, R. (2016). Variasjoner av likhetsfunksjonen til TextRank for automatisert oppsummering.
Steinberger, J., og Jezek, K. (2004). Bruk av latent semantisk analyse i tekstoppsummering og sammendragsevaluering.
Metsis, V., Androutsopoulos, I., og Paliouras, G. (2006). Spamfiltrering med naive Bayes – hvilke naive Bayes?
Aizawa, A. (2003). Et informasjonsteoretisk perspektiv på TF-IDF-tiltak.
Mihalcea, R., & Tarau, P. (2004). TextRank: Gir orden i tekster.
Gong, Y., og Liu, X. (2001). Generisk tekstoppsummering ved bruk av relevansmål og latent semantisk analyse.
Ramadhan, WP, Novianty, SA og Setianingsih, SC (2017). Sentimentanalyse ved bruk av multinomial logistisk regresjon.
Blei, DM, Ng, AY og Jordan, MI (2003). Latent Dirichlet-tildeling. Journal of Machine Learning Research.
Interaktive økter som oppmuntrer til diskusjon, analyse og praktisk utforskning av NLP-teknikker og maskinlæringsmodeller. Studentene vil engasjere seg i eksempler fra den virkelige verden, casestudier og akademiske artikler.
Gruppearbeid:
Samarbeidsprosjekter der studentene skal jobbe i team for å bruke maskinlæringsmetoder til å analysere tekstdatasett. Dette inkluderer å lage Python-skript, utføre databehandlingsoppgaver og presentere funnene sine.
Praktiske laboratorieøkter:
Praktiske programmeringsøvelser utført i et datalab. Studentene vil implementere teknikkene som læres i forelesningene, som webskraping, tokenisering, tekstklassifisering og oppsummering, ved hjelp av Python.
Studentene skal presentere gruppeprosjektene sine for klassen, noe som gir dem muligheten til å utvikle presentasjonsferdigheter og motta tilbakemeldinger fra medstudenter og instruktøren.
Utskrift av journaler