Datengestützte Methoden der Medienforschung – Künstliche Intelligenz – Wie lässt sich eine Flut von Texten analysieren?

Datengestützte Methoden der Medienforschung – Künstliche Intelligenz – Wie lässt sich eine Flut von Texten analysieren?

Ausstellende Einrichtung

ELTE/BTK
Fachbereich Medien und Kommunikation

Dozent(en):

Dr. Márton Gosztonyi

Startdatum

17. Februar 2025

Enddatum

17. Mai 2025

Studienfach

CHARM-Prioritätsfeld

Studienniveau

Studienaufwand, ECTS

3

Kurzbeschreibung

Ziel des Kurses ist es, den Studierenden umfassende Kenntnisse über grundlegende Techniken und Methoden der natürlichen Sprachverarbeitung (NLP) und des maschinellen Lernens zu vermitteln. Im Laufe des Semesters lernen die Studierenden die Programmiersprache Python und deren Anwendung auf verschiedene Aufgaben der Textverarbeitung kennen, darunter Web-Scraping, Textaufbereitung, Tokenisierung und Lemmatisierung. Der Kurs behandelt Vektormodelle, probabilistische Modelle und verschiedene Arten von Modellen des maschinellen Lernens und befähigt die Studierenden, Texte zusammenzufassen, zu klassifizieren und verschiedene linguistische Modelle sowie Techniken der Textmodellierung anzuwenden. Neben dem theoretischen Wissen vertiefen die Studierenden ihr Verständnis durch praktische Übungen, wodurch sie darauf vorbereitet werden, fortgeschrittene NLP-Lösungen in realen Kontexten anzuwenden.

Ausführliche Beschreibung

Kursthemen und Zeitplan (basierend auf einem 14-wöchigen Semester):

1) Einführung in künstliche Intelligenz und NLP
2) Python I: Grundlegende Operationen, Variablen, Einlesen von Dateien
3) Python II: If-Else-Operationen, Zeichenketten, Sammlungen, Listen, Listenfunktionen, Schleifen
4) Python III: Web-Scraping, Sammlungen, Tupel, Wörterbücher
5) Vektormodelle: Textvorbereitung, Tokenisierung, Lemmatisierung
6) Vektormodelle: TF-IDF, neuronale Wort-Embeddings
7) Probabilistische Modelle: Markov-Modell, Textklassifizierung
8) Probabilistische Modelle: Sprachmodelle, Textgenerierung, Gedichtschreiben
9) Probabilistische Modelle: N-Gram-basierte Wortersetzung
10) Modelle des maschinellen Lernens: Naive-Bayes-Modell – Wie stelle ich fest, ob mein Modell geeignet ist?
11) Modelle des maschinellen Lernens: Logistische Regression – Sentimentanalyse
12) Modelle des maschinellen Lernens: Textzusammenfassung
13) Modelle des maschinellen Lernens: Latent Dirichlet Allocation – Themenmodellierung, nicht-negative Matrixfaktorisierung (NMF)
14) Modelle des maschinellen Lernens: Latente semantische Analyse (Latent Semantic Indexing)

Lernziele

Am Ende des Kurses wird der Teilnehmer in der Lage sein, große Textdatensätze mithilfe von Techniken der natürlichen Sprachverarbeitung (NLP) und des maschinellen Lernens zu analysieren.

Am Ende des Kurses wird der Teilnehmer in der Lage sein, seine Python-Programmierkenntnisse anzuwenden, um Aufgaben wie Web-Scraping, Textvorbereitung, Tokenisierung und Lemmatisierung durchzuführen.

Am Ende des Kurses wird der Lernende in der Lage sein, Vektormodelle, Wahrscheinlichkeitsmodelle und Modelle des maschinellen Lernens zu nutzen, um Texte zusammenzufassen, zu klassifizieren und zu modellieren.

Am Ende des Kurses wird der Teilnehmer in der Lage sein, Sprachmodelle zur Textgenerierung zu erstellen und mithilfe logistischer Regression eine Stimmungsanalyse durchzuführen.

Am Ende des Kurses wird der Teilnehmer in der Lage sein, Techniken des maschinellen Lernens wie Naive Bayes, Latent Dirichlet Allocation (LDA) und Topic Modeling anzuwenden, um Muster in Textdaten zu untersuchen.

Am Ende des Kurses wird der Teilnehmer in der Lage sein, die Wirksamkeit von NLP-Modellen zu bewerten, indem er die Ergebnisse von Algorithmen des maschinellen Lernens auswertet.

Am Ende des Kurses sind die Teilnehmer in der Lage, im Rahmen von Gruppenprojekten Python-Skripte zu entwickeln, NLP-Methoden anzuwenden und Ergebnisse auf der Grundlage der Analyse realer Daten zu präsentieren.

Kursvoraussetzungen

Keine Voraussetzungen.

Freie Plätze

20

Literatur zum Kurs (Pflichtlektüre oder empfohlene Lektüre):

Pflichtlektüre:

Elhadad, M. (2010). „Natural Language Processing with Python“, Steven Bird, Ewan Klein und Edward Loper, O’Reilly Media.
Antić, Z. (2021). „Python Natural Language Processing Cookbook“. Packt Publishing Ltd.

Wittgenstein, L. (1998). Philosophische Untersuchungen. Atlantis Budapest.

Chomsky, N. (1968). Linguistische Beiträge zur Erforschung des Geistes: Zukunft. Sprache und Denken.

Gadamer, H. G. (2003). Wahrheit und Methode: Entwurf einer philosophischen Hermeneutik. Sapientia Humana Osiris.

Literaturempfehlungen:

Shannon, C. (2001). Eine mathematische Theorie der Kommunikation. ACM SIGMOBILE Mobile Computing and Communications Review.

Barrios, F., López, F., Argerich, L. und Wachenchauzer, R. (2016). Variationen der Ähnlichkeitsfunktion von TextRank für die automatisierte Zusammenfassung.

Steinberger, J., & Jezek, K. (2004). Einsatz der latenten semantischen Analyse bei der Textzusammenfassung und der Bewertung von Zusammenfassungen.
Metsis, V., Androutsopoulos, I., & Paliouras, G. (2006). Spam-Filterung mit Naive-Bayes-Algorithmen – Welcher Naive-Bayes-Algorithmus?

Aizawa, A. (2003). Eine informationstheoretische Perspektive auf TF-IDF-Maße.

Mihalcea, R., & Tarau, P. (2004). TextRank: Ordnung in Texte bringen.

Gong, Y., & Liu, X. (2001). Allgemeine Textzusammenfassung unter Verwendung von Relevanzmaßen und latenter semantischer Analyse.

Ramadhan, W.P., Novianty, S.A. und Setianingsih, S.C. (2017). Sentimentanalyse mittels multinomialer logistischer Regression.

Blei, D.M., Ng, A.Y. und Jordan, M.I. (2003). Latent Dirichlet Allocation. Journal of Machine Learning Research.

Geplante pädagogische Aktivitäten und Unterrichtsmethoden:

Interaktive Veranstaltungen, die zur Diskussion, Analyse und praktischen Erprobung von NLP-Techniken und Modellen des maschinellen Lernens anregen. Die Studierenden setzen sich mit Beispielen aus der Praxis, Fallstudien und wissenschaftlichen Arbeiten auseinander.

Gruppenarbeit:

Kooperative Projekte, bei denen die Studierenden in Teams arbeiten und Methoden des maschinellen Lernens zur Analyse von Textdatensätzen anwenden. Dazu gehören das Erstellen von Python-Skripten, die Durchführung von Datenverarbeitungsaufgaben und die Präsentation ihrer Ergebnisse.
Praktische Laborübungen:

Praktische Programmierübungen, die in einem Computerraum durchgeführt werden. Die Studierenden wenden die in den Vorlesungen erlernten Techniken wie Web-Scraping, Tokenisierung, Textklassifizierung und Zusammenfassung mithilfe von Python an.

Die Studierenden werden ihre Gruppenprojekte vor der Klasse präsentieren, was ihnen die Möglichkeit bietet, ihre Präsentationsfähigkeiten weiterzuentwickeln und Feedback von ihren Kommilitonen und dem Dozenten zu erhalten.

Kurscode

BBN-MTU-465

Sprache

Bewertungsmethode

Abschließende Zertifizierung

Zeugnis

keine

Bewertungsdatum

17. Mai 2025

Modalität

Eingesetztes Lernmanagementsystem

Leinwand

Unterrichtsstunden pro Woche für den Studierenden:

90 Min.

Konkrete regelmäßige wöchentliche Unterrichtstage/-zeiten

10:00–11:30 Uhr

Zeitzone