Méthodes de recherche sur les médias fondées sur les données – Intelligence artificielle – Comment analyser une mer de textes ?

Méthodes de recherche sur les médias fondées sur les données – Intelligence artificielle – Comment analyser une mer de textes ?

Établissement de formation

ELTE/BTK
Département des médias et de la communication

Enseignant(s) :

Márton Gosztonyi, docteur ès sciences

Date de début

17 février 2025

Date de fin

17 mai 2025

Domaine d'étude

Champ prioritaire CHARM

Niveau d'études

Charge de travail, ECTS

3

Brève description

L'objectif de ce cours est de fournir aux étudiants des connaissances approfondies sur les techniques et méthodes fondamentales du traitement du langage naturel (TLN) et de l'apprentissage automatique. Tout au long du semestre, les étudiants apprendront le langage de programmation Python et son application à diverses tâches de traitement de texte, notamment le web scraping, la préparation de texte, la tokenisation et la lemmatisation. Le cours aborde les modèles vectoriels, les modèles probabilistes et différents types de modèles d'apprentissage automatique, permettant ainsi aux étudiants de résumer des textes, de les classer et d'appliquer divers modèles linguistiques et techniques de modélisation de textes. Outre les connaissances théoriques, les étudiants approfondiront leur compréhension grâce à des exercices pratiques, ce qui les préparera à mettre en œuvre des solutions avancées de TALN dans des contextes concrets.

Description complète

Thèmes abordés et calendrier des cours (sur la base d'un semestre de 14 semaines) :

1) Introduction à l'intelligence artificielle et au traitement du langage naturel (NLP)
2) Python I : Opérations de base, variables, lecture de fichiers
3) Python II : Opérations if-else, chaînes de caractères, collections, listes, fonctions de listes, boucles
4) Python III : Web scraping, collections, tuples, dictionnaires
5) Modèles vectoriels : Préparation du texte, tokenisation, lemmatisation
6) Modèles vectoriels : TF-IDF, représentations neuronales des mots
7) Modèles probabilistes : modèle de Markov, classification de textes
8) Modèles probabilistes : modèles linguistiques, génération de textes, écriture de poésie
9) Modèles probabilistes : substitution de mots basée sur les N-grammes
10) Modèles d’apprentissage automatique : Naive Bayes – Comment déterminer si mon modèle est adéquat ?
11) Modèles d’apprentissage automatique : régression logistique – analyse des sentiments
12) Modèles d’apprentissage automatique : synthèse de texte
13) Modèles d’apprentissage automatique : allocation latente de Dirichlet – modélisation de thèmes, factorisation de matrices non négatives (NMF)
14) Modèles d’apprentissage automatique : analyse sémantique latente (indexation sémantique latente)

Acquis d'apprentissage

À l'issue de cette formation, le participant sera capable d'analyser de grands ensembles de données textuelles à l'aide du traitement du langage naturel (NLP) et des techniques d'apprentissage automatique.

À l'issue de cette formation, le participant sera capable de mettre en pratique ses compétences en programmation Python pour réaliser des tâches telles que le web scraping, la préparation de texte, la tokenisation et la lemmatisation.

À l'issue de cette formation, le participant sera capable d'utiliser des modèles vectoriels, des modèles probabilistes et des modèles d'apprentissage automatique pour résumer, classer et modéliser des textes.

À l'issue de cette formation, le participant sera capable de créer des modèles linguistiques pour la génération de texte et de réaliser une analyse des sentiments à l'aide de la régression logistique.

À l'issue de cette formation, le participant sera capable de mettre en œuvre des techniques d'apprentissage automatique telles que l'algorithme de Naive Bayes, l'allocation latente de Dirichlet (LDA) et la modélisation de thèmes afin d'explorer les tendances présentes dans les données textuelles.

À l'issue de cette formation, le participant sera capable d'évaluer l'efficacité des modèles de traitement du langage naturel (NLP) en interprétant les résultats des algorithmes d'apprentissage automatique.

À l'issue de cette formation, le participant sera capable de collaborer à des projets en groupe pour développer des scripts Python, d'appliquer des méthodes de traitement du langage naturel (NLP) et de présenter des résultats issus de l'analyse de données réelles.

Exigences du cours

Aucune condition requise.

Places disponibles

20

Ouvrages du cours (obligatoires ou recommandés) :

Lectures obligatoires :

Elhadad, M. (2010). Traitement du langage naturel avec Python, Steven Bird, Ewan Klein et Edward Loper, O’Reilly Media.
Antić, Z. (2021). Python Natural Language Processing Cookbook. Packt Publishing Ltd.

Wittgenstein, L. (1998). Enquêtes philosophiques. Atlantis Budapest.

Chomsky, N. (1968). Contributions linguistiques à l'étude de l'esprit : l'avenir. Langage et pensée.

Gadamer, H.G. (2003). Vérité et méthode : esquisse d'une herméneutique philosophique. Sapientia Humana Osiris.

Lectures recommandées :

Shannon, C. (2001). Une théorie mathématique de la communication. ACM SIGMOBILE Mobile Computing and Communications Review.

Barrios, F., López, F., Argerich, L. et Wachenchauzer, R. (2016). Variations de la fonction de similarité de TextRank pour la synthèse automatisée.

Steinberger, J., & Jezek, K. (2004). Utilisation de l’analyse sémantique latente dans la synthèse de textes et l’évaluation des résumés.
Metsis, V., Androutsopoulos, I., & Paliouras, G. (2006). Filtrage du spam avec l’algorithme de Bayes naïf – Quel algorithme de Bayes naïf ?

Aizawa, A. (2003). Une approche fondée sur la théorie de l'information des mesures TF-IDF.

Mihalcea, R., & Tarau, P. (2004). TextRank : mettre de l'ordre dans les textes.

Gong, Y., & Liu, X. (2001). Résumé de textes génériques à l'aide d'une mesure de pertinence et de l'analyse sémantique latente.

Ramadhan, W.P., Novianty, S.A. et Setianingsih, S.C. (2017). Analyse des sentiments à l'aide de la régression logistique multinomiale.

Blei, D.M., Ng, A.Y. et Jordan, M.I. (2003). « Latent Dirichlet Allocation ». Journal of Machine Learning Research.

Activités pédagogiques prévues et méthodes d'enseignement :

Des sessions interactives qui favorisent la discussion, l'analyse et l'exploration pratique des techniques de traitement du langage naturel (NLP) et des modèles d'apprentissage automatique. Les étudiants travailleront à partir d'exemples concrets, d'études de cas et d'articles scientifiques.

Travail en groupe :

Projets collaboratifs dans le cadre desquels les étudiants travailleront en équipe pour appliquer des méthodes d’apprentissage automatique à l’analyse d’ensembles de données textuelles. Cela comprend la création de scripts Python, la réalisation de tâches de traitement des données et la présentation de leurs résultats.
Séances pratiques en laboratoire :

Exercices pratiques de programmation réalisés dans une salle informatique. Les étudiants mettront en œuvre les techniques apprises lors des cours magistraux, telles que le web scraping, la tokenisation, la classification de textes et la synthèse, à l'aide de Python.

Les étudiants présenteront leurs projets de groupe devant la classe, ce qui leur permettra de développer leurs compétences en matière de présentation et de bénéficier des commentaires de leurs camarades et de l'enseignant.

Code du cours

BBN-MTU-465

Langue

Méthode d'évaluation

Certification finale

Relevé de notes

aucun

Date d'évaluation

17 mai 2025

Modalité

Système de gestion de l'apprentissage actuellement utilisé

Toile

Nombre d'heures de cours par semaine pour l'étudiant :

90 min

Jour et heure précis de cours hebdomadaires

10 h 00 - 11 h 30

Fuseau horaire