L'objectiu del curs és proporcionar als estudiants un coneixement exhaustiu de les tècniques i mètodes fonamentals en el processament del llenguatge natural (PLN) i l'aprenentatge automàtic. Al llarg del semestre, els estudiants aprendran el llenguatge de programació Python i la seva aplicació a diverses tasques de processament de text, com ara la recopilació de dades web, la preparació de text, la tokenització i la lematització. El curs cobreix models vectorials, models probabilístics i diferents tipus de models d'aprenentatge automàtic, permetent als estudiants resumir textos, classificar textos i aplicar diversos models lingüístics i tècniques de modelització de text. A més dels coneixements teòrics, els estudiants aprofundiran en la seva comprensió mitjançant exercicis pràctics, preparant-los per aplicar solucions avançades de PNL en contextos del món real.
Temes i horari del curs (basats en un semestre de 14 setmanes):
1) Introducció a la Intel·ligència Artificial i la PNL
2) Python I: Operacions bàsiques, variables, lectura de fitxers
3) Python II: operacions If-Else, cadenes, col·leccions, llistes, funcions de llista, bucles
4) Python III: Web Scraping, col·leccions, tuples, diccionaris
5) Models vectorials: preparació de text, tokenització, lematització
6) Models vectorials: TF-IDF, incrustacions neuronals de paraules
7) Models probabilístics: model de Markov, classificació de text
8) Models probabilístics: models lingüístics, generació de textos, escriptura de poesia
9) Models probabilístics: substitució de paraules basada en N-Gram
10) Models d'aprenentatge automàtic: Bayes ingenu: com puc determinar si el meu model és adequat?
11) Models d'aprenentatge automàtic: Regressió logística – Anàlisi de sentiments
12) Models d'aprenentatge automàtic: resum de text
13) Models d'aprenentatge automàtic: assignació latent de Dirichlet: modelització per temes, factorització matricial no negativa (NMF)
14) Models d'aprenentatge automàtic: anàlisi semàntica latent (indexació semàntica latent)
Al final del curs, l'estudiant serà capaç d'analitzar grans conjunts de dades de text utilitzant tècniques de processament del llenguatge natural (PLN) i aprenentatge automàtic.
Al final del curs, l'alumne podrà aplicar les habilitats de programació en Python per realitzar tasques com ara l'extracció de dades web, la preparació de text, la tokenització i la lematització.
Al final del curs, l'alumne podrà utilitzar models vectorials, models probabilístics i models d'aprenentatge automàtic per resumir, classificar i modelar textos.
Al final del curs, l'alumne podrà crear models lingüístics per a la generació de text i realitzar anàlisis de sentiments mitjançant la regressió logística.
Al final del curs, l'alumne podrà implementar tècniques d'aprenentatge automàtic com ara Naive Bayes, Latent Dirichlet Allocation (LDA) i Topic Modeling per explorar patrons en dades textuals.
Al final del curs, l'alumne podrà avaluar l'efectivitat dels models de PNL interpretant els resultats dels algoritmes d'aprenentatge automàtic.
Al final del curs, l'alumne podrà col·laborar en projectes de grup per desenvolupar scripts de Python, aplicar mètodes de PNL i presentar resultats basats en l'anàlisi de dades del món real.
Sense requisits.
Lectura obligatòria:
Elhadad, M. (2010). Processament del llenguatge natural amb Python, Steven Bird, Ewan Klein i Edward Loper, O'Reilly Media.
Antić, Z. (2021). Llibre de cuina sobre processament del llenguatge natural en Python. Packt Publishing Ltd.
Wittgenstein, L. (1998). Investigacions filosòfiques. Atlantis Budapest.
Chomsky, N. (1968). Contribucions lingüístiques a l'estudi de la ment: futur. Llenguatge i pensament.
Gadamer, HG (2003). Veritat i mètode: esbós d'una hermenèutica filosòfica. Sapientia Humana Osiris.
Lectura recomanada:
Shannon, C. (2001). Una teoria matemàtica de la comunicació. ACM SIGMOBILE Mobile Computing and Communications Review.
Barrios, F., López, F., Argerich, L., i Wachenchauzer, R. (2016). Variacions de la funció de similitud de TextRank per a la resum automatitzada.
Steinberger, J., i Jezek, K. (2004). Ús de l'anàlisi semàntica latent en el resum de text i l'avaluació de resums.
Metsis, V., Androutsopoulos, I., i Paliouras, G. (2006). Filtratge de correu brossa amb Naive Bayes: quin Naive Bayes?
Aizawa, A. (2003). Una perspectiva teòrica de la informació de les mesures TF-IDF.
Mihalcea, R. i Tarau, P. (2004). TextRank: posar ordre als textos.
Gong, Y., i Liu, X. (2001). Resum genèric de text mitjançant mesures de rellevància i anàlisi semàntica latent.
Ramadhan, WP, Novianty, SA i Setianingsih, SC (2017). Anàlisi de sentiments mitjançant regressió logística multinomial.
Blei, DM, Ng, AY i Jordan, MI (2003). Assignació de Dirichlet latent. Revista de recerca en aprenentatge automàtic.
Sessions interactives que fomenten la discussió, l'anàlisi i l'exploració pràctica de tècniques de PNL i models d'aprenentatge automàtic. Els estudiants interactuaran amb exemples del món real, estudis de casos i treballs acadèmics.
Treball en grup:
Projectes col·laboratius on els estudiants treballaran en equips per aplicar mètodes d'aprenentatge automàtic per analitzar conjunts de dades de text. Això inclou la creació de scripts de Python, la realització de tasques de processament de dades i la presentació dels seus resultats.
Sessions pràctiques de laboratori:
Exercicis pràctics de programació realitzats en un laboratori d'informàtica. Els estudiants implementaran les tècniques apreses a les classes, com ara l'extracció de dades web, la tokenització, la classificació de text i el resum, utilitzant Python.
Els estudiants presentaran els seus projectes en grup a la classe, oferint-los l'oportunitat de desenvolupar habilitats de presentació i rebre comentaris dels companys i del professor.
Transcripció de registres