A kurzus célja, hogy a hallgatók átfogó ismereteket szerezzenek a természetes nyelvfeldolgozás (NLP) és a gépi tanulás alapvető technikáiról és módszereiről. A félév során a hallgatók megismerkednek a Python programozási nyelvvel és annak alkalmazásával különböző szövegfeldolgozási feladatokban, ideértve a webes adatgyűjtést, a szövegelőkészítést, a tokenizálást és a lemmatizálást. A kurzus kiterjed a vektormodellekre, a valószínűségi modellekre és a gépi tanulás különböző típusú modelljeire, lehetővé téve a hallgatók számára a szövegek összefoglalását, osztályozását, valamint különböző nyelvészeti modellek és szövegmodellezési technikák alkalmazását. Az elméleti ismeretek mellett a hallgatók gyakorlati feladatok révén is elmélyítik ismereteiket, felkészülve ezzel a fejlett NLP-megoldások valós körülmények közötti alkalmazására.
A kurzus témái és órarendje (14 hetes szemeszter alapján):
1) Bevezetés a mesterséges intelligenciába és a természetes nyelvfeldolgozásba
2) Python I: Alapműveletek, változók, fájlok olvasása
3) Python II: If-Else műveletek, karakterláncok, gyűjtemények, listák, listafüggvények, ciklusok
4) Python III: Webes adatgyűjtés, gyűjtemények, tuple-ok, szótárak
5) Vektoros modellek: Szöveg-előkészítés, tokenizálás, lemmatizálás
6) Vektormodellek: TF-IDF, neurális szóbeágyazások
7) Valószínűségi modellek: Markov-modell, szövegosztályozás
8) Valószínűségi modellek: Nyelvi modellek, szöveggenerálás, versírás
9) Valószínűségi modellek: N-gram-alapú szóhelyettesítés
10) Gépi tanulási modellek: Naiv Bayes – Hogyan állapíthatom meg, hogy a modell megfelelő-e?
11) Gépi tanulási modellek: Logisztikus regresszió – Érzelemelemzés
12) Gépi tanulási modellek: Szövegösszefoglalás
13) Gépi tanulási modellek: Latens Dirichlet-allokáció – Témamodellezés, nemnegatív mátrixfaktorizáció (NMF)
14) Gépi tanulási modellek: Latens szemantikai elemzés (latens szemantikai indexelés)
A tanfolyam végére a hallgató képes lesz nagy szöveges adathalmazokat elemezni a természetes nyelvfeldolgozás (NLP) és a gépi tanulás technikáinak segítségével.
A tanfolyam végén a hallgató képes lesz a Python programozási ismereteit olyan feladatok elvégzésére alkalmazni, mint például a webes adatgyűjtés, a szöveg előkészítése, a tokenizálás és a lemmatizálás.
A tanfolyam végén a hallgató képes lesz vektormodelleket, valószínűségi modelleket és gépi tanulási modelleket alkalmazni szövegek összefoglalására, osztályozására és modellezésére.
A tanfolyam végén a hallgató képes lesz szöveggenerálásra szolgáló nyelvi modelleket létrehozni, valamint logisztikus regresszió segítségével érzelemelemzést végezni.
A kurzus végén a hallgató képes lesz olyan gépi tanulási technikákat alkalmazni, mint a Naive Bayes, a Latent Dirichlet Allocation (LDA) és a téma-modellezés, a szöveges adatokban rejlő mintázatok feltárása érdekében.
A tanfolyam végén a hallgató képes lesz értékelni az NLP-modellek hatékonyságát a gépi tanulási algoritmusok eredményeinek értelmezése révén.
A tanfolyam végén a hallgató képes lesz csoportos projektekben együttműködni Python-szkriptek fejlesztése, természetes nyelvfeldolgozási módszerek alkalmazása, valamint a valós adatok elemzésén alapuló eredmények bemutatása céljából.
Nincs követelmény.
Kötelező olvasmány:
Elhadad, M. (2010). Természetes nyelvfeldolgozás Pythonnal, Steven Bird, Ewan Klein és Edward Loper, O’Reilly Media.
Antić, Z. (2021). Python természetes nyelvfeldolgozási kézikönyv. Packt Publishing Ltd.
Wittgenstein, L. (1998). Filozófiai vizsgálódások. Atlantis, Budapest.
Chomsky, N. (1968). A nyelvészet hozzájárulása az elme kutatásához: Jövő. Nyelv és gondolkodás.
Gadamer, H.G. (2003). Igazság és módszer: Egy filozófiai hermeneutika vázlata. Sapientia Humana Osiris.
Ajánlott olvasmányok:
Shannon, C. (2001). A kommunikáció matematikai elmélete. ACM SIGMOBILE Mobile Computing and Communications Review.
Barrios, F., López, F., Argerich, L. és Wachenchauzer, R. (2016). A TextRank hasonlósági függvényének variációi az automatizált összefoglaláshoz.
Steinberger, J., & Jezek, K. (2004). A látens szemantikai elemzés alkalmazása szövegösszefoglalásban és az összefoglalások értékelésében.
Metsis, V., Androutsopoulos, I., & Paliouras, G. (2006). Spamszűrés naiv Bayes-módszerrel – Melyik naiv Bayes-módszer?
Aizawa, A. (2003). A TF-IDF-mérők információelméleti szemléletű elemzése.
Mihalcea, R., és Tarau, P. (2004). TextRank: Rendszerteremtés a szövegekben.
Gong, Y., és Liu, X. (2001). Általános szövegösszefoglalás relevancia-mérő és látens szemantikai elemzés segítségével.
Ramadhan, W.P., Novianty, S.A. és Setianingsih, S.C. (2017). Érzelemelemzés multinomiális logisztikus regresszió alkalmazásával.
Blei, D.M., Ng, A.Y. és Jordan, M.I. (2003). Latent Dirichlet Allocation. Journal of Machine Learning Research.
Interaktív foglalkozások, amelyek ösztönzik az NLP-technikák és a gépi tanulási modellek megvitatását, elemzését és gyakorlati alkalmazását. A hallgatók valós példákkal, esettanulmányokkal és tudományos cikkekkel foglalkoznak majd.
Csoportmunka:
Együttműködésen alapuló projektek, amelyek során a hallgatók csapatokban dolgoznak, és gépi tanulási módszereket alkalmaznak szöveges adatkészletek elemzésére. Ez magában foglalja Python-parancsfájlok írását, adatfeldolgozási feladatok elvégzését, valamint az eredmények bemutatását.
Gyakorlati laborfoglalkozások:
Gyakorlati programozási feladatok számítógéptermi környezetben. A hallgatók Python segítségével alkalmazzák az előadásokon elsajátított technikákat, mint például a webes adatgyűjtés, a tokenizálás, a szövegosztályozás és az összefoglalás.
A hallgatók bemutatják csoportos projektjeiket az osztály előtt, ami lehetőséget nyújt számukra a prezentációs készségek fejlesztésére, valamint arra, hogy visszajelzést kapjanak társaiktól és az oktatótól.
Tanulmányi eredményekről szóló igazolás