A gazdasági kutatásokhoz alkalmazott modern statisztikai és gépi tanulási technikákra összpontosító haladó szintű kurzus. A hallgatók olyan eszközöket alkalmaznak majd valós adatokra, mint az ARIMA, a logisztikai regresszió, a PCA, a véletlenszerű erdők és a SHAP, és elsajátítják azokat a készségeket, amelyekkel Python segítségével időfüggő és nagy dimenziójú adathalmazokat tudnak elemezni.
Ez a kurzus a statisztika alapvető ismereteire épül, beleértve olyan kulcsfontosságú fogalmakat, mint a valószínűség, az eloszlások, a mintavétel, a hipotézisvizsgálat, a varianciaanalízis és a regresszióanalízis. Olyan hallgatók számára készült, akik már rendelkeznek tapasztalattal ezen alapvető technikák gazdasági problémákra való alkalmazásában. Ezen a másodszintű kurzuson a hallgatók eljutnak a modern közgazdasági kutatásban és az adattudományban használt kortárs analitikai módszerekig, amelyek összetettebb, magas dimenziójú és időfüggő adatokra összpontosítanak.
A kurzus célja, hogy a hallgatók gyakorlati tapasztalatot szerezzenek a Python programozási nyelv használatában, miközben elmélyítik a statisztikai gondolkodásmód és a gépi tanulás iránti megértésüket. A hallgatók valós adathalmazokkal dolgoznak majd idősor-modellek (pl. ARIMA) felépítésén, logisztikus regressziót és regularizációval kiegészített általánosított lineáris modellezést (lasso, ridge) hajtanak végre, dimenziócsökkentési technikákat – például PCA-t és faktoranalízist – alkalmaznak, valamint kísérleteznek klaszterezési és felügyelt tanulási modellekkel, mint például a véletlenszerű erdők és a gradiens-erősítés.
Ahelyett, hogy elválasztanák az elméletet a gyakorlattól, az összes foglalkozás integrált formátumot követ, ahol a hallgatók a fogalmakat azonnal alkalmazhatják kódolás és csoportos elemzés révén. A cél az, hogy a hallgatók képesek legyenek önálló, megbízható és közölhető gazdasági elemzéseket készíteni, amelyek mind az akadémiai, mind az alkalmazott kutatási szabványoknak megfelelnek.
A kurzus végén a hallgató képes lesz a következőkre:
• Idősor-modellek alkalmazása és értelmezése gazdasági adatok előrejelzéséhez
• Osztályozási modellek építése és értékelése logisztikus regresszió és regularizáció segítségével
• Dimenziócsökkentés végzése PCA és faktoranalízis segítségével
• Klaszterezés és felügyelet nélküli tanulási technikák alkalmazása mintázatok felfedezésére
• Felügyelt gépi tanulási algoritmusok (pl. véletlenszerű erdő, SVM) megvalósítása és összehasonlítása
• A modell eredményeinek értelmezése és a megállapítások hatékony közlése
A hallgatóknak el kell végezniük egy bevezető statisztika kurzust, vagy rendelkezniük kell azzal egyenértékű előzetes ismeretekkel. A szükséges kompetenciák közé tartozik az alapvető statisztikai elvek (pl. átlag, variancia), a valószínűségszámítás, az eloszlások, a mintavétel és a becslés, a hipotézisvizsgálat, a varianciaanalízis (ANOVA) és a lineáris regresszió megértése. A hallgatóknak emellett magabiztosan kell tudniuk értelmezni a statisztikai eredményeket, és a valós gazdasági adatok alapján érvelni. Előzetes programozási tapasztalatot nem feltételezünk, de elengedhetetlen a Python nyelv elsajátítására és használatára irányuló hajlandóság.
Kötelező olvasmányok
• James és társai (2023). Bevezetés a statisztikai tanulásba, Python-alkalmazásokkal
• Kenett és társai (2022). Modern statisztika: számítógépes megközelítés Python nyelven
• McClave és társai (2017). Statisztika az üzleti életben és a közgazdaságtanban
Ajánlott
• Müller & Guido (2016). Bevezetés a gépi tanulásba Python nyelven
• Hyndman & Athanasopoulos (2021). Előrejelzés: elvek és gyakorlat
• Xiao (2022). Mesterséges intelligencia programozás Python nyelven
• Előadások
• Csoportos feladatok
• Záróprojekt
• Python-alapú gyakorlatok
• Heti konzultációk
Tanulmányi eredményekről szóló igazolás