Az adatoktól a helyes következtetésig – mit jelent valójában érteni az adatelemzéshez?
Egy biztosítótársaság több évnyi adatból próbálja meghatározni, mekkora kockázatot jelent egy ügyfél, és ennek alapján mennyibe kerüljön a biztosítása. Egy bank azt szeretné megbecsülni, mely ügyfeleknek érdemes hitelt adnia. Egy mérnök a meghibásodási adatokból keresi egy alkatrész hibájának lehetséges okát. Egy klinikán pedig akár több ezer megfigyelés alapján vizsgálhatják, milyen tényezők állhatnak kapcsolatban egy betegség kialakulásával. Elsőre egészen különböző problémáknak tűnnek. Egy dolog azonban közös bennük: adatokból kell megalapozott következtetést levonni. Erről beszélgettünk Bálinttal, Adatelemzés és Power BI képzésünk oktatójával.
Interjú Bálinttal, Adatelemzés és Power BI képzésünk oktatójával
Bálint alkalmazott közgazdaságtant végzett a Budapesti Corvinus Egyetemen, majd alkalmazott biztosítási matematikát tanult az ELTE matematika szakán. Három évig dolgozott a KPMG-nél, jelenleg pedig a Generali Biztosítónál dolgozik Adattudósként árazási, aktuáriusi területen, ahol a statisztikai modellezés és az adatelemzés a mindennapi munkájának része.
- Mennyiben oktatsz másként, mint amikor annak idején neked tanították ezt a szakmát az egyetemen?
Az egyetemi oktatásról beszélve számos hallgatói tapasztalat alapján megfigyelhető, hogy a statisztika- és matematikaoktatás sokszor túlságosan elméletközpontú és merev tud lenni, miközben kevesebb hangsúly kerül arra, hogyan alkalmazhatók az egyes módszerek valós problémák megoldására. Ezen szeretnék változtatni. Egy adatelemző számára természetesen fontos a modellek mögötti statisztikai alapok megértése, de a gyakorlatban ennél is lényegesebb, hogy tudja, melyik módszert mikor és miért érdemes használni, milyen feltételezések mellett működik, és hogyan kell helyesen értelmezni az eredményét.
- Beszélgetésünk előtt azt mondtad félig-meddig viccesen, hogy „minél több adat van, annál könnyebb hazudni vele” Ezt hogy érted pontosan?
Ez különösen érdekes annak fényében, hogy ma szinte mindenhol azt halljuk: „az adat az új olaj”, a modern gazdaság és a vállalati döntéshozatal egyik legfontosabb erőforrása. A több adat azonban önmagában még nem jelent jobb elemzést.
Minél nagyobb adathalmazzal és minél több változóval dolgozunk, annál több statisztikai összefüggést találhatunk. Ezek között azonban lehetnek véletlenszerű, félrevezető vagy rosszul értelmezett kapcsolatok is. Megfelelő módszertani tudás nélkül könnyen felépíthető egy olyan modell, amely látszólag alátámaszt egy állítást, miközben a belőle levont következtetés torz vagy akár fals.
Ezért különösen fontos, hogy az adatelemző ne csak használni tudja a statisztikai eszközöket, hanem értse is azok működését és korlátait. A képzésben ezért már az alapoktól foglalkozunk a leíró és következtető statisztikával, a regresszióelemzéssel, valamint a korreláció és az ok-okozati kapcsolat megkülönböztetésével.
- Milyen hibákba futhat bele egy átgondolatlan adat-elemző?
Például, egy regressziós modellt technikailag ma már viszonylag könnyű elkészíteni. A valódi szakmai kérdés az, hogy helyesen építettük-e fel. Milyen változókat kell figyelembe vennünk? Kimaradt-e olyan zavaró változó, amely torzíthatja az eredményt? Megfelelő-e az adatstruktúra? Egyáltalán alkalmas-e az adott modell arra a kérdésre, amelyre választ keresünk?
Ez a probléma már az egyetemen, a szakdolgozatírás során elöjön. Előfordulhat, hogy valaki már a kutatás elején eldönti, milyen regressziós vagy más statisztikai modellel fogja megvizsgálni a hipotézisét, majd csak később, a módszertan részletesebb megismerésekor derül ki, hogy az adatai vagy a kutatási kérdése valójában más modellt igényelnének. Más módszert kívánhatnak például az időben változó adatok, ahol trenddel és szezonalitással is számolni kell; más megközelítést a több időszakon keresztül megfigyelt vállalatokat vagy országokat tartalmazó paneladatok; és megint mást egy olyan osztályozási probléma, ahol például azt szeretnénk megbecsülni, hogy egy ügyfél lemorzsolódik-e. Egy szakdolgozat esetében egy rosszul megválasztott modell sok elvesztegetett munkát és hibás következtetést eredményezhet. A vállalati gyakorlatban azonban ugyanez már üzleti döntéseket, árazást, kockázatbecslést vagy akár jelentős pénzügyi eredményeket befolyásolhat. Éppen ezért a képzés egyik fontos célja, hogy a résztvevők ne egyszerűen különböző modelleket ismerjenek meg, hanem átlássák, melyik módszer milyen problémára és adatstruktúrára alkalmas és milyen következtetéseket enged meg.
- Ki tudnál emelni egy konkrét gondolatot, vagy elvet, amire hangsúlyt fektetsz a Data Analyst képzéseden?
Az egyik kedvencem a a korreláció és az ok-okozati kapcsolat megkülönböztetése.
Két változó közötti statisztikai kapcsolat ugyanis önmagában még nem bizonyítja, hogy az egyik okozza a másikat.
Ha például egy vállalatnál azt látjuk, hogy a mobilalkalmazást gyakrabban használó ügyfelek többet vásárolnak, ebből még nem következik, hogy az alkalmazás használata növeli a költést. Lehetséges, hogy eleve az aktívabb ügyfelek használják gyakrabban az alkalmazást és vásárolnak többet – vagyis egy harmadik, zavaró változó áll a háttérben.
Érdekes ugyanakkor, hogy az oksági elemzés részletesebb módszertana az egyetemi oktatásban sokszor csak magasabb szintű, akár posztgraduális kurzusokon jelenik meg, miközben a korreláció és az okság megkülönböztetése az adatelemzői gondolkodás egyik alapvető kérdése. Éppen ezért a képzésben már a statisztikai alapoknál foglalkozunk azzal, hogyan ismerhetők fel a félrevezető összefüggések, és mikor beszélhetünk puszta együttmozgásról és mikor valódi ok-okozati kapcsolatról.
- Hogy jelenik meg az AI az adat-elemzésben?
Ma már egy generatív AI-eszköznek egyszerűen leírhatjuk az adathalmazunkat és a problémát, amire megoldást keresünk. Az AI javasolhat statisztikai modellt, megírhatja a szükséges Python-kódot, segíthet a hibakeresésben, sőt az eredmények értelmezésében is. Ez azonban újabb csapdát jelenthet. Attól, hogy az AI egy adott modellt javasol, és a hozzá generált kód hiba nélkül lefut, még nem biztos, hogy az adott modell a valós problémára szakmailag a legmegfelelőbb választás. Ehhez továbbra is szükség van arra, hogy az elemző értse az adatok szerkezetét, a releváns változókat, a modell feltételezéseit és az alkalmazott módszer korlátait. Csak ennek birtokában tudja megítélni, hogy az AI javaslata valóban helyes-e. Ezért az AI a képzésben sem az adatelemzői gondolkodás helyettesítőjeként jelenik meg, hanem annak eszközeként. Megtanuljuk használni az elemzési munkafolyamat gyorsítására, ugyanakkor azt is, hogyan ellenőrizzük kritikusan az általa javasolt módszereket és eredményeket.
Egy modell pedig nem attól jó, hogy lefut, hanem attól, hogy az adott problémára megfelelő modellt választottunk, és pontosan értjük, mit mond az eredménye.
– Kinek lehet hasznos az adatelemzés?
Számos olyan területet tudok mondani, ahol az adatelemzési tudás a gyakorlatban is jól hasznosítható.
- „Szociológusoknak például közvélemény-kutatásnál lehet nagyon hasznos az adatelemzés, ahol akár egészen meglepő összefüggéseket is találhatunk az adatok között.
- Mérnököknél egy gép vagy alkatrész meghibásodási adatait lehet elemezni: mekkora a selejt vagy a meghibásodás valószínűsége, milyen tényezők növelik ezt, illetve hol lehet a hiba kiváltó oka.
- Az egészségügyben orvosi és műszeres adatok elemzésében, vagy akár csak az ilyen elemzések megfelelő értelmezésében lehet fontos ez a tudás. Az osztályozásnak itt is rengeteg alkalmazása van: nagy mennyiségű adat alapján például különböző sejtek klasszifikációja vagy egy betegség kockázatának becslése is ilyen típusú probléma lehet.
- Pénzügyi területen szintén nagyon jól használható az osztályozás. Egy bank sok különböző adat alapján próbálja meghatározni egy ügyfél kockázatát: jó vagy rossz adós lehet-e, mekkora a nemfizetés valószínűsége, érdemes-e számára hitelt nyújtani.
- Biztosításban pedig hasonló kérdés, hogy egy adott ügyfélnél vagy kockázati profilnál milyen valószínűséggel következik be káresemény.
- Közgazdászoknak szerintem az adatelemzési tudás szinte kötelező. Az árazás például tipikusan ilyen terület: ott van a termék előállítási költsége, a versenytársak árazása, a kereslet és rengeteg más adat, amelyekből meg kell próbálni meghatározni a megfelelő árat.
- De akár kisvállalkozóknak is nagyon hasznos lehet, például piackutatáshoz vagy különböző beszerzési lehetőségek összehasonlításához. A kisebb vállalkozásoknál sokszor éppen az adat jelenti az egyik szűk keresztmetszetet: kevesebb adatuk van, vagy nem használják ki megfelelően a rendelkezésükre álló adatokat, és ezen a ponton könnyen versenyhátrányba kerülhetnek a nagyobb vállalatokkal szemben.”
Ugyanakkor, az adatelemzési tudás nem feltétlenül jelent teljes szakmaváltást. Sokak számára éppen abban rejlik az értéke, hogy a már meglévő szakmai tudásukat egészíthetik ki vele, ami akár cégen belüli előrelépéshez vagy új feladatkör betöltéséhez is komoly előnyt jelenthet.
– Ha már szóba kerültek az állások: nagyon sok álláshirdetésben látjuk elvárásként vagy előnyként a Power BI ismeretét. De a gyakorlatban mennyire használják ezt a nagyvállalatok?
Ez vállalatonként és munkakörönként jelentősen eltér. Sok nagyobb szervezetnél külön BI-szakértők vagy akár külön BI-területek foglalkoznak a riportok és dashboardok kialakításával. Különösen a középmenedzsment számára lehet fontos egy jól felépített, interaktív dashboard, ahol a legfontosabb mutatók, trendek és eredmények gyorsan áttekinthetők és szűrhetők. Más vállalatoknál ennél jóval puritánabb riportokkal dolgoznak, és akár a felső vezetéshez is csak a legegyszerűbb kimutatások jutnak el.
– Sokan azért tartanak az adatelemzéstől, mert komoly matematikai tudást feltételeznek mögötte. Valójában mennyi matematika szükséges hozzá?
Szerencsére egyáltalán nem kell matematikusnak lenni hozzá: a középiskolai, nagyjából 12. osztályos matematika megfelelő kiindulási alap. Statisztikai gondolkodásra természetesen szükség van, de a képzés célja éppen az, hogy a szükséges módszereket gyakorlati oldalról tegye érthetővé. Olyan, korábban elvontnak tűnő, 12. osztályban tanult matematikai fogalmak is értelmet nyernek, mint például a logaritmus: nem önmagában a számítás kerül előtérbe, hanem az, hogy mire és hogyan használjuk egy valódi adatelemzés során: a változások és arányok értelmezésére.
Éppen ezt a gyakorlati szemléletet szeretném átadni az Adatelemzés és Power BI képzés során.