Az adatelőkészítés az a folyamat, amely során a nyers adatokat megtisztítják, átalakítják és előkészítik a modell tanításához.
Ide tartozik a hiányzó adatok kezelése, az értékek normalizálása vagy a szöveges adatok számokká alakítása. Ez a lépés elengedhetetlen, mert a rosszul előkészített adatok hibás eredményekhez vezethetnek.
Az AI projektek sikerének egyik kulcsa – gyakran az idő nagy részét ez a munka teszi ki.
Egy webshop adatainál a vásárlói életkor egységesítése (pl. „25 év” és „25” egységesítése).
Az adat minden olyan információ, amit az AI rendszerek feldolgoznak, és amiből tanulnak.
Az adatok címkézése, hogy a modell tanulni tudjon belőlük.
A jellemzők azok a változók vagy tulajdonságok, amelyeket a modell a döntések meghozatalához használ.
A keresztvalidáció egy technika, amely az adatok több részre osztásával méri a modell teljesítményét.
A tanítókészlet az a konkrét adathalmaz, amelyet az AI-modell betanítására használnak.
A tesztkészlet egy külön adathalmaz, amellyel a betanított AI-modell teljesítményét mérik.
A tokenizálás a szöveg feldarabolása kisebb egységekre, például szavakra, szótagokra vagy karakterekre.
A validációs készlet olyan adathalmaz, amelyet a modell finomhangolására, az optimális paraméterek kiválasztására használnak.