A klaszterezés egy felügyelet nélküli tanulási technika, amely hasonló adatokat csoportokba rendez.
A cél az, hogy az adatok belső hasonlóságait kiaknázva új struktúrát fedezzen fel. Nem előre megadott kategóriák szerint dolgozik, hanem maga alakítja ki a csoportokat.
Nagyon hasznos, ha egy vállalkozás szeretné jobban megérteni ügyfeleit.
Vásárlói szokások alapján ügyfélcsoportok létrehozása marketing célokra.
Az adatelőkészítés az a folyamat, amely során a nyers adatokat megtisztítják, átalakítják és előkészítik a modell tanításához.
Az algoritmus egy szabályrendszer vagy lépéssorozat, amely meghatározza, hogyan kell egy adott problémát megoldani.
A Big Data kifejezés hatalmas, gyorsan növekvő és sokszínű adathalmazokat jelöl, amelyeket hagyományos módszerekkel nem lehet hatékonyan feldolgozni.
Az embedding olyan technika, amely a szavakat vagy más elemeket számsorozatként (vektorként) ábrázolja, hogy a gép fel tudja dolgozni őket.
Az AI azon területe, ahol a számítógép adatokból tanul anélkül, hogy explicit módon programoznánk minden egyes lépést.
A jellemzők azok a változók vagy tulajdonságok, amelyeket a modell a döntések meghozatalához használ.
A k-NN algoritmus az új adatokat azokhoz hasonlítja, amelyekhez legközelebb esnek az adathalmazban.
Az AI skálázhatósága azt jelenti, hogy a rendszer mennyire képes nagyobb adatmennyiségen vagy több felhasználóval is hatékonyan működni.