A szöveg legkisebb egysége, amelyet az AI-modell feldolgoz (lehet szó, szótag vagy karakterdarab).
A nyelvi modellek nem szavakkal dolgoznak, hanem tokenekkel. A tokenizálás a szöveg feldarabolása ezekre az egységekre. Egy válasz hossza gyakran tokenekben van mérve.
Meghatározza, hogy egy AI mennyi szöveget tud egyszerre feldolgozni.
A „vállalkozás” szót a modell két tokenre bontja: „váll” és „alkozás”.
Az embedding olyan technika, amely a szavakat vagy más elemeket számsorozatként (vektorként) ábrázolja, hogy a gép fel tudja dolgozni őket.
Az LLM olyan nyelvi modell, amely hatalmas mennyiségű szöveges adaton tanul, és képes összetett, emberihez hasonló szövegeket létrehozni.
A nyelvi modell egy AI-rendszer, amely a nyelv statisztikai mintázatait tanulja meg, hogy szövegeket értelmezzen vagy generáljon.
A prompt az a szöveg- vagy hangalapú utasítás vagy bemenet, amelyet a felhasználó ad egy nyelvi modellnek vagy AI-nak.
A prompt engineering az a technika, amikor tudatosan és strukturáltan tervezünk meg promptokat, hogy az AI a lehető legjobb választ adja.
Az NLP az AI egyik ága, amely az emberi nyelv számítógépes feldolgozásával foglalkozik.
A tokenizálás a szöveg feldarabolása kisebb egységekre, például szavakra, szótagokra vagy karakterekre.
A transformer egy neurális hálózati architektúra, amely hatékonyan dolgozza fel a szöveges adatokat.