A tokenizálás a szöveg feldarabolása kisebb egységekre, például szavakra, szótagokra vagy karakterekre.
Az AI-modellek így tudják a szöveget feldolgozható formába alakítani. A modern nyelvi modellek gyakran “subword” tokeneket használnak, hogy ritkább szavakat is kezelni tudjanak.
A természetes nyelvfeldolgozás minden feladatának első lépése.
A „Mesterséges intelligencia” kifejezést a modell például három tokenre bonthatja: „Mester”, „séges” és „intelligencia”.
Az embedding olyan technika, amely a szavakat vagy más elemeket számsorozatként (vektorként) ábrázolja, hogy a gép fel tudja dolgozni őket.
Az LLM olyan nyelvi modell, amely hatalmas mennyiségű szöveges adaton tanul, és képes összetett, emberihez hasonló szövegeket létrehozni.
A nyelvi modell egy AI-rendszer, amely a nyelv statisztikai mintázatait tanulja meg, hogy szövegeket értelmezzen vagy generáljon.
A prompt az a szöveg- vagy hangalapú utasítás vagy bemenet, amelyet a felhasználó ad egy nyelvi modellnek vagy AI-nak.
A prompt engineering az a technika, amikor tudatosan és strukturáltan tervezünk meg promptokat, hogy az AI a lehető legjobb választ adja.
Az NLP az AI egyik ága, amely az emberi nyelv számítógépes feldolgozásával foglalkozik.
A szöveg legkisebb egysége, amelyet az AI-modell feldolgoz (lehet szó, szótag vagy karakterdarab).
A transformer egy neurális hálózati architektúra, amely hatékonyan dolgozza fel a szöveges adatokat.