A multimodális AI többféle adatforrást (szöveg, kép, hang, videó) egyszerre dolgoz fel és értelmez.
Az emberhez hasonlóan képes több érzékszervi bemenet kombinálására, így összetettebb feladatokat tud megoldani.
Nagyon közel hozza az AI-t az emberi gondolkodásmódhoz.
ChatGPT Vision, amely képeket és szövegeket is ért.
A beszédfelismerés az a folyamat, amely során az AI az emberi beszédet szöveggé alakítja.
Az embedding olyan technika, amely a szavakat vagy más elemeket számsorozatként (vektorként) ábrázolja, hogy a gép fel tudja dolgozni őket.
A gépi látás az AI azon ága, amely a vizuális adatok (képek, videók) értelmezésével foglalkozik.
Az LLM olyan nyelvi modell, amely hatalmas mennyiségű szöveges adaton tanul, és képes összetett, emberihez hasonló szövegeket létrehozni.
A Text-to-Speech (TTS) olyan technológia, amely írott szöveget emberi hanghoz hasonló beszéddé alakít.
A szöveg-kép átalakítás egy olyan AI-technológia, amely szöveges leírás alapján képes létrehozni képeket.
Az NLP az AI egyik ága, amely az emberi nyelv számítógépes feldolgozásával foglalkozik.
A transformer egy neurális hálózati architektúra, amely hatékonyan dolgozza fel a szöveges adatokat.