Olyan tanulási módszer, ahol az ágensek jutalmazás és büntetés alapján tanulnak.
A megerősítéses tanulásban egy ágens különböző akciókat hajt végre egy környezetben, és jutalmakat vagy büntetéseket kap az eredmények alapján. Célja, hogy maximalizálja a hosszú távú jutalmat. Ez egy próbálgatáson alapuló tanulási folyamat.
Különösen hatékony olyan területeken, ahol a döntések sorozata vezet egy végső eredményhez.
Játékok (pl. sakk, Go), robotika, önvezető autók, portfóliókezelés.
Olyan önálló AI-rendszer, amely képes célokat követni, döntéseket hozni és végrehajtani feladatokat emberi beavatkozás nélkül.
Az AI azon területe, ahol a számítógép adatokból tanul anélkül, hogy explicit módon programoznánk minden egyes lépést.
A gradiens ereszkedés egy optimalizálási módszer, amely lépésenként javítja a modell paramétereit a hibák csökkentése érdekében.
A hyperparaméter hangolás az a folyamat, amely során megtaláljuk a modell számára legjobb beállításokat.
A mélytanulás a gépi tanulás egyik speciális ága, amely többrétegű neurális hálózatokat használ bonyolult problémák megoldására.
A modell az a matematikai és statisztikai struktúra, amelyet az AI az adatokból tanulás során hoz létre, és amit a döntéshozatalra használ.
Az emberi agy működését utánzó számítási modell, amely rétegekből és neuronokból áll.
A tanulási ráta egy hyperparaméter, amely meghatározza, mekkora lépésekben frissítse a modell a paramétereit a tanulási folyamat során.