This is the Trace Id: 0bea6c07b9911275e258214b46ad228b
Ugrás a tartalomtörzsre Felfedezés Az összes termék megtekintése (200+) Microsoft Foundry Azure Copilot GitHub Copilot Azure Kubernetes Service (AKS) Azure Cosmos DB Azure Database for PostgreSQL Azure Arc Microsoft Fabric Linux Virtual Machines az Azure-ban Foundry Models Foundry Agent Service Foundry IQ Foundry Tools Foundry Control Plane Observability a Foundry Control Plane felületén Azure OpenAI in Foundry Models Azure Beszéd a Foundry Toolsban Azure Machine Learning Az összes adatbázis megtekintése Azure Cosmos DB Azure DocumentDB Azure SQL Azure Database for PostgreSQL Azure által felügyelt Redis Microsoft Fabric Azure Databricks Linux Virtual Machines az Azure-ban Windows Server az Azure-on Azure Functions Azure Virtual Machine Scale Sets Azure API Management Azure Container Apps Azure Kubernetes Service (AKS) Azure Kubernetes Fleet Manager Azure Container Registry Azure Red Hat OpenShift Azure Container Instances Azure tároló tárhely Azure Arc Azure Local Felhőhöz készült Microsoft Defender Azure Monitor Microsoft Sentinel Azure Migrate Az összes megoldás megtekintése (40+) Felhőmegoldások kis- és középvállalatoknak Felhőmigrálási és modernizációs központ Adatelemzés mesterséges intelligenciához Azure-adatbázisok AI-alkalmazások és ‑ügynökök Microsoft Marketplace Microsoft Sovereign Cloud AI-alkalmazások és ‑ügynökök Felelősen alkalmazott AI az Azure-ral AI-infrastruktúra Adatelemzés mesterséges intelligenciához Gépi tanulási műveletek (MLOps) Kevés kódolást igénylő alkalmazásfejlesztés az Azure-ban Integrációs szolgáltatások Kiszolgáló nélküli számítástechnika DevOps Áttelepítési és korszerűsítési központ .NET-alkalmazások áttelepítése Adatbázisok az Azure-ban Azure-beli Linux Azure-beli Oracle SAP a Microsoft felhőben Adaptív felhő Nagy teljesítményű feldolgozás (HPC) Szolgáltatott infrastruktúra (IaaS) Rugalmasság Azure Essentials Frontier Accelerate Azure-hez Azure-beli FinOps Microsoft Marketplace Azure-díjszabás áttekintése Azure-fiók létrehozása Ingyenes Azure-szolgáltatások Rugalmas vásárlási lehetőségek Díjszabási kalkulátor Azure-beli FinOps A mesterséges intelligenciából származó ROI maximalizálása Megtakarítási Azure-csomagok Azure-foglalások Azure Hybrid Benefit Virtual Machines Azure SQL Microsoft Foundry Microsoft Fabric Azure Kubernetes Service (AKS) Felhőhöz készült Microsoft Defender További információ Szoftverfejlesztő vállalatok Microsoft Marketplace Partner keresése Források Azure-partnereknek Az Azure használatának első lépései Ügyfeleink sikertörténetei Elemzői jelentések, tanulmányok, e-könyvek Videók További információ a felhőalapú számításról Dokumentáció Az Azure Portal felfedezése Fejlesztői források Gyorssablonok Források startupok számára Fejlesztői közösség Diákok Azure partnereknek Blog Események és webináriumok Képzés Támogatás Kapcsolatfelvétel az értékesítéssel Az Azure használatának első lépései Bejelentkezés

Mi az a megerősítő tanulás?

Fedezze fel, mi a megerősítő tanulás, és hogyan segíti az AI-rendszereket az alkalmazkodásban és a fejlődésben az idő múlásával.

A megerősítő tanulás áttekintése

A megerősítő tanulás olyan gépi tanulási módszer, amely során a rendszerek a környezetük használatával tanulnak, visszajelzést kapnak, és módosítják a viselkedést, hogy idővel javíthassák a döntéshozatalt.

Legfontosabb tanulságok

  • A megerősítő tanulás próbálkozáson és hibákon keresztül tanítja be a modelleket, és jutalmakat használ a viselkedés időbeli alakításához.
  • Jól használható olyan feladatoknál, amelyek döntések sorozatát foglalják magukban, például a robotikában, a játékokban vagy a személyre szabásban.
  • Az emberi visszajelzésekre épülő (RLHF) megerősítő tanulása javítja a modell illesztését azáltal, hogy nem kizárólag automatizált jeleket, hanem emberi visszajelzéseket is felhasznál.
  • Az RLHF segít a rendszereknek olyan válaszokat létrehozni, amelyek jobban tükrözik az emberi célokat, értékeket vagy preferenciákat.
  • Mindkét megközelítés folyamatosan fejlődik, ahogy a gépi tanulás egyre nagyobb szerepet játszik az AI által támogatott eszközökben és rendszerekben.

A megerősítő tanulás fogalommeghatározása

A megerősítő tanulás egy olyan gépi tanulási megközelítés, amelyben a rendszerek tapasztalat útján tanulnak. Egy ügynök interakcióba lép a környezetével, műveleteket hajt végre, jutalmak vagy büntetések formájában visszajelzést kap, majd a teljesítmény javítása érdekében módosítja a jövőbeli viselkedését. Idővel az ügynök megtanulja, mely döntések vezetnek jobb eredményekhez, ezért ez a módszer különösen hasznos dinamikus vagy egymást követő feladatoknál, amikor az optimális megoldás előre nem ismert. Számos területen használják, a robotikától és a játékoktól kezdve az ajánlórendszereken át a tartalommoderálásig.

A megerősítő tanulás alapjai

Mi a megerősítő tanulás, és hogyan hat az AI-rendszerekre?

A gépi tanulás lehetővé teszi, hogy a számítógépek az idő múlásával, kifejezett programozás nélkül tanuljanak mintázatokat az információkból. Az e-mailek szűrésétől a csalások észlelésén át a mesterséges intelligenciával támogatott fordításig mindent működtet. Ezen a tág területen belül a megerősítő tanulás egy olyan speciális megközelítés, amely tapasztalat útján tanítja meg a rendszereket döntéseket hozni.

Egy másfajta tanulási ciklus

A felügyelt tanulással ellentétben, amely címkézett adatokat használ, a megerősítő tanulás próba-szerencse alapon működik. Egy rendszer — úgynevezett ügynök — interakcióba lép a környezetével, műveleteket hajt végre, és jutalmakat vagy büntetéseket kap. Idővel megtanulja, mely műveletek vezetnek jobb eredményekhez.

A visszacsatolási hurok így működik:
  • Az ügynök végrehajt egy műveletet.
  • A környezet válaszol.
  • Az ügynök jutalmatkap, vagy büntetést.
  • Az ügynök ezen visszajelzés alapján módosítja a stratégiáját .
Ez a felállás különösen hasznos, amikor a helyes válasz előre nem ismert, de a siker az eredmények alapján mérhető. Azt a módot tükrözi, ahogyan az emberek tanulnak: próbálkoznak, megfigyelik az eredményt, majd ehhez igazítják a következő lépést.

Hogyan segíti a megerősítő tanulás az intelligensebb rendszereket
A megerősítő tanulás ideális olyan rendszerekhez, amelyeknek döntések sorozatát kell meghozniuk, és minden művelet hatással van a következőre. Gyakran használják dinamikus környezetekben, ahol egy modell újbóli betanítása a nulláról nem praktikus.

Gyakori alkalmazások:
 
  • Robotika: robotok tanítása járásra, tárgyak megragadására vagy navigálásra
  • Játékok: versenyképes stratégiák kidolgozása
  • Ipari automatizálás: vezérlőrendszerek finomhangolása és adaptálása
  • Tartalomajánlások: beállítás a felhasználói viselkedés alapján
  • Erőforrás-optimalizálás: a hatékonyság javítása például az adatközpontok működtetésében

Mindezekben a megerősítő tanulás segít a rendszereknek tapasztalatból fejlődni — nem csupán adatokból.

Egy lépés előre: emberi visszajelzésen alapuló megerősítő tanulás

A hagyományos megerősítő tanulás mérnökök által meghatározott jutalmakat használ. De vannak olyan célok — például egy világos magyarázat megírása vagy a társadalmi normákkal való összhang —, amelyeket nehéz számszerűsíteni. Itt jön képbe az emberi visszajelzésen alapuló megerősítő tanulás (RLHF).

Mi az RLHF? Az RLHF-ben az emberi értékelők értékelések, preferenciák vagy összehasonlítások formájában adnak visszajelzést. Ez a visszajelzés segít a modelleket olyan eredmények felé terelni, amelyek jobban tükrözik az emberi értékeket és elvárásokat.

Az RLHF különösen fontossá vált a nagy nyelvi modellek (LLM-ek) és a generatív rendszerek tanításában. Segít biztosítani, hogy az eredmények ne csak működőképesek legyenek, hanem hasznosak, megfelelőek és összhangban álljanak a felhasználói szándékkal.

Az erősségek és kompromisszumok megértése

A megerősítő tanulás és az RLHF valódi előnyöket kínál, különösen összetett vagy kiszámíthatatlan környezetekben. De új kihívásokat is hoznak. Mindkettőnek az alapos megértése segít a csapatoknak kiválasztani a megfelelő eszközt az adott feladathoz.

Előnyök
  • Alkalmazkodik kiszámíthatatlan környezetekben
    Sok valós rendszer — robotok, játékok, logisztika — változó körülmények között működik. A megerősítő tanulás segít ezeknek a rendszereknek idővel alkalmazkodni és fejlődni.
  • Biztonságosabb, jobban szabályozható rendszerek
    Az olyan biztonságkritikus területeken, mint a gyártás vagy az önvezető járművek, a megerősítő tanulás lehetővé teszi a fokozatos finomhangolást. Ha emberi visszajelzéssel párosítják, biztonságosabb, stabilabb viselkedést segíthet elő.
  • Összhangban van az emberi célokkal
    Az RLHF arra tanítja a modelleket, hogy azt helyezzék előtérbe, amit az emberek értékesnek tartanak — ne csak azt, amit könnyű mérni. Ez kifejezőbb eredményeket eredményez olyan területeken, mint a tartalommoderálás, a csevegőrobot-beszélgetések és a javaslati motorok.
Kihívások
  • Az emberi visszajelzés nem skálázható könnyen
    A strukturált emberi visszajelzések gyűjtése időigényes. Ahogy a modellek és a feladatok egyre összetettebbé válnak, ezt egyre nehezebb kezelni.
  • Magas költség és összetettség
    Az RLHF további lépéseket ad hozzá a betanítási folyamathoz. A csapatoknak be kell tanítaniuk egy alapmodellt, majd azt finomhangolniuk kell az emberi adatokkal, ami nagyobb számítást, koordinációt és kiértékelést igényel.
  • Nehéz stabilizálni és reprodukálni
    Mivel a megerősítő tanulás az adott környezetétől függ, az apró változtatások kiszámíthatatlan eredményeket hozhatnak. Az állandó teljesítményhez tesztelésre, finomhangolásra és gondos tervezésre van szükség.
Használati esetek

Valós alkalmazások

A megerősítő tanulást és az RLHF-et már használják olyan rendszerekben, amelyek finoman alkalmazkodnak, személyre szabnak vagy reagálnak.

Társalgási AI

A nagy nyelvi modellek — és egyre inkább a kis nyelvi modellek (SLM-ek) — RLHF-et használnak a válaszaik finomítására a felhasználók számára. Az emberi felülvizsgálók segítenek a hangnem alakításában, a torzítás csökkentésében, és segítenek a modelleknek a hasznos és releváns válaszok felé irányítani.

Robotika

A robotok gyakran kiszámíthatatlan körülmények között működnek — gyártócsarnokokban, otthonokban vagy földeken. A megerősítő tanulás segít nekik a műveletek eredmények alapján történő módosításában, például abban, hogy megtanuljanak szabálytalan alakú tárgyakat felvenni, vagy egyenetlen terepen járni.

Tartalomjavaslat és személyre szabás

Ezek a rendszerek a felhasználói viselkedés alapján fejlődnek. A megerősítő tanulás lehetővé teszi, hogy a tartalomcsatornák, a streamelési platformok és a tanulási alkalmazások idővel alkalmazkodjanak a relevancia javításához. Az emberi bevitel segíthet abban is, hogy a javaslatokat a változatos vagy jó minőségű tartalmak felé irányítsuk.

Tartalommoderálás

Azokban a területeken, ahol a közösségi szabványok vagy a közösségi környezet számít, az RLHF segít a rendszereknek jobb döntéseket hozni. Az emberi értékelések és a visszajelzések segítenek a modelleknek megtanulni, hogy mi a megfelelő, még akkor is, ha az nem egyértelmű.

Játék

A játékokat gyakran használják tanulási környezetként, mert strukturált szabályokat és mérhető célokat kínálnak. A megerősítő tanulás segít az ügynököknek új stratégiákat kifejleszteni ismételt játék és iteráció révén, gyakran szimulációk keretében, mielőtt azokat a valós világban alkalmaznák.

Pénzügyi modellezés és kereskedés

Az adaptív modellek a megerősítő tanulást használják piaci stratégiák feltárására, portfóliók kezelésére vagy kockázati forgatókönyvek tesztelésére. Ezek a rendszerek szintetikus környezetekből és történeti adatokból tanulnak, idővel fejlődnek, miközben a valós világbeli mutatókhoz maradnak igazítva.

Felkészülés a következő lépésekre az AI-ban:

A gépi tanulás számos mai AI-áttörés alapját adja. A számítógépes látástechnológiától a nyelvi modelleken át a robotikán át a modern innovációt az adatokból való tanulás vezérli. A megerősítő tanulás – és különösen az RLHF – egyre nagyobb szerepet játszik az interakcióból tanuló rendszerekben, nem csak az utasításokban.

A felhasználói élményre épülő intelligensebb rendszerek
A megerősítő tanulási modellek tapasztalaton keresztül fejlődnek, így jobban illeszkednek a bizonytalan vagy szekvenciális feladatokhoz. Ahelyett, hogy rögzített adatokból tanulnának, valós időben alkalmazkodnak, így több lépéssel javítják az eredményeket.

Mivel ezeket a rendszereket szélesebb területeken alkalmazzák – beleértve a szöveget, képeket, hanganyagokat és videókat egyesítő többmodelles AI-t –, az emberi visszajelzések alapvető réteget jelentenek. Segít a nem könnyen mérhető döntések meghozatalában – például hogy egy csevegőrobot megfelelő választ adott-e, vagy egy javaslat valóban hasznos volt-e.

Az RLHF következő fázisa
Ahogy egyre több szervezet vezet be mesterséges intelligenciával támogatott eszközöket, az RLHF egyre inkább központi szerepet játszik a felelős fejlesztésben – különösen a természetes nyelvi feldolgozási (NLP-) alkalmazásokban , ahol a hang, a kontextus és a relevancia számít. De nehéz skálázni. A hasznos emberi visszajelzések gyűjtése költséges és időigényes.

Ennek megoldásához a kutatók a következőt vizsgálják:
  • Hatékonyabb visszacsatolási hurkok, beleértve az emberi válaszokat utánzó szintetikus visszajelzést is.
  • Jobb kiértékelési eszközök annak mérésére, hogy a modellek mennyire igazodnak a célokhoz vagy értékekhez.
  • Átívelő alkalmazások, amelyek a megerősítő tanulást más gépi tanulási formákkal kombinálják a rugalmasabb rendszerek érdekében.
Egyre nagyobb az érdeklődés az RLHF használata iránt az átláthatóság és az elszámoltathatóság növelése érdekében. A kívánt viselkedés emberi bevitellel való befolyásolásával a csapatok jobban szabályozhatják az AI-rendszerek fejlődését.

Egy változó terület
A megerősítő tanulás és az RLHF nem minden helyzetben használható megoldások. Azonban hatékonyak, ha a megfelelő problémára használják őket. Ahogy az AI-rendszerek egyre hatékonyabbak lesznek – egyre fontosabbá válnak olyan területeken, mint a kognitív AI, amelynek célja az emberi érvelés utánzása –, az adaptációt, felügyeletet és igazítást támogató módszerek igényei csak növekedni fognak.

Az üzleti vezetőknek és a fejlesztőknek egyaránt hasznára válik, ha megértik, hogyan működnek ezek a technikák, mert így megalapozottabb, átgondoltabb AI-alkalmazásokat hozhatnak létre. A megerősítő tanulás nem mindig a válasz – de ha megfelel a problémának, új módszereket nyit meg olyan rendszerek létrehozására, amelyek a való világban tanulnak.
Erőforrások

További információ az Azure-ról

Egy férfi mosolyogva néz egy fényképezőgépbe.
Azure-erőforrások

Az Azure-erőforrásközpont bemutatása

Ismerje meg a videókat, elemzői jelentéseket, képzéseket, esettanulmányokat, kódmintákat és megoldásarchitektúrákat.
Képzési és minősítési lehetőségek

Ismerkedés az Azure képzési tervekkel

Fejlessze a felhővel kapcsolatos készségeket a hatás növelése érdekében – a személyes növekedéstől az erősebb üzleti eredményekig.
Két személy mosolyogva néz egy lapot.
Események és webináriumok

Fedezze fel a közelgő eseményeket és képzéseket

Fedezze fel az új innovációkat, fejlessze készségeit, és kapcsolódjon a közösséghez — online vagy személyesen.
GYIK

 Gyakori kérdések

  • Az AI-rendszerek általában három módszer egyikével tanulnak:

    Felügyelt tanulás:
    Címkézett adatokból tanul. Olyan feladatokhoz használják, mint a tárgyfelismerés vagy a fordítás.

    Felügyelet nélküli tanulás:
    Címkézett eredmények nélkül talál mintákat. Fürtözésre vagy anomáliadetektálásra használják.

    Megerősítő tanulás:
    Interakció és visszajelzés révén tanul. Szekvenciális döntéshozatalra használják.
  • A megerősítő tanulás segít a modelleknek a próbálgatásokon keresztül döntéseket hozni. Olyan rendszerek betanítására tervezték, amelyek úgy tanulnak, hogy interakcióba lépnek a környezetükkel, és idővel a jutalmak vagy büntetések alapján módosítják a viselkedésüket. Ez olyan feladatok esetében hasznos, ahol az eredmények több művelettől függenek, nem pedig egyetlen előrejelzéstől.
  • Az emberi visszajelzéseken alapuló (RLHF) megerősítő tanulás olyan módszer, amely emberi bevitellel javítja a modell viselkedését. Az RLHF egy olyan módszer, amellyel a modelleket emberek preferenciái, értékelései vagy összehasonlításai alapján tanítják, ahelyett hogy kizárólag automatizált jutalmakra támaszkodnának. Ez segít a rendszereknek olyan eredmények elérésében, amelyek jobban megfelelnek az emberi céloknak vagy értékeknek – különösen olyan területeken, mint a beszélgetés, a tartalomgenerálás vagy a moderálás.
  • A megerősítő tanulás a döntéshozatalra összpontosít. Megtanít egy modellt arra, hogy műveleteket hajtson végre egy környezetben, és a visszajelzésből tanuljon. Egyes rendszerekben a mély tanulást a megerősítő tanulásban használják, hogy segítsenek a modellnek összetett bemenetek, például képek vagy szöveg feldolgozásában. A mély tanulás réteges neurális hálózatokat használ, hogy nagy mennyiségű adatból tanuljon, és gyakran alkalmazzák olyan feladatokhoz, mint a képfelismerés, a beszédfeldolgozás vagy a szöveggenerálás.
  • A kereséssel kiegészített generálás (RAG) és az emberi visszajelzésen alapuló megerősítéses tanulás (RLHF) két különböző módszer az AI által generált válaszok javítására. Az RAG segít a modellnek külső információkhoz – például dokumentumokhoz vagy adatbázisokhoz – hozzáférni, miközben kimenetet hoz létre, így a válaszok pontosabbak és naprakészek. Az RLHF emberi preferenciákra vagy visszajelzésekre való betanításával javítja a modell viselkedését, és segít a felhasználói szándéknak megfelelőbb, hasznosabb válaszokat előállítani. Az RAG támogatja a ténybeli pontosságát; Az RLHF támogatja a minőséget és az igazítást.
Magyar (Magyarország) Fogyasztói állapot adatainak védelme Kapcsolatfelvétel a Microsofttal Adatvédelem Cookie-k kezelése Használati feltételek Védjegyek A hirdetéseinkről EU Compliance DoCs