PULI: a magyar nyelvi modell, ami nem akar ChatGPT lenni

KakasTech AI asszisztens elemzése
  • A HUN-REN Nyelvtudományi Kutatóközpont 2024 augusztusában elindította a PULI LlumiX modellt, egy 7 milliárd paraméteres, Llama‑2 alapú magyar nyelvi rendszert, amely 50 milliárd magyar szóból tanult.
  • A modell 66,98 % HuCOLA, 70,06 % HuSST és 74,54 % HuRTE pontosságot ért el zero‑shot teszteken, így javítja a magyar ügyfélszolgálatok hitelességét és csökkenti a külföldi AI‑függőséget.
  • 2024‑től 2027‑ig a HUN‑REN Cloud nyílt hozzáférést ad a PULI‑modellekhez, miközben a kutatóközpont a 16‑17. századi magyar szövegekből új modellt épít, erősítve a digitális szuverenitást.

Rendszer fókusz: Telepítsd a PULI LlumiX‑et a saját vagy a HUN‑REN Cloud‑on futó infrastruktúrára, és kötelezd el a magyar nyelvű ügyfél‑ és belső kommunikáció kizárólag ezen modell feldolgozását, hogy megakadályozd az adatok külföldi AI‑szolgáltatókhoz való továbbítását.

Ez a cikk több nemzetközi forrás alapján, mesterséges intelligencia közreműködésével készült szerkesztett összefoglaló, amely nem azonos egyetlen konkrét forrás tartalmával sem. A szöveg csak szerkesztői átolvasás után jelenik meg, ennek ellenére tartalmazhat pontatlanságokat; a felhasznált források lentebb olvashatók.

Említett modellek
Kép forrása: Saját AI generált kép

Amikor magyar felhasználóként beírsz valamit a ChatGPT-be vagy a Geminibe, egy olyan rendszerrel beszélsz, amely a magyart lényegében „melléktermékként” tanulta meg. A nagy nemzetközi modellek tanítóanyagának elsöprő része angol, a magyar pedig egy kicsi, sajátos szeletet foglal el benne – ezért fordul elő, hogy a válasz nyelvtanilag hibátlan, mégis furcsán cseng, rossz szinonimát használ, vagy egyszerűen nem ismeri a specifikusan magyar tartalmakat.

PULI: nem rivális, hanem kutatási infrastruktúra

Erre a problémára ad választ a PULI, a HUN-REN Nyelvtudományi Kutatóközpont magyar nyelvi modellcsaládja. Fontos rögtön az elején tisztázni, mi a PULI, és mi nem. Nem a ChatGPT magyar riválisa, és nem is annak szánták. A projekt elsődleges célja kutatási: a kutatóközpont vezetője, Prószéky Gábor Széchenyi-díjas számítógépes nyelvész megfogalmazása szerint azért indították a programot, hogy megértsék, miért és hogyan működnek ezek a rendszerek – vagyis hogy belássanak a „fekete dobozba”.

Ehhez pedig hatalmas előnyt jelent, ha az ember maga építi a modellt, nem csak használ egy készet. A PULI ebben az értelemben tudományos infrastruktúra, nem fogyasztói termék.

50 milliárd magyar szó ereje

A modellcsalád ereje a magyar nyelvi anyagban rejlik. A PULI mögött egy nagyjából 50 milliárd magyar szavas szövegkorpusz áll, és a fejlesztők szerint éppen ezért modellezi finomabban a magyar nyelvet, mint a nagy nemzetközi társai – jobban kezeli a specifikusan magyar tartalmakat, és stilisztikailag helyesebb szövegeket generál.

Ez nem elvont előny: egy ügyfélszolgálati rendszernél például kifejezetten számít, hogy a válasz természetes magyarsággal szólaljon meg, mert a felhasználó azonnal észreveszi a furcsa mondatokat és a rossz szóválasztásokat.

A fejlődés útja: a szövegfolytatástól a LlumiX-ig

A PULI nem egyetlen modell, hanem több, különböző célra épített rendszer:

  • Korai változatok: A régebbi nyelvi modellek logikáját követték, megadott szöveget folytattak, nem interaktív válaszadásra készültek.
  • ParancsPULI: Utasításkövető modell, amely már a ChatGPT-szerű működés irányába mozdult el.
  • PULI LlumiX: A jelenlegi csúcs. Egy magyar nyelvre optimalizált, folytatólagosan előtanított és utasításkövetésre finomhangolt rendszer, amely a Llama-2 architektúrára épül. A finomhangolásához 66 ezer angol és 15 ezer magyar promptot használtak.

A modelleket bárki kipróbálhatja a kutatóközpont demóoldalán.

Benchmarkok: magyar nyelvi fölény

Az eredmények a magyar nyelvű teszteken meggyőzőek. A PULI LlumiX felülmúlta a korábbi magyar nyelvű modelleket, például a PULI Triót és a HILANCO-GPTX-et.

HuCOLA nyelvhelyesség: 66,98%HuSST érzelem- és hangulatfejtés: 70,06%HuRTE szöveges következtetés: 74,54%. Mindezt zero-shot, azaz előzetes célzott tanítás nélkül érte el, kizárólag általános nyelvi tudására támaszkodva.

A kutatók külön vizsgálták a hosszú szövegkörnyezetben nyújtott teljesítményt is egy „tű a szénakazalban” típusú teszttel, amely azt méri, képes-e a modell nagy szövegmennyiségből előhalászni a releváns információt.

Osztálytermi méret, globális adatközpontok ellen

Van azonban egy korlát, amelyet őszintén ki kell mondani: a méret. A PULI jelenleg 7 milliárd paraméteres modell – összehasonlításképp a nagy nemzetközi rendszerek ennek százszorosát is meghaladják. A háttérben egy egyszerű, nyers ok áll: a Nyelvtudományi Kutatóközpontnak van szuperszámítógépe, de az a világcégek gépparkjához mérve kis teljesítményű. Ezért téves elvárás, hogy a PULI mindenben lekörözze a ChatGPT-t; a helyes olvasat az, hogy egy szűk, jól körülhatárolt területen – a magyar nyelv finom kezelésében – tud olyat, amit a nagy modellek nem feltétlenül.

A laborból a felhőbe – és vissza a 16. századba

A projekt a kutatáson túl a gyakorlat felé is elmozdult. A HUN-REN Cloud 2024 augusztusától egy 2027-ig futó szolgáltatást üzemeltet a PULI-modellek alapján, ami azt jelenti, hogy a rendszer nem maradt a laborban, hanem hozzáférhető infrastruktúrává vált a hazai kutatói és intézményi közösség számára.

Emellett folynak a bővítési tervek is: a kutatóközpont a történeti magyar nyelvre is szeretne modellt építeni. Prószéky Gábor szerint önmagában nincs elég régi szöveg ahhoz, hogy abból építsenek rendszert, de mivel a PULI-t már megtanították a mai magyarra, megvan a technológia, hogy a 16–17. századi levelezésekből, jogi és egyéb dokumentumokból továbbtanítsák – így elvben egyszer akár a régi kor emberének nyelvén is megszólalhat.

A digitális szuverenitás záloga

A tágabb tanulság túlmutat egyetlen modellen. A KakasTech is írt már róla, hogy a Magyar Telekom vezetése szerint Európa gyakorlatilag „adatkolóniává vált”, és hogy a hazai vállalkozásoknak érdemes helyi nyelvi modellek felé mozdulniuk a teljes külföldi függőség helyett. A PULI pontosan ennek a gondolatnak a tudományos oldala: egy olyan rendszer, amelyet hazai erőforrásból, hazai szövegekkel, hazai igényekre fejlesztenek. Nem egy globális cég fejlesztési stratégiájának van kiszolgáltatva, és garanciát ad arra, hogy magyar kutatók mélységében értsék a mesterséges intelligencia működését.

„Nem ez fogja megnyerni a nemzetközi modellversenyt – de nem is az a dolga. Az a dolga, hogy legyen saját, értett és ellenőrizhető technológiánk a saját nyelvünkre. Ez pedig hosszú távon többet érhet, mint egy ranglistás helyezés.”

Kövesd a témát

Értesítést kapsz a profilodban és a heti hírlevélben, ha új cikkünk jelenik meg a követett témáidban.

Cégek
Témák

Tetszett a cikk?

Oszd meg

Gyakori kérdések az AI hírekről

Hol olvashatóak a legfrissebb AI hírek magyarul?

A KakasTech AI Hírek rovata naponta frissül: a mesterséges intelligencia legújabb fejlesztései, modell-bejelentések és iparági elemzések magyar nyelven, ellenőrzött nemzetközi források alapján olvashatóak nálunk.

Milyen témákat fednek le a KakasTech AI hírei?

A nagy AI-laborok (OpenAI, Anthropic, Google DeepMind) bejelentéseitől a chipeken és a robotikán át a hazai és nemzetközi szabályozásokig minden lényeges területet követünk.

Hogyan értesülhetek azonnal a legújabb AI változásokról?

Feliratkozhatsz a heti összefoglaló hírlevelünkre a lap alján, vagy követheted az AI API-árkalkulátorunkat és az AI-modell összehasonlító oldalunkat a legfrissebb technikai adatokért.

Hozzászólások 0

A hozzászóláshoz kérjük, jelentkezz be.

Még nincsenek hozzászólások. Írd meg te az elsőt!