Több adat legyőzi a nagyobb modellt – itt a Xiaomi-Robotics-1

KakasTech AI asszisztens elemzése
  • 2024. július 16-án a Xiaomi bemutatta a Xiaomi‑Robotics‑1 robotot, amely 100 000 óra kézi mozgásadatból tanult VLA modellt.
  • A modell 57,6 % sikerarányt ért el RoboCasa365‑ben és 20,07 pontot RoboDojo‑n, ami 10‑15 % javulást jelent a korábbi 46,6 % és 13,07 ponthoz képest.
  • A nagy mennyiségű, UMI‑eszközökkel gyűjtött adat várhatóan felgyorsítja a robotikai fejlesztéseket, és a skálázási törvény alkalmazását más fizikai AI‑ra is inspirálhatja.

Rendszer fókusz: Ellenőrizze, hogy a 100 000 órás mozgásadatot aláírt, hash‑ellenőrzött csomagokban tárolják, és a UMI‑eszközök firmware‑jét rendszeresen frissítik, hogy megakadályozzák az adat‑manipulációt és a modell‑poisoninget.

Ez a cikk több nemzetközi forrás alapján, mesterséges intelligencia közreműködésével készült szerkesztett összefoglaló, amely nem azonos egyetlen konkrét forrás tartalmával sem. A szöveg csak szerkesztői átolvasás után jelenik meg, ennek ellenére tartalmazhat pontatlanságokat; a felhasznált források lentebb olvashatók.

Kép forrása: Saját AI generált kép

A robotika évek óta ugyanabba a falba ütközik: a mesterséges intelligencia a nyelv és a kép területén azért fejlődött robbanásszerűen, mert egyre több adaton, egyre nagyobb modellekkel és egyre több számítási kapacitással tanult. A robotoknál viszont pont ez a nyersanyag – a nagy mennyiségű, jó minőségű mozgásadat – hiányzott.

A Xiaomi új alapmodellje, a Xiaomi-Robotics-1 éppen erre a problémára ad választ.

„A robotoknál nem feltétlenül a nagyobb modell nyer, hanem a több adat.”

A skálázási törvény kiterjesztése a fizikai AI-ra

A július 16-án bemutatott modell lényege, hogy ugyanazt a skálázási mintát követi, amelyet a nagy nyelvi modelleknél (LLM) már megismertünk: a teljesítménye kiszámíthatóan javul, ahogy több adaton és nagyobb mérettel tanul. A Xiaomi szerint ez Kínában az első szisztematikus bizonyítéka annak, hogy a robotok irányítási modeljeire (robot policy models) is érvényes a skálázási törvény.

A rendszer egy úgynevezett Vision-Language-Action (VLA) modell, vagyis egyszerre dolgozza fel:

  • a vizuális látványt,
  • a természetes nyelvi utasítást,
  • valamint a közvetlen cselekvést és mozgásvezérlést.

Ennek köszönhetően a robot nyelvi parancsokat követve képes ismeretlen környezetben is elvégezni különféle mobil manipulációs feladatokat – ráadásul „dobozból kivéve”, külön helyszíni betanítás nélkül.

Az adatáttörés: Kézi fogóeszközök a fizikai robotok helyett

A valódi trükk az adatgyűjtés módszertanában rejlik. A nyelvi modellek a nyilvános internet hatalmas szövegkészletén taníthatók, a hasznos robotmozgás-adat viszont rendkívül szűkös. A hagyományos módszer az, hogy emberek távirányítással vezetnek végig egy fizikai robotot minden egyes mozdulaton – ez azonban lassú, drága, és jellemzően ismétlődő adatot termel ugyanabból a feladatból.

A 100 000 órányi valós adat nagy részét nem drága robotokkal, hanem kamerával felszerelt, kézi fogóeszközökkel (úgynevezett UMI-eszközökkel) gyűjtötte össze, közvetlenül az emberi kezek mozgásából.

Így a fizikai robotflották korlátai nélkül lehetett óriási léptékű mozgásadathoz jutni.

Kétfázisú betanítás és rekordmérések

A tanítás – akárcsak a nyelvi modelleknél – két fő szakaszból áll:

  • Előtanítás: A modell széles, általánosítható cselekvésgeneráló képességet szerez a 100 000 órányi emberi mozgásadatból.
  • Utótanítás: Ez a fázis igazítja a megszerzett tudást a valódi robottestek kinematics-jellegzetességeihez és a nyelvi utasítások pontos követéséhez.

A Xiaomi mérései szerint az előtanítás során a teljesítmény tisztán és kiszámíthatóan javult az adat és a modellméret növelésével, és ami döntő: ez a javulás átvitellel megjelent a valós idejű, fizikai tesztekben is.

Teljesítmény-összehasonlítás

A RoboCasa365 sikerarányában a korábbi 46,6%-os csúcsértéket 57,6%-ra tornázta fel a modell, miközben a RoboDojo átlagpontszámát is 13,07-ről 20,07-re javította. Az új feladatok gyorsillesztésénél – ahol korábban a Physical Intelligence ért el körülbelül 40,0%-ot – a Xiaomi-Robotics-1 kevesebb mint 10 órányi adattal 75,0%-os sikerarányt produkált.

A gyakorlati tesztek során a modellt négy teljesen új feladaton próbálták ki (telefon becsomagolása, mosás betöltése, papír adagolása a nyomtatóba, tárgyak dobozolása). Egy látványos demóban a robot állítólag emberi beavatkozás nélkül pakolt be egy teljes bőröndöt egy tízperces, szobán átívelő folyamat során.

Háromnapos kiadási sorozat és a nyílt súlyok

A Xiaomi-Robotics-1 nem elszigetelt kísérlet, hanem egy átfogó, háromnapos robotikai bejelentéssorozat csúcspontja:

  • Július 14.: Emberi szinthez közeli sikeraránnyal működő, gyári összeszerelő humanoid robot bemutatása.
  • Július 15.: A 38 milliárd paraméteres Xiaomi-Robotics-U0 robotikai világmodell nyílt forráskódúvá tétele.
  • Július 16.: A Xiaomi-Robotics-1 vezérlési alapmodell kiadása.

Ez a három pillér egy teljes „hardver–adat–modell” ökoszisztémát alkot, megerősítve a Xiaomi törekvését, hogy a testet öltött AI (embodied AI) piacának globális éllovasává váljon. A vállalat közölte, hogy a kódkészletet és a modell-súlyokat egyaránt közzéteszi.

Összegzés

A cselekvések és eredmények helyes olvasata nem az, hogy a nagyobb modellek feleslegesek lennének, hanem az, hogy a robotikában jelenleg az adat képezi a legfőbb szűk keresztmetszetet, nem a paraméterszám.

A Xiaomi egy skálázható és költséghatékony receptet igazolt: nagy léptékű, robot nélküli előtanítás emberi mozgásból, majd kevés valós robotadattal történő finomhangolás. Ha ez a megközelítés iparági szabvánnyá válik, jelentősen felgyorsíthatja a humanoid és mobil robotok elterjedését a gyárakban és a háztartásokban egyaránt.

Kövesd a témát

Értesítést kapsz a profilodban és a heti hírlevélben, ha új cikkünk jelenik meg a követett témáidban.

Cégek
Témák

Tetszett a cikk?

Oszd meg

Gyakori kérdések az AI hírekről

Hol olvashatóak a legfrissebb AI hírek magyarul?

A KakasTech AI Hírek rovata naponta frissül: a mesterséges intelligencia legújabb fejlesztései, modell-bejelentések és iparági elemzések magyar nyelven, ellenőrzött nemzetközi források alapján olvashatóak nálunk.

Milyen témákat fednek le a KakasTech AI hírei?

A nagy AI-laborok (OpenAI, Anthropic, Google DeepMind) bejelentéseitől a chipeken és a robotikán át a hazai és nemzetközi szabályozásokig minden lényeges területet követünk.

Hogyan értesülhetek azonnal a legújabb AI változásokról?

Feliratkozhatsz a heti összefoglaló hírlevelünkre a lap alján, vagy követheted az AI API-árkalkulátorunkat és az AI-modell összehasonlító oldalunkat a legfrissebb technikai adatokért.

Hozzászólások 0

A hozzászóláshoz kérjük, jelentkezz be.

Még nincsenek hozzászólások. Írd meg te az elsőt!