AI HÍREK Szoftver & alkalmazások
augusztus 7. – 17:47 3 perc 2

DeepSeek V4 Flash: az olcsó modell, amely a saját, drágább testvérét is legyőzi az ügynök-teszteken

KakasTech AI asszisztens elemzése
  • 2024. július 31-én a kínai DeepSeek kiadta a V4‑Flash‑0731 frissített modelljét, 284 milliárd paraméterrel és 13 milliárd aktivált MoE‑architektúrával.
  • A modell 82,7 pontot ért el a Terminal‑Bench 2.1‑en, 14,7 %-os előnyt szerezve a 72,1 pontot elért V4‑Pro‑Preview‑hoz képest, miközben tokenenként 0,14 $‑ba, 0,28 $‑ba kerül, az árak harmadát nyújtva.
  • A nyílt súlyok MIT licenc alatt a Hugging Face‑en és az OpenAI Responses API‑val való támogatás miatt a fejlesztők gyorsan átállhatnak, erősítve a költséghatékony középkategóriás AI‑piacot.

Rendszer fókusz: Használjon szigorú token‑használati monitorozást és költség‑figyelmeztetéseket a DeepSeek V4‑Flash API‑hívásoknál, ellenőrizze a ‘thinking’ tokenek számlázását, és korlátozza az API‑kulcsok hozzáférését IP‑szintű whitelist‑el.

Ez a cikk több nemzetközi forrás alapján, mesterséges intelligencia közreműködésével készült szerkesztett összefoglaló, amely nem azonos egyetlen konkrét forrás tartalmával sem. A szöveg csak szerkesztői átolvasás után jelenik meg, ennek ellenére tartalmazhat pontatlanságokat; a felhasznált források lentebb olvashatók.

Kép forrása: Saját AI generált kép

A kínai DeepSeek július 31-én hivatalosan is kiadta a V4 Flash modell frissített változatát, nyilvános bétaverzióban az API-n keresztül. A bejelentés érdekessége nem egy vadonatúj alaptechnológia, hanem az, hogy egy szándékosan olcsó, könnyű modell olyan eredményeket ér el az ügynökteszteken, amelyekkel a saját, nagyobb és drágább testvérmodelljét, a V4 Pro-t is megelőzi.

A modell architektúrája és mérete változatlan a korábbi V4-Flash-Preview-hoz képest – egy 284 milliárd paraméteres, ebből 13 milliárd aktivált paraméterrel dolgozó Mixture-of-Experts (MoE) rendszer, egymillió tokenes kontextusablakkal. Az egyetlen változás a poszttréning: a DeepSeek újratanította a modell viselkedését, és ezzel jelentős ugrást ért el az ügynök- és kódolási feladatokban.

Amikor az olcsóbb modell veri a drágábbat

A legfontosabb szám: a V4-Flash-0731 82,7 pontot ért el a Terminal-Bench 2.1 teszten, szemben a V4-Pro-Preview 72,1 pontjával – ez 14,7 százalékos előny a költséghatékony modell javára a prémium testvérével szemben.

Ez azért figyelemre méltó, mert a Terminal-Bench és a hasonló tesztek (például a Toolathlon 70,3 ponttal) valós, többlépcsős szoftvermérnöki és eszközhasználati feladatokat mérnek, nem pusztán lexikális tudást. Ez egy szoftverek működtetésére hangolt modell.

A DeepSeek több egyéb eredményt is közzétett:

  • NL2Repo 54,2
  • Cybergym 76,7
  • DeepSWE 54,4
  • Agent Last Exam 25,2
  • DSBench-FullStack 68,7

A számokat a cég saját DeepSeek Harness rendszerével, minimális módban, maximális szinten mérte (top_p 0,95, temperature 1,0). Fontos árnyalat: az utolsó néhány teszt (Agent Last Exam, Automation Bench) szándékosan brutális, hosszú távú feladatsor, ahol a húszas értékek jelenleg az egész élvonalbeli (frontier) mezőnyben normálisnak számítanak – a teljesen autonóm, órákig tartó feladatvégrehajtást egyelőre senki sem oldotta meg.

Független megerősítésként az Artificial Analysis az Intelligence Indexen 50 pontot adott a 0731-es buildnek: ez tíz ponttal magasabb az áprilisi preview-nál, hattal a jóval nagyobb V4 Pro-nál, és egy szinten van a Gemini 3.6 Flash-sel.

Az igazi történet az árazás

A V4 Flash millió bemeneti tokenenként 0,14 dollárba, kimeneti tokenenként pedig 0,28 dollárba kerül – nagyjából a V4 Pro árának harmada (utóbbi 0,435, illetve 0,87 dollár). Összehasonlításképp: az Anthropic Opus 4.8 modellje, amely a legtöbb teszten vezet, 85,0 pontot ért el a Terminal-Bench 2.1-en – a V4 Flash 82,7 pontja mindössze 2,3 pont lemaradás, ennek a töredékéért. A nagy léptékben ügynökfeladatokat futtató csapatoknak ez a matek sokat számít.

Egy fontos részlet a költségvetéshez: a gondolkodási („thinking”) mód alapértelmezetten be van kapcsolva, és a kimeneti díjszabás szerint számláz, még akkor is, ha ezek a rejtett érvelési tokenek nem jelennek meg a végső válaszban. Emellett a DeepSeek árlistája egy jövőbeli csúcsidős szorzót is kilátásba helyezett (kétszeres díj pekingi idő szerint bizonyos idősávokban), aminek a bevezetési dátuma egyelőre nincs meghirdetve.

Fejlesztőbarát integráció és nyílt súlyok

A hivatalos kiadás API-oldali újdonsága, hogy a V4 Flash mostantól natívan támogatja az OpenAI Responses API formátumát, így az OpenAI ökoszisztémájára építő fejlesztők minimális kódmódosítással válthatnak át rá. A DeepSeek emellett kifejezetten a Codex-integrációhoz igazította a modellt. A modell azonosítója változatlan maradt (deepseek-v4-flash), tehát a meglévő integrációk automatikusan az új változatot kapják – nincs új végpont, nincs sémaváltás.

A stratégia egyértelmű: a DeepSeek a fejlesztők belépési küszöbét igyekszik minimálisra csökkenteni. A 0731-es súlyok ráadásul nyilvánosan elérhetők a Hugging Face-en, MIT licenc alatt.

Mit jelent ez a piacnak?

A V4 Flash jól illeszkedik abba a szélesebb iparági trendbe, amely a magas árú zászlóshajó-modellek kihívójaként a hozzáférhető, jó ár-érték arányú középkategóriát erősíti. A modell nem dominál minden teszten, de az értékajánlata világos: a magas teljesítménynek nem kell magas árral járnia. Egy olyan időszakban, amikor a kínai modellek sorra jelennek meg közel frontier-szintű teljesítménnyel a frontier-árak töredékéért, minden ilyen kiadás tovább élezi a nyílt forráskódú AI körüli vitát, és egyre nehezebbé teszi a zárt, prémium modellek felárának megindokolását.

Kövesd a témát

Értesítést kapsz a profilodban és a heti hírlevélben, ha új cikkünk jelenik meg a követett témáidban.

Cégek
Témák

Tetszett a cikk?

Oszd meg

Gyakori kérdések az AI hírekről

Hol olvashatóak a legfrissebb AI hírek magyarul?

A KakasTech AI Hírek rovata naponta frissül: a mesterséges intelligencia legújabb fejlesztései, modell-bejelentések és iparági elemzések magyar nyelven, ellenőrzött nemzetközi források alapján olvashatóak nálunk.

Milyen témákat fednek le a KakasTech AI hírei?

A nagy AI-laborok (OpenAI, Anthropic, Google DeepMind) bejelentéseitől a chipeken és a robotikán át a hazai és nemzetközi szabályozásokig minden lényeges területet követünk.

Hogyan értesülhetek azonnal a legújabb AI változásokról?

Feliratkozhatsz a heti összefoglaló hírlevelünkre a lap alján, vagy követheted az AI API-árkalkulátorunkat és az AI-modell összehasonlító oldalunkat a legfrissebb technikai adatokért.

Hozzászólások 0

A hozzászóláshoz kérjük, jelentkezz be.

Még nincsenek hozzászólások. Írd meg te az elsőt!