Claude Opus 5: kétszer okosabb, mint az elődje, ugyanannyiért

KakasTech AI asszisztens elemzése
  • Anthropic július 24‑én bemutatta a Claude Opus 5‑öt, $5/$25 tokenenkénti áron, ugyanazt a díjat, mint az Opus 4.8, de több mint duplája a teljesítménynek.
  • A duplájára nőtt teljesítmény ugyanazon $5/$25 díjon jelentősen csökkenti a feladatonkénti költséget, különösen hosszú, eszközhívás‑intenzív munkafolyamatoknál, így a fejlesztők olcsóbban használhatják a komplex érvelést.
  • Ha a független benchmarkek megerősítik az Anthropic adatait, az Opus 5 a költséghatékony LLM‑piacot átalakíthatja, nyomást gyakorolva az OpenAI‑ra és a Google‑ra.

Rendszer fókusz: Használja az Opus 5‑öt kódfelülvizsgálatra, de minden generált sebezhetőségi javaslatot ellenőrizzen hagyományos SAST‑eszközzel, és figyelje a lehetséges hallucinációkat a válaszokban.

Ez a cikk több nemzetközi forrás alapján, mesterséges intelligencia közreműködésével készült szerkesztett összefoglaló, amely nem azonos egyetlen konkrét forrás tartalmával sem. A szöveg csak szerkesztői átolvasás után jelenik meg, ennek ellenére tartalmazhat pontatlanságokat.

Kép forrása: Saját AI generált kép

Új modell bejelentése

Az Anthropic július 24-én kiadta a Claude Opus 5-öt, a bejelentés fő üzenete pedig ezúttal nem a puszta képességplafon áttörése, hanem a nagyságrendekkel jobb ár-érték arány. A cég saját megfogalmazása szerint az új modell megközelíti a zászlóshajó Claude Fable 5 intelligenciáját – méghozzá annak fele áráért –, és kifejezetten a mindennapi, intenzív fejlesztői használatra tervezték.

Az Opus 5 azonnal elérhetővé vált az Anthropic minden platformján (alkalmazásokban, API-n és a nagy felhőszolgáltatóknál), változatlanul 5 dolláros bemeneti és 25 dolláros kimeneti 1 millió tokenenkénti áron. Ez pontosan megegyezik az elődje, az Opus 4.8 tarifájával, miközben a csúcskategóriás Fable 5 ennek a duplájába kerül (10 / 50 dollár).

Műszaki paraméterek és új funkciók

A modell a Claude Max előfizetés új alapértelmezett modellje lett, a Pro csomagban pedig a legerősebb választható opció. Az Anthropic nem elméleti csúcsmodellként, hanem a gyakorlati munkára optimalizált eszközként pozicionálja.

  • Effort (Erőfeszítési) beállítás: A fejlesztők finomhangolhatják a modell gondolkodási mélységét (reasoning depth). Alacsonyabb fokozaton gyorsabb és olcsóbb a válasz, magasabb beállításnál mélyebb és szigorúbb a logikai érvelés.
  • 1 milliós kontextusablak: Hatalmas kódbázisok és összetett dokumentumok egyidejű feldolgozásához.
  • Fast mód: Egy különleges opció, amely a normál generálási sebesség nagyjából 2,5-szeresén fut.

Áttörő mérések – gyártói környezetben

Az Anthropic által közzétett teszteredmények kiemelkedő előrelépést mutatnak az előző generációhoz képest:

  • Frontier-Bench v0.1: Az Opus 5 43,3%-ot ért el, szemben az előd Opus 4.8 18,7%-ával és a Fable 5 33,7%-ával. Ez több mint dupla teljesítmény az elődhöz képest.
  • CursorBench (kódolás): A Fable 5 csúcsteljesítményének körülbelül 99,5%-át hozza, feleakkora feladatonkénti költséggel.
  • OSWorld (számítógép-használat): Felülmúlta a Fable 5 alapértékét, harmadannyi elszámolt költségen.
  • ARC-AGI-3 (ismeretlen problémák): Háromszoros eredményt ért el a következő legjobb modellhez képest.

A cég az elméleti mérések mellett egy gyakorlati példát is kiemelt: az Opus 5 egy gépalkatrész rajzát kapta meg anélkül, hogy közvetlenül láthatta volna a képet. A modell erre önállóan írt egy számítógépes látórendszert (computer vision pipeline-t), kinyerte a nyers pixelekből a geometriát, majd teljesen újraépítette az alkatrészt – egy olyan komplex feladatot oldva meg, amelyet a cég szerint egyetlen versenytárs modell sem tudott teljesíteni öt próbálkozásból.

Két fontos szakmai fenntartás

Ahogy a gyártói bejelentéseknél mindig, itt is érdemes két kritikus részletet figyelembe venni:

  • Külső mérések hiánya: Az adatok az Anthropic saját tesztkörnyezetéből származnak, független harmadik fél egyelőre nem erősítette meg őket. Az egyetlen külső ellenőrzést az Egyesült Királyság AI Security Institute-ja végezte a korai checkpointokon.
  • Biztonsági visszahullás (Fallback) a teszteknél: A Frontier-Bench mérések során, ha a biztonsági osztályozó elutasított egy kérést az Opus 5-től vagy a Fable 5-től, a rendszer a háttérben az Opus 4.8-ra esett vissza – vagyis a mért pontszámok egy kis részét valójában a korábbi modell generálta.

A valódi kulcs: A feladatonkénti költség

A fejlesztők és vállalati felhasználók számára a legfontosabb mutató nem a tokenenkénti listaár, hanem az egy feladatra eső teljes költség. Hosszú, ágenses (agentic) munkafolyamatoknál egy olyan modell, amely kevesebb lépésből, kevesebb felesleges körből és eszközhívásból (tool call) éri el a célját, végső soron sokkal olcsóbb – még azonos tokentarifa mellett is.

Az Opus 5 legnagyobb vívmánya, hogy a csúcskategóriás, komplex érvelést igénylő feladatok költségét drasztikusan lejjebb nyomja az Anthropic ökoszisztémáján belül.

Korai visszajelzések a piacról

  • Harvey (Jogi AI): Az Opus 5 elhozta az Opus 4.8 maximális érvelési minőségét, miközben átlagosan 26 százalékkal kevesebb tokent használt fel.
  • Zapier: A modell sikeresen végigvitt egy teljes ügyfélmegtartási munkafolyamatot (amelyre a korábbi modellek nem voltak képesek) anélkül, hogy növelte volna a felhasznált tokenek számát.

Biztonság, kontroll és korlátok

A kiadott rendszerkártya (system card) szerint az Opus 5 a cég eddigi legjobban illesztett (aligned) modellje a saját automatizált viselkedési auditjukon, megelőzve a Sonnet 5-öt és a Fable 5-öt is.

A dokumentum ugyanakkor szokatlanul őszinte a korlátokkal kapcsolatban:

  • Hallucináció: Elismeri, hogy az Opus 5 összességében nagyobb pontossága ellenére valamivel többet hallucinál, mint az Opus 4.8.
  • Képességkorlát: Lemarad a zárt Mythos 5 mögött a biológiai kutatásokban és az offenzív kiberbiztonságban.
  • Kibervédelmi szabályozás: A modell képes forráskódokban sebezhetőségeket keresni (védekező munka), de a lefordított binárisok vizsgálata, a behatolástesztelés (pentesting) és az exploit-generálás szigorúan tiltva marad.

„Az új modell megközelíti a zászlóshajó Claude Fable 5 intelligenciáját – méghozzá annak fele áráért –, és kifejezetten a mindennapi, intenzív fejlesztői használatra tervezték.”

Összegzés

A következő hetek fő kérdése az lesz, hogy a független fejlesztői mérések és a valós produkciós környezetek igazolják-e a cég által bemutatott kódolási és hatékonysági ugrást.

Kövesd a témát

Értesítést kapsz a profilodban és a heti hírlevélben, ha új cikkünk jelenik meg a követett témáidban.

Cégek
Témák

Tetszett a cikk?

Oszd meg

Gyakori kérdések az AI hírekről

Hol olvashatóak a legfrissebb AI hírek magyarul?

A KakasTech AI Hírek rovata naponta frissül: a mesterséges intelligencia legújabb fejlesztései, modell-bejelentések és iparági elemzések magyar nyelven, ellenőrzött nemzetközi források alapján olvashatóak nálunk.

Milyen témákat fednek le a KakasTech AI hírei?

A nagy AI-laborok (OpenAI, Anthropic, Google DeepMind) bejelentéseitől a chipeken és a robotikán át a hazai és nemzetközi szabályozásokig minden lényeges területet követünk.

Hogyan értesülhetek azonnal a legújabb AI változásokról?

Feliratkozhatsz a heti összefoglaló hírlevelünkre a lap alján, vagy követheted az AI API-árkalkulátorunkat és az AI-modell összehasonlító oldalunkat a legfrissebb technikai adatokért.

Hozzászólások 0

A hozzászóláshoz kérjük, jelentkezz be.

Még nincsenek hozzászólások. Írd meg te az elsőt!