JARVIS, te vagy az? Megmutatta új mesterséges intelligenciáját az OpenAI

Mintha JARVIS gyakornoknak állt volna: ezt tudja a GPT-6 Astra.

Tony Starknak elég volt odaszólnia JARVIS-nak, és a digitális asszisztens már intézte is a feladatokat – nekünk eddig valamivel több kattintás jutott. Az OpenAI új GPT-6 Astra modellje viszont már olyan, mintha ennek a technológiának az alfaverziója lenne: kezeli a számítógépet, összetett munkafolyamatokat végez el, és közben egyre ügyesebben értelmezi, mit szeretnénk tőle. Repülő páncélt azért még ne rendeljünk hozzá.

Az OpenAI eddigi legintelligensebb és legjobban összehangolt modelljeként jellemzi a GPT-6 Astrát, amely a programozástól a tudományos kutatáson át az irodai munkáig több területen is előrelépést ígér. A vállalat által közölt teszteredmények ráadásul eléggé látványosak, a modell 98 százalékot ért el a FrontierMath Tier 4 matematikai feladatsorán, az ARC-AGI-3 teszten pedig 99,9 százalékig jutott. Ezek persze tesztpontszámok, nem pedig garanciák arra, hogy mostantól minden válasza hibátlan lesz.

A hétköznapokban valószínűleg az lesz az érdekesebb, mennyi munkát tud ténylegesen levenni a vállunkról. Az Astra böngészhet, űrlapokat tölthet ki, adatokat elemezhet, dokumentumokat és prezentációkat készíthet, sőt szoftvereket telepíthet és tesztelhet. Az OpenAI szerint a meglévő sablonokhoz, valamint a felhasználó írásos és vizuális stílusához is ügyesebben igazodik. A ChatGPT Sites segítségével pedig egy szöveges kérésből weboldalak, webalkalmazások és játékok készítését, közzétételét és megosztását is elvégezheti. A tempón is csiszoltak. Az OSWorld 2.0 késleltetési szimulációiban az Astra nagyjából 40 perc alatt teljesített egy feladatot a GPT-5.6 Sol körülbelül 75 percével szemben, miközben jobb eredményt ért el. A Codex működésének fejlesztéseivel együtt a Mind2Web teszten 1,9-szeres feladatvégzési sebességről számoltak be.

Az önállóság mellé jobb ítélőképességet is ígérnek. Az Astra a kisebb hiányosságokat a szövegkörnyezetből pótolhatja, lényeges bizonytalanságnál viszont célzottan kérdezhet. A Codexben közben folytathatja a válaszunktól független munkát. Hosszabb feladatoknál egy kísérleti megoldás jegyzetekkel és visszakereshető korábbi kontextussal segíti, hogy ne vesszenek el az eredeti célok és kikötések.

A tudományos oldalon az OpenAI régóta nyitott matematikai problémák megoldásához nyújtott segítségről is beszámolt. A kiberbiztonsági képességek ugyanakkor különösen erősek, mivel az Astra éles védelmi korlátozások nélkül 100 százalékot ért el az ExploitBench teszten, és a vizsgálatok során két korábban ismeretlen sérülékenységet is felfedezett és kihasznált. A megjelenő változat támogatja a védekező kódellenőrzést és javítást, bizonyos fejlettebb támadó jellegű kéréseket azonban visszautasít. A cég azt is elismeri, hogy egyes tesztekben nehezebbé vált a modell írott gondolatmenetének leellenőrzése.

Az Astra először szervezetek szűk köréhez kerül, majd a közlés szerint a következő napokban a ChatGPT Plus, Pro, Business és Enterprise felhasználóihoz is eljut. API-n, Microsoft Azure-on és AWS Bedrockon keresztül szintén elérhető lesz. A standard API-díj egymillió bemeneti tokenenként 10, kimeneti tokenenként 50 dollár; a legfeljebb kétszeres sebességet kínáló Fast mód kétszeres áron működik. A gyorsaságnak tehát itt is megvan a felára.

Borítókép: AI