Kifejezetten az AAA kategóriás mobilos játékok és az eszközön futó mesterséges intelligencia növekvő hardverigényeire válaszul mutatta be az Arm a legújabb grafikus zászlóshajóját, a Mali G2-Ultra NX GPU-t. Az Arm hivatalos mérnöki bejelentése és a Chips and Cheese technikai elemzése szerint a lapka kulcsfontosságú újítása a dedikált Neural Execution (NX) magok integrálása a grafikus csővezetékbe, amelyek az NFRU (Neural Frame Reconstruction Unit) eljárással valós idejű neurális felskálázást és képkockagenerálást végeznek közvetlenül a lapkán.
Dedikált NX magok: NFRU képkockagenerálás és NSS felskálázás
Az okostelefonok és hordozható kézikonzolok legkomolyabb korlátját az akkumulátoros üzemidő, a hűtési kapacitás és a szűkös memória-sávszélesség jelenti. Az Arm technológiai ismertetője szerint a tisztán raszteres renderelés elért arra a falra, ahol a nyers felbontás és a képkockasebesség hagyományos emelése már aránytalanul magas DRAM-forgalmat és hőt termel. A Mali G2-Ultra NX erre a kihívásra három önálló neurális funkciócsomaggal válaszol.
A Neural Super Sampling (NSS) technológia a renderelési munkamenet terhét veszi le a shaderekről: a játék natívan 540p felbontásban fut, majd a neurális háló ezt rekonstruálja éles, részletgazdag 1080p kimenetté. A Neural Frame Rate Upscaling (NFRU) a képkockagenerálás feladatát látja el, és a bejövő 30 FPS-es renderelési folyamatot duplázza meg folyamatos 60 FPS-re mozgásvektorok és neurális köztes képkockák kiszámításával. A legösszetettebb modul, a Neural Super Sampling and Denoising (NSSD) pedig a felskálázást kombinálja valós idejű sugár-rekonstrukcióval, így a fénysugarak útjának és tükröződéseinek kiszámítása lényegesen kevesebb nyers mintavételezést igényel.

Négyszeres hatékonyságugrás és 70 százalékkal kevesebb DRAM-forgalom
A vállalat által közölt belsős mérési adatok alapján a Mali G2-Ultra NX az AI-natív grafikai csővezeték bekapcsolásával akár négyszeres FPS-növekedést és négyszer jobb energiahatékonyságot ér el a hagyományos mobil renderelési folyamatokhoz mérve. Mivel a gépi látási algoritmusok a lapkára integrált gyorsítótárakban dolgozzák fel a képi adatokat, a rendszer szintű DRAM adatforgalom mintegy 70 százalékkal csökken, ami kulcsfontosságú a vékony telefonházak túlmelegedésének megelőzésében.
A tisztán hagyományos, gépi tanulást nem alkalmazó játékok alatt a nyers hardveres teljesítmény 14 százalékkal növekedett, míg a szintetikus grafikus tesztekben 24 százalékos gyorsulást mértek. A GPU-ba egy teljesen újratervezett Execution Engine (EE) került, amely az Arm közlése szerint a vállalat elmúlt hét generációjának legjelentősebb utasításkészlet-architektúrális (ISA) átalakítása, és közvetlen hardveres optimalizációt nyújt az Unreal Engine 5 Nanite mikrogeometriás és Lumen globális megvilágítási rendszereihez. Ezt egészíti ki a harmadik generációs Ray Tracing Unit (RTU v3), amely a hardveres gyorsítás révén 70 százalékkal csökkenti a sugárkövetési számítások terhét a geometriai csővezetéken.
C2-Ultra processzormagok SME2 kiegészítéssel
A CSS for Mobile 2 platform a grafikus egység mellett a számítási központot is frissíti a C2-Ultra processzormagok révén. Az új zászlóshajó magok megkapták az SME2 (Scalable Matrix Extension 2) támogatást, amely kifejezetten a helyi, készüléken futtatott AI-modellek mátrixműveleteit gyorsítja fel. Az előző generációhoz viszonyítva 15 százalékkal jobb egyszálas és 12 százalékkal magasabb többszálás teljesítmény érhető el, a webböngészés 15 százalékkal, az alkalmazások betöltése pedig 12 százalékkal gyorsult.
A mérések szerint két darab SME2-kompatibilis C2-Ultra mag akár 1,7-szeres gyorsulást nyújt a legújabb nyílt forráskódú helyi nyelvi és multimodális modellek futtatásakor. Bár konkrét készülékeket vagy rendszerchipeket még nem neveztek meg, a technológiai licenc a partnercégek – köztük a MediaTek és a Samsung – számára már elérhető, így az első NFRU-képes és Mali G2-Ultra NX architektúrára épülő csúcskészülékek a következő generációs prémium okostelefonokban debütálhatnak.