Rameno C1: Toto sú nové jadrá, ktoré zvyšujú výkon a umelú inteligenciu.

  • Nová rodina jadier Arm C1 (Ultra, Premium, Pro a Nano) s až o 45 % vyšším viacjadrovým výkonom.
  • SME2 vylepšuje umelú inteligenciu na CPU: priemerné vylepšenia 3,7x a až 5x pri špecifickom zaťažení s nižšou spotrebou energie.
  • C1-DSU umožňuje klastre až do 14 jadier, zdieľanú L3 a veľmi flexibilné konfigurácie.
  • Platforma Lumex CSS: Integrácia CPU C1, GPU Mali G1 a podpora pre 6nm LPDDR3.

Jadrá ramena C1

Nová rodina Jadrá ramena C1 predstavuje zásadný posun v ekosystéme mobilných a ultraprenosných zariadení, nahrádza známy Cortex jasnejším zameraním na trvalý výkon a efektívnosť. Táto generácia prichádza s... Platforma Lumex a so zrejmým cieľom: zrýchliť umelú inteligenciu na samotnom zariadení bez kompromisov v oblasti výdrže batérie alebo teploty.

Okrem zmeny názvu návrh kombinuje Architektúra Armv9.3-A, zásadnú prepracovanosť pamäťového subsystému a výrazné posilnenie možností maticových výpočtov. Výsledkom sú rozsiahle zlepšenia výkonu s nižšou spotrebou energie, ako aj plán určený pre smartfóny, tablety, notebooky a nositeľné zariadenia.

Architektúra a nové funkcie jadier Arm C1

Architektúra jadra Arm C1

Séria C1 je rozdelená do štyroch variantov: C1-Ultra (maximálny výkon), C1-Prémiový (vysoký výkon na menšej ploche), C1-Pro (zostatok) a C1-Nano (maximálna účinnosť). Každý výrobca môže tieto bloky kombinovať do heterogénnych klastrov a vytvárať tak SoC prispôsobené rôznym rozsahom a použitiu s konfiguráciami až 14 jadier.

Spoločnosť Arm vylepšila front-end aj back-end, vrátane vylepšení predikcie, vyrovnávacích pamätí a vykonávania mimo poradia. Vďaka novému prepojeniu a efektívnejšej (dátovo náročnejšej) zdieľanej vyrovnávacej pamäti, SLC bunky), platforma ponúka priemerné zvýšenie takmer o 15 % pri každodennom používaní, ktoré sa dá škálovať až +30 % pri náročných nákladoch a dosiahnuť vrcholy až 45 % vo viacjadrovom procesore.

Podpora pamäte sa vyvíja s LPDDR6 aby sa znížila spotreba energie a latencia, pričom sa zachovala kompatibilita s LPDDR5X pri rýchlostiach až do 9600 MT/s. Táto pamäťová základňa spolu s prepracovaným klastrom posilňuje trvalý výkon a odozvu pri tepelnom namáhaní.

C1-Ultra: výkonnostný strop

Ako špičkové jadro, C1-Ultra Zameriava sa na vlajkové lode SoC a úlohy s vysokým dopytom, ako je výpočtová fotografia, rozsiahle modely umelej inteligencie alebo mobilné hry AAA. V porovnaní s Cortex-X925 hovorí Arm o... +25% v jednom vlákne, čo je číslo, ktoré pomáha škálovať celkový výkon v kombinácii s väčším počtom jadier v klastri.

Front-end zlepšuje šírku pásma L1 inštrukcií a presnosť predikcie, zatiaľ čo back-end zvyšuje okno vykonávania mimo poradia približne o 25 %, dosahujúc približne 2.000 inštrukcií súčasne. Okrem toho sa dátová kapacita L1 zdvojnásobila na 128 KB a rýchlosť čítania L1 sa zrýchlila približne o 33 %.

C1-Premium: vysoký výkon na menšej ploche

Pre prémiové zariadenia, ktoré nepotrebujú absolútne maximum, C1-Prémiový zachováva si architektúru veľmi blízku Ultra, ale s 35% zníženie plochyJe navrhnutý tak, aby vyvážil výkon a cenu, čo umožňuje kompaktnejšie konštrukcie bez obetovania významných čísel.

C1-Pro: Rovnováha a viacjadrové svaly

V centrálnom segmente, C1-Pro nahrádza Cortex-A725 za +11% účinnosť pri rovnakej spotrebe a so zlepšeniami efektívnosti, ktoré dosahujú až o 26 % menej energie pri rovnakom výkoneV oblasti hier spoločnosť Arm uvádza zisky okolo + 16% v tejto triede jadier.

Kľúče sú v výkonnejšom front-ende (vylepšená statická predikcia a Oveľa väčší BTB) a backend s väčšou šírkou pásma v L1D a nižšou latenciou v L2, keď je predikcia správna. Prediktor bol tiež vyladený tak, aby zrýchlil odozvu v reálnych situáciách.

C1-Nano: účinnosť nadovšetko

Pre ľahké úlohy a extrémne úspory, C1-Nano zvyšuje účinnosť približne o 26% v porovnaní s predchodcom (oblasť zostala prakticky neporušená, ~+2 % oproti A520). Fázy predikcie a načítania boli oddelené, aby sa inštrukcie do L1 dostali skôr a skrátili sa čakania na neúspešné predikcie.

Okrem toho, vektorové spracovanie, disky sa vypnú, keď sa kanál zasekne a prevádzka medzi L3 a DRAM sa zníži (v priemere okolo 21 % a pri určitých zaťaženiach až o 39 %), čo znižuje spotrebu a zlepšuje odozvu.

C1-DSU: Flexibilné klastre a nižšia spotreba

Nový C1-DSU riadi prepojenie jadier v rámci zdieľanej vyrovnávacej pamäte L3 a premosťuje priepasť so zvyškom SoC (RAM, GPU atď.). V porovnaní s predchádzajúcimi iteráciami tento dizajn znižuje typickú spotrebu energie systému približne o 11% a vplyv pamäte o ~7 %, pričom sa spolieha na režimy ako napríklad L3 Rýchle zdriemnutie aby sa minimalizovali straty, keď sa nepoužívajú.

Ďalším kľúčovým prvkom je integrácia Akcelerátory SME2 ako prvky mimo jadra: v C1-Ultra a C1-Premium je ich prítomnosť povinná, zatiaľ čo v C1-Pro a C1-Nano Je to voliteľné v závislosti od návrhu výrobcu. K nim má prístup akékoľvek jadro v klastri, keď sú prítomné, čo umožňuje veľmi rozmanité kombinácie (napr. 2× C1‑Ultra + 6× C1‑Pro s jedným alebo dvoma akcelerátormi SME2 alebo skromnejšie kombinácie mixujúce Pro a Nano).

Platforma Lumex obsahuje aj novú generáciu grafických procesorov (GPU). Hoci sa táto správa zameriava na procesory (CPU), Mali G1 sprevádzané ~20% zlepšením grafického výkonu, zdvojnásobuje priepustnosť sledovania lúčov a znižuje náklady na energiu na snímku približne o 9 %, čím posilňuje kombináciu pre hry s prioritou grafického procesora a úlohy s umelou inteligenciou.

SME2 a úloha CPU v umelej inteligencii

SME2 na ramene C1

Veľký skok v umelej inteligencii prichádza s SME2 (Rozšírenie škálovateľnej matice 2), ktorý urýchľuje násobenie matíc, viacnásobné predikáty a nové dátové typy (vrátane kompaktných presností ako 2b/4b) a koordinuje sa so SVE2 pre pokročilú vektorizáciu. V agregovaných číslach Arm hovorí o priemerné zlepšenia 3,7x s poklesom spotreby blízkym 27%.

V praktických prípadoch spoločnosť preukázala zníženie latencie 4,7x rýchlejšie rozpoznávanie reči (Whisper Base), 2,4–2,8-násobné zrýchlenia v prevod textu na reč a veľké nárasty generovania tokenov pre LLM (napr. Gemma 3), ktoré sú blízko × 5Beh na CPU zabraňuje prenosom na iné akcelerátory, čo skracuje čakacie doby a zaisťuje rýchlejšiu odozvu.

Pri malých alebo interaktívnych záťažiach sa CPU opäť dostáva do centra pozornosti: s SME2Mnohé každodenné úlohy (lokálne vylepšenie obrazu, segmentácia, klasifikácia, efekty kamery alebo zvuk) sa vykonávajú rýchlejšie, s menšími réžiami a bez prechodu cez sieť. Keď sa dopyt zvýši, grafický procesor (GPU) alebo externý NPU môže naďalej preberať úlohu, ale CPU už nie je úzkym hrdlom.

K dispozícii je aj softvérová podpora: existuje integrácia v Linux a Android 16, optimalizované reťazce nástrojov a knižnice (KleidiAI) a kompatibilita s enginmi ako napríklad Unity a Unreal EngineVďaka tomu budú môcť aplikácie a hry rýchlejšie prijať tieto vylepšenia hneď, ako sa objavia prvé komerčné SoC.

Platforma Lumex CSS spája všetky časti (CPU C1, GPU Mali G1, prepojenie a pamäť) s návrhmi pripravenými na produkciu 3 nm, hardvérová telemetria a Kompatibilita ramenného systému s LPDDR6. To umožňuje partnerom zrýchliť ich mobilné a notebookové projekty pomocou škálovateľných klastrov až do 14 jadier a funkcií umelej inteligencie na zariadení.

Rameno C1 kombinuje trvalý výkon, efektívnosť a skutočný impulz pre umelú inteligenciu na procesoroch vďaka SME2; ponúkajú flexibilitu C1-DSU na prispôsobenie klastrov každému radu produktov a tvoria pevný základ pre ďalšiu vlnu mobilných a prenosných SoC, ktoré sa snažia vyvážiť výkon, autonómiu a schopnosti umelej inteligencie bez toho, aby boli vždy závislé od cloudu.

RISC-V SoC Sophgo
Súvisiaci článok:
SOPHGO SG2000/SG2002: SoC pre AI s jadrom RISC-V + ARM

Pridať ako preferovaný zdroj v Google