Den nye familie af Arm C1-kerner markerer et stort skift i økosystemet for mobile og ultrabærbare enheder, og erstatter den velkendte Cortex med et klarere fokus på vedvarende ydeevne og effektivitet. Denne generation kommer med Lumex-platformen og med et åbenlyst mål: at accelerere AI på selve enheden uden at gå på kompromis med batteri eller temperatur.
Ud over navneændringen kombinerer forslaget Armv9.3-A arkitektur, en gennemgribende redesign af hukommelsessystemet og et betydeligt boost til matrixcomputerens kapaciteter. Resultatet er omfattende forbedringer af ydeevnen med lavere strømforbrug samt en køreplan designet til smartphones, tablets, bærbare computere og wearables.
Arkitektur og nye funktioner i Arm C1-kernerne

C1-serien er organiseret i fire varianter: C1-Ultra (maksimal ydeevne), C1-Premium (høj ydeevne på mindre område), C1-Pro (balance) og C1-Nano (maksimal effektivitet). Hver producent kan kombinere disse blokke i heterogene klynger for at skabe SoC'er tilpasset forskellige serier og anvendelser med konfigurationer af op til 14 kerner.
Arm har justeret både front- og backend, herunder forbedringer af forudsigelser, cacher og udførelse af forkerte ordrer. Takket være den nye forbindelse og en mere effektiv (dataintensiv) delt cache, SLC-celler), tilbyder platformen gennemsnitlige stigninger på tæt på 15 % i daglig brug, hvilket skaleres til +30% ved krævende belastninger og nå toppe på op til 45% i multikerne.
Hukommelsesstøtte udvikler sig med LPDDR6 for at reducere strømforbrug og latenstid, samtidig med at kompatibilitet med LPDDR5X opretholdes ved hastigheder på op til 9600 MT/s. Denne hukommelsesbase, sammen med klyngedesignet, forstærker vedvarende ydeevne og respons under termisk stress.
C1-Ultra: ydeevneloftet
Som en kerne i topklasse, C1-Ultra Den er rettet mod flagskibs-SoC'er og opgaver med høj efterspørgsel såsom computerfotografering, store AI-modeller eller mobile AAA-spil. Sammenlignet med Cortex-X925 taler Arm om en +25% i enkelt tråd, et tal der hjælper med at skalere den samlede ydeevne, når det kombineres med flere kerner i klyngen.
Frontend forbedrer båndbredden for L1 af instruktioner og forudsigelsesnøjagtighed, mens backend øger vinduet for udførelse uden for ordre med omkring 25 % og når op på omkring 2.000 instruktioner samtidigt. Derudover fordobles L1-datakapaciteten til 128 KB, og L1-læsehastigheden accelereres med cirka 33 %.
C1-Premium: høj ydeevne på mindre område
For premium-enheder, der ikke kræver det absolut maksimale, C1-Premium opretholder en arkitektur meget tæt på Ultra, men med en 35% arealreduktionDen er designet til at balancere ydeevne og omkostninger, hvilket muliggør mere kompakte designs uden at ofre betydende cifre.
C1-Pro: Balance og multikernemuskulatur
I det centrale segment, C1-Pro erstatter Cortex-A725 med en +11% effektivitet ved samme forbrug og med effektivitetsforbedringer, der når op til 26 % mindre energi ved samme ydelseInden for spil nævner Arm en fortjeneste på omkring + 16% i denne klasse af kerner.
Nøglerne er i en mere kapabel frontend (raffineret statisk forudsigelse og en Meget større BTB), og en backend med mere båndbredde i L1D og lavere latenstid i L2, når forudsigelsen er korrekt. Prædiktoren er også blevet justeret til at fremskynde responsen i virkelige scenarier.
C1-Nano: effektivitet frem for alt
Til lette opgaver og ekstreme besparelser, C1-Nano øger effektiviteten med omkring 26% sammenlignet med sin forgænger (området holdes stort set intakt, ~+2% i forhold til A520). Forudsigelses- og hentningsfaser er blevet afkoblet for at bringe instruktioner til L1 hurtigere og reducere ventetider på mislykkede forudsigelser.
Derudover vektorbehandling, drev lukkes ned, når pipelinen sidder fast, og trafikken mellem L3 og DRAM reduceres (omkring 21 % i gennemsnit og op til 39 % under visse belastninger), hvilket mindsker forbruget og forbedrer responsen.
C1-DSU: Fleksible klynger og lavere forbrug
De nye C1-DSU orkestrerer forbindelsen af kernerne under en delt L3-cache og bygger bro til resten af SoC'en (RAM, GPU osv.). Sammenlignet med tidligere iterationer reducerer designet det typiske systemstrømforbrug med ca. 11% og hukommelsens påvirkning med ~7%, afhængigt af tilstande som f.eks. L3 Hurtig lur for at minimere tab, når den ikke er i brug.
En anden central del er integrationen af SME2-acceleratorer som elementer uden for kernen: i C1-Ultra og C1-Premium er deres tilstedeværelse obligatorisk, mens i C1-Pro og C1-Nano Det er valgfrit afhængigt af producentens design. Enhver kerne i klyngen kan tilgå dem, når de er til stede, hvilket muliggør meget forskellige kombinationer (f.eks. 2× C1-Ultra + 6× C1-Pro med en eller to SME2-acceleratorer eller mere beskedne kombinationer, der blander Pro og Nano).
Lumex-platformen inkluderer også en ny generation af GPU'er. Selvom fokus i denne nyhed er på CPU'erne, Mali G1 ledsaget af ~20% forbedringer i grafikydeevne, fordobler gennemløbshastigheden af ray tracing og reducerer strømomkostningerne pr. frame med omkring 9%, hvilket styrker blandingen til GPU-første spil og AI-arbejdsbelastninger.
SME2 og CPU'ens rolle i AI

Det store spring inden for AI kommer med SME2 (Skalerbar Matrixudvidelse 2), som accelererer matrixmultiplikationer, multiprædikater og nye datatyper (herunder kompakte præcisioner som 2b/4b), og koordinerer med SVE2 for avanceret vektorisering. I aggregerede tal taler Arm om gennemsnitlige forbedringer på 3,7x med et forbrugsfald tæt på 27%.
I praktiske tilfælde har virksomheden vist latensreduktioner på 4,7x i talegenkendelse (Hviskebase), 2,4-2,8x hastighedsforøgelser i tekst til en voz og store stigninger i tokengenerering til LLM (f.eks. Gemma 3), der er tæt på × 5Kørsel på CPU'en undgår overførsler til andre acceleratorer, hvilket reducerer ventetider og giver hurtigere respons.
Ved små eller interaktive belastninger er CPU'en igen i centrum: med SMV2Mange hverdagsopgaver (lokal billedforbedring, segmentering, klassificering, kameraeffekter eller lyd) udføres hurtigere, med mindre overhead og uden at gå gennem netværket. Når efterspørgslen stiger, kan GPU'en eller en ekstern NPU fortsætte med at tage over, men CPU'en er ikke længere en flaskehals.
Softwaresupport er også tilgængelig: der er integration i Linux og Android 16, optimerede værktøjskæder og biblioteker (KleidiAI) og kompatibilitet med motorer som f.eks. Unity og Unreal EngineDette vil gøre det nemmere for apps og spil hurtigt at implementere disse forbedringer, når de første kommercielle SoC'er ankommer.
Platformen Lumex CSS sætter alle delene sammen (C1 CPU, Mali G1 GPU, forbindelse og hukommelse) med produktionsklare designs 3 nm, hardwaretelemetri og Armsystemkompatibilitet med LPDDR6. Dette giver partnere mulighed for at accelerere deres mobile og bærbare computerprojekter med skalerbare klynger på op til 14 kerner og AI-funktioner på enheden.
Arm C1 kombinerer vedvarende præstation, effektivitet og et reelt skub fremad for AI på CPU'er takket være SME2; de tilbyder fleksibiliteten ved C1-DSU til at tilpasse klynger til hver produktserie og udgør et solidt fundament for den næste bølge af mobile og bærbare SoC'er, der søger at balancere kraft, autonomi og AI-funktioner uden altid at være afhængige af skyen.