CPU跑30亿参数轻量化模型、GPU带神经加速器,Arm CSS for Mobile 2全面跃升

原创2026-09-10 16:36:57浏览710
710
Star

作者:华秋开源硬件社区 黄晶晶

在2026年9月举行的 Arm Everywhere China年度大会上,Arm 正式推出第二代移动终端计算子系统(CSS for Mobile 2),在单一计算平台中实现对智能体 AI 和 AI 原生图形技术的全面支持。Arm CSS for Mobile 2 集成全新 Arm Mali G2-Ultra NX GPU、搭载 SME2 的 Arm C2 CPU 集群、增强型系统 IP、物理实现方案以及开发者就绪的软件生态系统。

 

 

在去年的发布中,Arm 全新平台命名体系里,Lumex 是面向旗舰手机 / 平板的移动端 CSS(Compute Subsystem计算子系统)。包含C1 CPU 集群(Armv9.3-A,SME2 第二代可扩展矩阵指令集)和Mali G1-Ultra GPU。此次迭代命名为CSS for Mobile 2,是Arm对命名体系做了简化。CSS for Mobile 更加清晰直观,同理面向 PC 领域的为CSS for PC。

Arm性能最强的移动CPU、双SME2单元加持

全新的Arm C2 CPU 集群包括Arm 性能最强大的移动 CPU——C2-Ultra、面向能效优化的 C2-Pro CPU,以及双 SME2 单元。这一设计使 AI 工作负载能够直接在 CPU 上实现高响应、低延迟处理,同时与各类 AI 加速器无缝协同工作。

 

与上一代 C1-Ultra 相比,C2-Ultra 可实现高达1.7倍的AI 性能提升,高达15%的单线程性能提升,在相同性能下高达 38% 的功耗降低。

 

Arm边缘AI 智能终端计算副总裁James McNiven解析,15% 这一数值来源于GeekBench 6.3 的单线程基准测试。而 1.7 倍性能提升则是针对特定的 AI 模型,在这个推理模型中,相较上一代产品,处理大量矩阵运算时可以实现1.7倍的执行性能提升。

 

 

 

Arm边缘AI CPU产品管理总监 Daniel Lu表示,我们的集群配置目前最高可支持 14 个核心,这种灵活配置带来独特的价值。例如,有些合作伙伴评估后认为,其智能体工作负载至少需要十个核心,就会相应选择十核心的配置。Arm 也非常愿意为芯片合作伙伴提供这种灵活性,以让他们能根据实际的工作负载,选择最适合的核心数量。

 

智能体时代的算力架构正在重构。在全新的计算体系中,随着AI从执行单一任务逐步演进为管理日益复杂的工作流,CPU 正成为整个系统的编排引擎。它负责维护上下文、调度工作负载,并协调更广泛计算系统中的各类任务,确保AI 智能体在推理、规划和执行过程中始终保持高响应性。

 

同时CPU直接承担部分AI计算任务。业界普遍存在一个认知误区,认为 AI 计算全部由 GPU 与 NPU 接管。但事实上,大量轻量推理、分支决策、上下文处理等 AI 相关工作,依然需要 CPU 来完成。CPU不再只是单纯的控制单元,而是深度参与 AI 工作流,与 GPU、NPU 形成异构协同,共同支撑智能体的持续运行。

 

为此,Arm最新的C2 CPU集群配置了翻倍的 SME2 计算能力,可使最新小语言模型的运行速度提升高达 70%,进一步增强CPU对AI工作负载的加速能力。

 

James McNiven表示,Arm 并没有对“轻量级模型”设定一个严格的定义或明确的参数门槛。不过通常来说,我们所说的轻量级模型主要是 20 亿至 30 亿的参数规模,例如 Gemma-2B、腾讯混元的 HY-1.8B-2Bit,都属于我们认为的轻量级模型。

 

 

他进一步分析,对于计算密集度非常高的工作负载来说,CPU 并非最优选择,更适合放到GPU或者NPU上去运行。我们更希望 CPU 聚焦于运行那些可以限定在本地算力预算之内的小语言模型。

 

第二代 Arm 可伸缩矩阵扩展(SME2)底层上沿用了与上一代 CSS 平台相同的架构。但可以支持更前沿的工艺节点(例如 2nm),此外今年可配置的 SME2 单元数增加,有些合作伙伴会选择部署更多的 SME2 单元。

 

针对 SME2 的优化,除了合作伙伴可以部署更多 SME2 单元之外,Arm 在生态系统软件支持上也完成了大量提升。例如,Arm KleidiAI 如今集成了数量更多的内核,同时落地SME2 配套指令集能力,例如查找表(look-up table)指令,CPU 可以直接处理位宽更小的权重与激活值。因此诸多优化成果来自软件生态合作伙伴的协同。

 

SME2 虽然是去年新推出的技术,但目前几乎所有旗舰智能手机,无论是安卓还是 iOS 手机,均已采用 SME2 技术。围绕 SME2 构建的生态系统也在不断壮大,其中包括支付宝、Google AI Edge Gallery、OPPO 和 vivo 等。

Arm Mali G2-Ultra NX支持AI原生图形

Arm Mali G2-Ultra NX 是首款集成专用神经网络加速器的 Mali GPU,可将神经网络计算与传统图形处理紧密融合,实现更高的能效和响应速度。图形处理与神经网络计算可在同一处理管线中协同运行,使相关工作负载直接在 GPU 内完成,这为开发者在性能、能效与视觉质量之间进行权衡和优化提供了全新的方式。

 

同时,该 GPU 还引入了全新的执行引擎(Execution Engine,EE)和第三代光线追踪单元(Ray Tracing Unit v3,RTUv3),专为日益复杂的图形工作负载以及现代游戏引擎功能而设计。

 

 

 

结合Arm神经网络技术,Mali G2-Ultra NX在神经网络处理场景下可实现最高 4 倍的“每瓦性能”提升。这一跨越式的能效进步,为更加丰富、更高保真度和更复杂的图形体验释放了更大的性能空间。

 

Arm Mali G2-Ultra NX 的三大AI原生图形技术方案,支撑 GPU面向下一代移动图形的核心能力。NSS 即神经超级采样,通过渲染更少像素,由 AI 重建高分辨率画面,在降低着色开销的同时提升画质,相关模型已在 Hugging Face、GitHub 及 ArmNG SDK 开源发布。

 

NFRU 为神经帧率提升技术,不需要渲染全部完整帧,依靠 AI 生成中间帧,用更低帧渲染成本实现更顺滑的运动画面,同样开放开发者获取。

 

NSSD 是神经超分与降噪技术,专门针对光线追踪带来的噪点问题,对低采样输入同时完成超分辨率重建与降噪处理,适配实时光追场景,该方案将于2026年通过早期接入计划开放可运行版本。三项技术分别从分辨率、帧率、光追降噪三个维度,依托 GPU 内置 AI 引擎优化图形渲染,大幅降低移动端渲染负载,为手机等设备带来更高画质、更流畅的游戏与实时图形体验。

 

 

 

Arm 边缘 AI 高级产品经理 Deyan Lazarov表示,我们聚焦打造轻量化、高效的 AI 神经网络,推动这项新技术能够先在移动端市场落地应用。因此,目前版本的神经网络只支持在两个渲染帧之间生成一帧 AI 重建帧。但面向未来,我们已经规划了更丰富的路线图来扩展应用场景,这也是我们正在积极推进的方向。

 

此外,延迟是一项关键考量。以 30 帧每秒(FPS)场景为例,在实际应用中,单帧时间预算约为 33 毫秒。开发者需要在这个时间窗口内既完成原始帧的渲染,同时完成 AI 生成帧的插入。这样在原本 30 FPS 的时间预算内,可以输出两帧画面,从而实现了 60 FPS 的效果。此外,开发者还需要配合使用帧步调(Frame Pacing)解决方案。因为实际运行过程中,帧与帧之间的时间间隔并不总是完全一致。虽然 AI 插值的延迟相对固定,但每一帧的实际渲染时间可能会有所波动。因此,需要借助 Android 平台或游戏引擎提供的帧步调解决方案,确保画面能够以稳定的节奏持续输出。

 

 

 

以《光影新生》为例,画面采用低分辨率渲染,并在生成帧流程中完成分辨率放大和重建,开发者可以独立使用 NFRU 来实现。如果渲染压力太大、时间不够用,还可以进一步降低原始渲染分辨率,从而减少 GPU 渲染所需时间。在最新版本中,我们还引入了不同质量等级(quality tiers)的模型。也就是说,如果开发者愿意在一定程度上牺牲画面质量,就可以选择运行速度快得多的网络模型。因此,对于开发者而言,有多种方式可以在画质和性能之间进行权衡,确保拥有足够的性能预算来满足自身需求。

 

 

 

AI 在处理复杂内容时优势显著,对于拥有大量几何细节和复杂渲染需求的桌面级画面内容,AI 能够发挥非常明显的作用。从行业发展趋势来看,我们相信 AI 增强图形(AI-enhanced graphics)将逐渐成为行业标配。不过,这并不意味着传统图形渲染会被取代。Arm 也持续推进传统图形性能的发展。例如,与上一代产品相比,Mali G2-Ultra NX 在现有游戏内容中可实现高达 14% 的性能提升。未来一方面会持续增强 AI 相关功能,另一方面也将不断推进传统图形渲染技术的演进。

 

 

 

Arm G2-Ultra NX 是以软 IP 的形式交付的,部分情况下也可提供硬宏(hard macro)实现方案。通常情况下,合作伙伴获取 RTL 交付后,可以根据自身产品需求决定具体配置,例如着色器核心与 NX 单元的数量配置,不同运行频率以及不同工艺节点。在此基础上,合作伙伴可以自行开展 IP 实现、配置及集成工作,有时甚至还会针对软件驱动进行进一步的优化。因此,合作伙伴并不是直接使用一套固定配置,而是根据自身 SoC 的设计目标进行定制化实现。据悉,小米已经宣布了玄戒 O3 采用Arm G2-Ultra NX。

 

CSS for Mobile 2 建立在 Arm 持续投入 AI 软件生态系统的基础之上,从 KleidiAI 到 Arm 神经图形开发套件(Arm Neural Graphics Development Kit),为开发者提供构建这些全新能力所需的软件和开放接口。全新的 AI Portal 为开发者和智能体提供单一入口,用于发现、评估和使用经过优化的模型、代码和工具。

 

Arm生态团队布局全球,不仅与国际游戏工作室合作,也在积极支持中国本土的游戏引擎和游戏作品。上海工程团队完成了大量软件适配和集成支持工作,他们和 Unity 中国、腾讯游戏、网易等企业都有非常紧密的合作。近期Arm宣布与腾讯游戏开展合作,共同探索神经动态全局光照(Neural Dynamic Global Illumination)等未来技术。