为AI而生!智能体时代,Arm重构移动计算平台

来源:爱集微 #arm# #CSS# #智能体#
558

9月8日,在上海举办的“Arm Everywhere China”活动上,Arm正式推出第二代移动终端计算子系统CSS for Mobile 2。

这不是一次常规的参数升级,而是Arm围绕“AI原生”理念,面向智能体时代,对移动计算平台的一次系统性重构——从CPU的指令集扩展到GPU的架构革新,从系统互连的延迟优化到软件生态的全链路打通……一切因AI而生,为智能体而来。

智能体时代,需要什么样的移动计算平台?

过去两年,手机上的AI经历了一场身份转变。早期的AI更像随叫随到的助手——翻译对话、抠掉照片里的路人、总结邮件内容,用户问一句,它答一句。而现在,AI正在变成能够主动理解意图、规划步骤、跨应用执行任务的智能体。

这种转变带来了完全不同的负载模式。一个典型的智能体工作流包含四个环节:感知、记忆、推理、行动。这四个环节不是一次性跑完,而是反复循环、多线程并行,甚至多个智能体协同运作,是延迟敏感、突发性强、内存密集且高度异构的。

在这个循环里,CPU扮演的是“总指挥”的角色。它负责维护任务状态、整合上下文信息、决定每个阶段该由哪个计算资源来执行——轻量级模型跑在CPU上,大模型可能调用NPU或云端,图形渲染交给GPU,而CPU要把这一切协调起来。

对于广大第三方开发者而言,CPU和GPU这类标准化、通用的计算资源才是主要开发平台。因此,CPU的单线程性能决定了智能体的响应速度,多线程能力决定了多任务并行的效率,而CPU与内存之间的数据通路,则直接影响整个工作流的延迟。

与此同时,移动端的图形负载也在经历一场质变。从2024年开始,虚幻引擎5的Lumen、Nanite、MegaLights等桌面级技术开始向手游渗透,光追复杂度持续攀升——Solar Bay Extreme基准测试中的光追负载比之前高出12倍。跨平台游戏要求手机和PC呈现一致的视觉体验,但手机的散热和电池预算并没有任何改善——这道“功耗墙”,成了移动图形技术必须翻越的大山。

CPU侧的智能体编排需求和GPU侧的桌面级画质压力,两股趋势交汇,共同催生了对新一代移动计算平台的需求。CSS for Mobile 2,就是Arm给出的答案。

C2 CPU集群+SME2:为智能体编排而生的算力底座

面对智能体时代的新负载,Arm推出了全新的C2 CPU集群。经典配置为两颗C2-Ultra加六颗C2-Pro,全部支持第二代可伸缩矩阵扩展SME2,并搭配动态共享单元DSU提供L3缓存。

C2-Ultra主打超高单线程性能,负责加快应用启动、UI交互和智能体编排,能够快速响应突发工作负载;C2-Pro则提供稳定持续的性能,适合长时间运行的任务。Arm这次的优化重点非常明确——一切围绕智能体工作流的低延迟和高响应。

根据Arm在FPGA平台上的测试,C2 CPU集群相比上一代实现了单线程性能提升15%、多线程提升12%、网页浏览速度提升15%、应用启动速度提升12%。而在AI模型层面,搭载双SME2引擎的C2-Ultra在最新AI模型上的执行性能最高提升1.7倍。

如果把智能体工作流拆开来看,每个环节的提升更加具体:语音转文本延迟降低40%,记忆检索和搜索性能提升41%,小语言模型推理速度平均提升25%,涵盖语音、记忆、推理、应用执行和网页浏览的端到端智能体工作流整体提升24%。

SME2是这一切的关键。相比上一代,C2 CPU集群集成了双SME2引擎,可配置的SME2单元数也相应增加。除了矩阵运算能力的提升,SME2还新增了查找表指令,CPU可以直接处理位宽更小的权重和激活值,这对2bit等高度压缩的轻量化模型尤其重要。现场演示中,Arm仅用CPU就实现了实时中英互译,模型只有300MB大小、2bit压缩,却能以FP32精度生成高质量语音。

生态方面,SME2已经不是实验室技术。目前几乎所有旗舰智能手机——无论安卓还是iOS——均已采用SME2。KleidiAI库集成了超过200个优化微内核,超过100个第三方应用完成了SME2集成,覆盖超过12个AI框架。Arm还与腾讯混元、千问、谷歌等企业合作推进模型优化和框架适配。

Mali G2-Ultra NX:首款AI原生GPU,桌面级画质塞进移动端

如果说C2 CPU集群是智能体的“大脑”,那么Mali G2-Ultra NX就是移动端图形的“新引擎”。这是Arm首款AI原生Mali GPU,核心思路是把AI加速能力直接嵌入图形处理管线,而不是作为外挂单元存在。

Mali G2-Ultra NX有三大核心组件。第一是神经加速器NX,被直接集成到着色器核心内部,能够在1到2瓦的低功耗下实现高质量神经图形,这种紧密集成可以复用GPU的内存系统和缓存,减少数据搬运。第二是全新执行引擎,这是Arm Mali过去七代产品中规模最大的一次指令集架构重构,面向UE5的Nanite和Lumen等桌面级技术打造,每个线程束的寄存器数量比上一代多2倍。第三是第三代硬件光追单元,支持全场景照明和阴影,采用更紧凑的光线-三角形数据结构,在主流光追基准测试中可将DRAM流量最多降低13%。

真正让这款GPU与众不同的,是三大神经图形技术的落地。神经超级采样NSS通过低分辨率渲染结果重建高分辨率图像,只需要渲染四分之一甚至八分之一的像素,其余由AI补全;神经帧率提升NFRU通过生成中间帧把帧率翻倍,30fps的渲染输入可以输出60fps的流畅画面;神经超级采样与降噪NSSD则把超分和降噪结合,专门应对光追场景中减少光线数量后产生的大量噪点。

这些技术不是PPT概念。Arm与Sumo Digital基于虚幻引擎5.5联合打造的游戏《光影新生》,首次在移动端实现了MegaLights全动态光照——最多1400盏动态光源,完全不需要预烘焙光照。在GPU功耗约2瓦的情况下,这款游戏可以稳定运行60fps,能效提升4倍,DRAM流量降低多达70%。

传统图形性能同样没有掉队。基准测试平均性能提升20%,非AI游戏性能提升14%。Arm还引入了硬件不透明度微贴图OMM,专门处理植被、头发、皮毛等大量透明几何体,在演示中可使帧率提升30%,同时将光追工作负载最多降低70%。

SI L2+LPDDR6:系统级互连与存储优化,打通智能体内存瓶颈

再强的CPU和GPU,如果数据喂不上去,性能也发挥不出来。智能体工作流延迟敏感、突发性强、内存密集,而且高度异构——数据可能在CPU、GPU、NPU和云端之间来回流动。这对系统互连和内存子系统提出了远超以往的要求:低延迟、高带宽、一致性、QoS流量管理、安全性,缺一不可。

CSS for Mobile 2采用了全新的SI L2系统互连,基于面向移动设备优化的通道化互连架构。它包含片上网络NoC、一级内存管理单元MMU L1、内存控制器MCN和系统级缓存SLC等组件,将C2 CPU集群和Mali G2-Ultra NX连接到统一内存,实现CPU和GPU对同一块内存地址空间的一致性访问。这种统一内存架构的好处是,数据不需要在不同计算引擎的地址空间之间来回拷贝,既降低了延迟,也节省了功耗。

SI L2完整支持LPDDR6,能够实现统一内存的高带宽访问。LPDDR6作为新一代移动内存标准,在带宽和能效上相比LPDDR5X有显著提升——小米玄戒O3上的LPDDR6带宽达到113.8GB/s,比LPDDR5X提升48%。高带宽对于智能体工作流至关重要,因为记忆检索、模型推理等环节都需要频繁访问内存中的大量数据。

最直观的提升是延迟。相比上一代SI L1,SI L2将CPU访问DRAM的延迟降低了约45%。在内存访问中,每一纳秒都很重要——尤其是对智能体这种对延迟极度敏感的工作负载而言,更快的内存访问意味着更快的上下文检索和更短的推理等待。

除了延迟和带宽,SI L2还在多个维度做了优化。硬件一致性方面,SI L2提供高效且可扩展的硬件一致性,简化了软件编程模型。QoS方面,SI L2具备高级服务质量功能,能够针对CPU、GPU、设备等不同来源的流量配置差异化的优先级和带宽分配,确保智能体的关键任务不会被后台任务阻塞。

软件生态:从模型到工具,真正赋能开发者

强大的硬件之外,软件生态决定了这些能力能不能被开发者更好的调用起来,这也成为此次发布的CSS for Mobile 2的一个重要特征。

Arm在这生态方面的布局可以用“一个入口、两套体系”来概括。

一个入口是Arm AI Portal。这是一个统一的AI开发平台,汇聚了经过优化和验证的预训练模型、性能与准确性数据、代码示例和部署资源。开发者可以在上面发现、评估、优化模型,并快速集成到应用中。对于智能体开发者,Arm还提供了MCP服务器,可以直接嵌入到Cursor、Codex等开发环境中,让智能体自主完成模型选择和调用。

两套体系分别面向CPU和GPU。CPU侧,KleidiAI与PyTorch ExecuTorch、Google LiteRT、阿里MNN、微软ONNX Runtime等主流AI框架深度集成,开发者无需改变现有流程就能释放SME2的底层能力。GPU侧,Arm推出了神经图形开发套件,支持Vulkan机器学习扩展和虚幻引擎等主流游戏引擎插件,同时提供SDK供自定义引擎集成。所有神经图形模型都已在Hugging Face和GitHub上开源,开发者可以基于自己的游戏内容重新训练模型。

这种开放策略在移动端尤为重要。手机形态多样,不同产品在性能、功耗和散热方面的要求千差万别,封闭的黑盒方案很难适配所有场景。Arm把模型和工具交给开发者,让他们根据自身需求做定制化优化。

KleidiAI、主流 AI 框架集成以及 Arm AI Portal共同打通了从硬件到软件的开发链路,将 Arm CSS for Mobile 2 的平台能力与开发者所使用的AI模型和软件工具紧密连接,帮助开发者打造更加强大、更智能的端侧 AI 体验。

结语

从C2 CPU集群的智能体编排,到Mali G2-Ultra NX的AI原生图形,从SI L2 的系统级IP,到AI Portal 与开源生态的开发者赋能,每一个组件都在回应同一个命题:让智能体 AI 和桌面级画质在手机的功耗约束下真正落地。

整体而言,CSS for Mobile 2不是一次常规的参数升级,而是Arm围绕“AI 原生”理念对移动计算平台的一次系统性重构,也是面向智能体时代对于移动计算平台架构的一次重塑。目标则是让智能体AI和AI原生图形在移动端实现真正落地。

当越来越多的智能体在手机上感知、记忆、推理、行动,CSS for Mobile 2,将成为它们最坚实的底座。

责编: 姜羽桐
来源:爱集微 #arm# #CSS# #智能体#
THE END

*此内容为集微网原创,著作权归集微网所有,爱集微,爱原创

关闭
加载

PDF 加载中...