为AI而生!智能体时代,Arm重构移动计算平台

为AI而生!智能体时代,Arm重构移动计算平台
View on original source
Category: SciTech
Share
Archive
Like
9月8日,在上海举办的'Arm Everywhere China'活动上,Arm正式推出第二代移动终端计算子系统CSS for Mobile 2。 这不是一次常规的参数升级,而是Arm围绕'AI原生'理念,面向智能体时代,对移动计算平台的一次系统性重构——从CPU的指令集扩展到GPU的架构革新,从系统互连的延迟优化到软件生态的全链路打通……一切因AI而生,为智能体而来。 智能体时代,需要什么样的移动计算平台? 过去两年,手机上的AI经历了一场身份转变。早期的AI更像随叫随到的助手——翻译对话、抠掉照片里的路人、总结邮件内容,用户问一句,它答一句。而现在,AI正在变成能够主动理解意图、规划步骤、跨应用执行任务的智能体。 这种转变带来了完全不同的负载模式。一个典型的智能体工作流包含四个环节:感知、记忆、推理、行动。这四个环节不是一次性跑完,而是反复循环、多线程并行,甚至多个智能体协同运作,是延迟敏感、突发性强、内存密集且高度异构的。在这个循环里,CPU扮演的是'总指挥'的角色。它负责维护任务状态、整合上下文信息、决定每个阶段该由哪个计算资源来执行——轻量级模型跑在CPU上,大模型可能调用NPU或云端,图形渲染交给GPU,而CPU要把这一切协调起来。 对于广大第三方开发者而言,CPU和GPU这类标准化、通用的计算资源才是主要开发平台。因此,CPU的单线程性能决定了智能体的响应速度,多线程能力决定了多任务并行的效率,而CPU与内存之间的数据通路,则直接影响整个工作流的延迟。 与此同时,移动端的图形负载也在经历一场质变。从2024年开始,虚幻引擎5的Lumen、Nanite、MegaLights等桌面级技术开始向手游渗透,光追复杂度持续攀升——Solar Bay Extreme基准测试中的光追负载比之前高出12倍。跨平台游戏要求手机和PC呈现一致的视觉体验,但手机的散热和电池预算并没有任何改善——这道'功耗墙',成了移动图形技术必须翻越的大山。 CPU侧的智能体编排需求和GPU侧的桌面级画质压力,两股趋势交汇,共同催生了对新一代移动计算平台的需求。CSS for Mobile 2,就是Arm给出的答案。 C2 CPU集群+SME2:为智能体编排而生的算力底座 面对智能体时代的新负载,Arm推出了全新的C2 CPU集群。经典配置为两颗C2-Ultra加六颗C2-Pro,全部支持第二代可伸缩矩阵扩展SME2,并搭配动态共享单元DSU提供L3缓存。 C2-Ultra主打超高单线程性能,负责加快应用启动、UI交互和智能体编排,能够快速响应突发工作负载;C2-Pro则提供稳定持续的性能,适合长时间运行的任务。Arm这次的优化重点非常明确——一切围绕智能体工作流的低延迟和高响应。根据Arm在FPGA平台上的测试,C2 CPU集群相比上一代实现了单线程性能提升15%、多线程提升12%、网页浏览速度提升15%、应用启动速度提升12%。而在AI模型层面,搭载双SME2引擎的C2-Ultra在最新AI模型上的执行性能最高提升1.7倍。如果把智能体工作流拆开来看,每个环节的提升更加具体:语音转文本延迟降低40%,记忆检索和搜索性能提升41%,小语言模型推理速度平均提升25%,涵盖语音、记忆、推理、应用执行和网页浏览的端到端智能体工作流整体提升24%。SME2是这一切的关键。相比上一代,C2 CPU集群集成了双SME2引擎,可配置的SME2单元数也相应增加。除了矩阵运算能力的提升,SME2还新增了查找表指令,CPU可以直接处理位宽更小的权重和激活值,这对2bit等高度压缩的轻量化模型尤其重要。现场演示中,Arm仅用CPU就实现了实时中英互译,模型只有300MB大小、2bit压缩,却能以FP32精度生成高质量语音。生态方面,SME2已经不是实验室技术。目前几乎所有旗舰智能手机——无论安卓还是iOS——均已采用SME2。KleidiAI库集成了超过200个优化微内核,超过100个第三方应用完成了SME2集成,覆盖超过12个AI框架。Arm还与腾讯混元、千问、谷歌等企业合作推进模型优化和框架适配。 Mali G2-Ultra NX:首款AI原生GPU,桌面级画质塞进移动端 如果说C2 CPU集群是智能体的'大脑',那么Mali G2-Ultra NX就是移动端图形的'新引擎'。这是Arm首款AI原生Mali GPU,核心思路是把AI加速能力直接嵌入图形处理管线,而不是作为外挂单元存在。Mali G2-Ultra NX有三大核心组件。第一是神经加速器NX,被直接集成到着色器核心内部,能够在1到2瓦的低功耗下实现高质量神经图形,这种紧密集成可以复用GPU的内存系统和缓存,减少数据搬运。第二是全新执行引擎,这是Arm Mali过去七代产品中规模最大的一次指令集架构重构,面向UE5的Nanite和Lumen等桌面级技术打造,每个线程束的寄存器数量比上一代多2倍。第三是第三代硬件光追单元,支持全场景照明和阴影,采用更紧凑的光线-三角形数据结构,在主流光追基准测试中可将DRAM流量最多降低13%。真正让这款GPU与众不同的,是三大神经图形技术的落地。神经超级采样NSS通过低分辨率渲染结果重建高分辨率图像,只需要渲染四分之一甚至八分之一的像素,其余由AI补全;神经帧率提升NFRU通过生成中间帧把帧率翻倍,30fps的渲染输入可以输出60fps的流畅画面;神经超级采样与降噪NSSD则把超分和降噪结合,专门应对光追场景中减少光线数量后产生的大量噪点。 这些技术不是PPT概念。Arm与Sumo Digital基于虚幻引擎5.5联合打造的游戏《光影新生》,首次在移动端实现了MegaLights全动态光照——最多1400盏动态光源,完全不需要预烘焙光照。在GPU功耗约2瓦的情况下,这款游戏可以稳定运行60fps,能效提升4倍,DRAM流量降低多达70%。 传统图形性能同样没有掉队。基准测试平均性能提升20%,非AI游戏性能提升14%。Arm还引入了硬件不透明度微贴图OMM,专门处理植被、头发、皮毛等大量透明几何体,在演示中可使帧率提升30%,同时将光追工作负载最多降低70%。 SI L2+LPDDR6:系统级互连与存储优化,打通智能体内存瓶颈 再强的CPU和GPU,如果数据喂不上去,性能也发挥不出来。智能体工作流延迟敏感、突发性强、内存密集,而且高度异构——数据可能在CPU、GPU、NPU和云端之间来回流动。这对系统互连和内存子系统提出了远超以往的要求:低延迟、高带宽、一致性、QoS流量管理、安全性,缺一不可。CSS for Mobile 2采用了全新的SI L2系统互连,基于面向移动设备优化的通道化互连架构。它包含片上网络NoC、一级内存管理单元MMU L1、内存控制器MCN和系统级缓存SLC等组件,将C2 CPU集群和Mali G2-Ultra NX连接到统一内存,实现CPU和GPU对同一块内存地址空间的一致性访问。这种统一内存架构的好处是,数据不需要在不同计算引擎的地址空间之间来回拷贝,既降低了延迟,也节省了功耗。 SI L2完整支持LPDDR6,能够实现统一内存的高带宽访问。LPDDR6作为新一代移动内存标准,在带宽和能效上相比LPDDR5X有显著提升——小米玄戒O3上的LPDDR6带宽达到113.8GB/s,比LPDDR5X提升48%。高带宽对于智能体工作流至关重要,因为记忆检索、模型推理等环节都需要频繁访问内存中的大量数据。最直观的提升是延迟。相比上一代SI L1,SI L2将CPU访问DRAM的延迟降低了约45%。在内存访问中,每一纳秒都很重要——尤其是对智能体这种对延迟极度敏感的工作负载而言,更快的内存访问意味着更快的上下文检索和更短的推理等待。 除了延迟和带宽,SI L2还在多个维度做了优化。硬件一致性方面,SI L2提供高效且可扩展的硬件一致性,简化了软件编程模型。QoS方面,SI L2具备高级服务质量功能,能够针对CPU、GPU、设备等不同来源的流量配置差异化的优先级和带宽分配,确保智能体的关键任务不会被后台任务阻塞。 软件生态:从模型到工具,真正赋能开发者 强大的硬件之外,软件生态决定了这些能力能不能被开发者更好的调用起来,这也成为此次发布的CSS for Mobile 2的一个重要特征。 Arm在这生态方面的布局可以用'一个入口、两套体系'来概括。一个入口是Arm AI Portal。这是一个统一的AI开发平台,汇聚了经过优化和验证的预训练模型、性能与准确性数据、代码示例和部署资源。开发者可以在上面发现、评估、优化模型,并快速集成到应用中。对于智能体开发者,Arm还提供了MCP服务器,可以直接嵌入到Cursor、Codex等开发环境中,让智能体自主完成模型选择和调用。 两套体系分别面向CPU和GPU。CPU侧,KleidiAI与PyTorch ExecuTorch、Google LiteRT、阿里MNN、微软ONNX Runtime等主流AI框架深度集成,开发者无需改变现有流程就能释放SME2的底层能力。GPU侧,Arm推出了神经图形开发套件,支持Vulkan机器学习扩展和虚幻引擎等主流游戏引擎插件,同时提供SDK供自定义引擎集成。所有神经图形模型都已在Hugging Face和GitHub上开源,开发者可以基于自己的游戏内容重新训练模型。 这种开放策略在移动端尤为重要。手机形态多样,不同产品在性能、功耗和散热方面的要求千差万别,封闭的黑盒方案很难适配所有场景。Arm把模型和工具交给开发者,让他们根据自身需求做定制化优化。 KleidiAI、主流 AI 框架集成以及 Arm AI Portal共同打通了从硬件到软件的开发链路,将 Arm CSS for Mobile 2 的平台能力与开发者所使用的AI模型和软件工具紧密连接,帮助开发者打造更加强大、更智能的端侧 AI 体验。 结语 从C2 CPU集群的智能体编排,到Mali G2-Ultra NX的AI原生图形,从SI L2 的系统级IP,到AI Portal 与开源生态的开发者赋能,每一个组件都在回应同一个命题:让智能体 AI 和桌面级画质在手机的功耗约束下真正落地。整体而言,CSS for Mobile 2不是一次常规的参数升级,而是Arm围绕'AI 原生'理念对移动计算平台的一次系统性重构,也是面向智能体时代对于移动计算平台架构的一次重塑。目标则是让智能体AI和AI原生图形在移动端实现真正落地。 当越来越多的智能体在手机上感知、记忆、推理、行动,CSS for Mobile 2,将成为它们最坚实的底座。

(0)Comments

 

A note on cookies

Newshunt uses essential cookies to keep you signed in and to remember your language and country, so the site works the way you expect. With your permission, we'd also like to use analytics cookies to understand how people use Newshunt and improve it over time.

Accepting only affects analytics. To learn more, view our Privacy Policy or Terms & Conditions.