Arm发布CSS for Mobile 2:GPU唱主角_手机网易网

Arm发布CSS for Mobile 2:GPU唱主角_手机网易网
View on original source
Category: SciTech
Share
Archive
Like
今天去了趟上海的Arm Everywhere China,Arm发布了新一代AI原生计算平台,说实话这种芯片计算平台的发布特别硬核,实在是考验我的吸收理解能力,我尽量写通俗一些,让大家都能看懂。 一年前,Arm Unlocked上海站的主角是Lumex CSS,这是Arm第一代面向手机的计算子系统,把CPU、GPU、系统互联和软件做成一个完整平台交给芯片厂,不再是一个个单独的IP核。 今天,Arm发布了第二代移动终端计算子系统(CSS for Mobile 2),也就是去年Lumex的第二代。 打开网易新闻 查看精彩图片 只看参数表的话,这是一次标准意义上的年度升级,CPU单线程提升15%,GPU基准性能最高提升24%。 不过,一整天的活动听下来,我越来越确定一件事,GPU才是Arm今年真正想讲的故事。 Lumex今年改成了CSS for Mobile 2,有人可能会疑惑为什么换名字,我们特地问了Arm这个问题,其实是有意为之,改名就是为了简化命名体系,CSS for Mobile表意清晰,一看就知道是针对移动领域的平台,与之相比,此前COMPUTEX上还发布了CSS for PC,这样大家一眼就能看清每个平台针对哪个品类。 名字变了背后,是Arm在交付方式上向前迈了一步,前文有提到,以前Arm交付的是单个IP核,芯片厂商自己拿回去组合,从Lumex开始,甚至从Arm CSS for Client开始,Arm在IP授权的基础上,又多了一种选择,即把CPU、GPU、系统互连、物理实现、软件工具链预先整合好,做成一个完整平台交给芯片厂商。 打开网易新闻 查看精彩图片 要特别说明的是,这不是捆绑销售,合作伙伴既可以整套采用CSS平台,也可以单独选用其中某个组件,还可以和自研或第三方IP结合,根据产品定位、性能目标和市场需求灵活搭配。 大家可以理解为CSS提供的是一个经过系统级优化的参考方案,用不用、用多少,主动权在客户手里。 CSS for Mobile 2的三大件分别是C2 CPU集群、Mali G2-Ultra NX GPU和SI L2系统互连,而这三大件的设计,都围绕同一个原点:智能体。 Arm认为,手机上的AI正在从问答助手变成能自主完成任务的智能体,而智能体的工作流可以拆成四步: 第一步是感知,听懂用户在说什么、理解意图; 第二步是记忆,调取日历、照片、偏好等上下文信息; 第三步是推理,根据已知信息规划下一步该做什么、生成结构化指令; 第四步是行动,调用对应的App或服务把事情办完。 当然,全程还有一个编排层在调度,决定每一步该跑在哪个计算资源上,CPU就是这个体系的编排调度中心,C2 CPU集群集成了双SME2引擎,就是专门用来跑轻量级AI任务的。 打开网易新闻 查看精彩图片 按Arm官方的说法,轻量模型通常指20亿至30亿参数规模,比如Gemma-2B、腾讯混元HY-1.8B-2Bit,这个规模的模型放在CPU上跑,延迟比NPU还低,而且跨平台兼容性好。 具体参数方面,最新AI模型性能最高提升1.7倍,语音转文本延迟降低40%,单线程性能提升15%。这些提升贯穿智能体工作流的各个环节,比如更快的语音处理缩短交互起始延迟,更快的记忆检索让智能体迅速调取上下文,更快的推理速度让决策更及时等。 值得一提的是,目前vivo X300系列、OPPO Find X9系列、三星S26系列,包括iPhone等几乎所有旗舰手机,都已经采用了SME2技术,这意味着Arm在CPU端的AI能力已经实现了大规模落地。 说完CPU,来说说今年的重头戏:GPU。 当前手机游戏的画面越来越复杂,高分辨率、高帧率、大世界、光线追踪,每一项都在增加GPU的工作量。而手机的功耗预算就那么多,散热空间也有限,GPU的性能增长追不上游戏复杂度的增长,这是所有手机GPU厂商都要面对的一堵墙。 Arm的解法是Mali G2-Ultra NX,这个名字里的'NX',就是Neural Accelerators(神经网络加速器)的意思。 打开网易新闻 查看精彩图片 从这就可以看出,Arm做了一个和很多厂商不同的选择,没有把AI加速器做成独立的NPU放在GPU旁边,而是直接集成进了着色器核心内部。 这个设计的好处是数据不用在GPU和NPU之间来回搬运,神经图形任务和渲染任务可以并行跑,共享GPU的内存系统和缓存,延迟更低、效率更高。而且这部分加速器面积极小,带电源门控,不用的时候直接关掉不耗电。 其实就像两个人一起拼乐高,如果一个在客厅、一个在卧室,零件要来回传递,效率很低;如果两个人坐在同一张桌子前,共享一个零件盒,随时能看到对方拼到哪了,配合起来就快得多。 基于NX加速器,Arm带来了三项神经图形技术: 神经超级采样(NSS):GPU 先渲染低分辨率画面,再用神经网络重建到高分辨率,最高提升2倍 FPS,外部内存流量降低50%。 神经帧率提升(NFRU):在两帧之间生成AI中间帧,支撑120 FPS持续游戏,DRAM流量降低33%。 神经超级采样与降噪(NSSD):把超分和降噪结合,专门用于复杂光追场景,在低采样率的光追画面上同时提升分辨率和去除噪点。 打开网易新闻 查看精彩图片 说到这里难免有人会问:这和NVIDIA的DLSS有什么区别? Arm也很坦诚,直言不讳表示底层要实现的场景确实高度相似,超分、帧生成、降噪,但手机必须在功耗和散热约束下重新设计整套东西,所以Arm的模型更小更省电,而且是开放的,手机厂商验证之后可以按自己的产品需求修改和定制,目前Arm正与腾讯游戏合作探索神经动态全局光照等下一代技术。 说白了,移动端再怎么堆料,在绝对画质方面肯定比不过桌面显卡,但我认为Arm的方向是对的,在手机个位数性能释放的功耗预算里,用AI来补画面,确实是一条'曲线救国'路。 说了这么多AI,不如实际跑跑看效果。 在Arm Everywhere China上,Arm展现了和Sumo Digital基于虚幻引擎5.5联合打造了一款叫《光影新生》demo,支持MegaLights,场景内最多1400盏动态光源,光照与阴影全部为光线追踪实时计算,没有预烘焙,实际效果非常惊艳。 打开网易新闻 查看精彩图片 作为参考,它原来只有15 FPS,但在Mali G2-Ultra NX平台上跑到了持续60 FPS,相当于帧率最高4倍的提升,同时DRAM流量还最多降低了70%。 如果以为G2-Ultra NX只靠AI,那就小看它了,这一代GPU在传统渲染上也有实打实的提升,主要有两项关键升级。 其中一个是全新的执行引擎,这是Mali七代产品以来最大的指令集架构升级,每个线程束的寄存器数量比上一代多了一倍,支持动态寄存器分配。 在面对UE5 Nanite和Lumen这类越来越复杂的着色器程序,寄存器翻倍能有效减少溢出到内存的情况,让大着色器更高效地运行。 另一个是第三代光线追踪单元,采用了更紧凑的光线-三角形数据结构,光追基准测试的DRAM流量降低13%。同时硬件支持不透明度微贴图(OMM),能高效处理植被、织物这类透明几何体,演示中帧率提升30%,光追负载降低70%。 打开网易新闻 查看精彩图片 硬件能力到位了,开发者能不能方便地用上才是关键,Arm在这方面也做了不少铺垫。 针对开发者生态,Arm推出了神经图形开发套件(Arm Neural Graphics Development Kit),目前NSS和NFRU模型已经在Hugging Face和GitHub上开放。 国内大厂的合作进展也很快,腾讯Magic Dawn、Unity中国团结引擎已集成;网易《燕云十六声》今年将推出NSS版本,腾讯《暗区突围:无限》、叠纸的《无限暖暖》也在集成中。另外据小米官方信息,玄戒O3也采用了G2-Ultra NX。 还是那句话,AI不是万能的,神经图形更像是一个工具,用在什么场景、用到什么程度,最终还是开发者说了算。 一整天活动下来,有两点观察想和大家分享。 第一、神经图形在移动端确实到了可用的节点,模型、插件、demo都有了,还有明确的接入周期和国内厂商的适配名单,这些都是技术从概念走向落地的信号。当然最终效果还要看量产机型和实际游戏,但至少路径我觉得是清晰的,不再是PPT上的画饼。 第二是关于CSS平台模式的一点思考,Arm把CPU、GPU、互连、软件整合得越来越深,那各家终端的差异化从哪里来? 针对这个问题,Arm也对雷科技表示,平台解决的是基础能力的下限, 保证每一家采用CSS 的芯片都能达到不错的性能、能效和兼容性,而差异化交给合作伙伴在平台上做,核心数量、频率、工艺节点、自研IP的混接,都由厂商自己决定。 相当于Arm的平台化不是要把厂商变成贴牌工厂,而是把重复造轮子的工作交给自己,让厂商把精力放在真正能体现差异的地方。 以上就是我在Arm Everywhere China的所见所闻,至于Arm这种模式能不能走通,等量产机型出来就会有答案了。 特别声明:本文为网易自媒体平台'网易号'作者上传并发布,仅代表该作者观点。网易仅提供信息发布平台。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

(0)Comments

 

A note on cookies

Newshunt uses essential cookies to keep you signed in and to remember your language and country, so the site works the way you expect. With your permission, we'd also like to use analytics cookies to understand how people use Newshunt and improve it over time.

Accepting only affects analytics. To learn more, view our Privacy Policy or Terms & Conditions.