VicroCode
让代码创造价值
VicroCode是一个轻量级代码在线发布、交易平台,开箱即用,免部署、免服务器、免备案,支持接入智能体、通用管理系统、游戏等多种项目
稍候片刻,您可先学习AI编程手册
正在加载中...

市场信息

智能体时代的移动计算,Arm 通过一场大会给出自己的答案

9 月 8 日,Arm 在上海举办年度旗舰活动 Arm Everywhere China,并在会上发布了第二代移动终端计算子系统 CSS for Mobile 2。 这是一个面向智能体 AI 与 AI 原生图形的计算平台,集成了 Arm C2 CPU 集群、Mali G2-Ultra NX GPU 以及 SI L2 系统互连,同时将系统 IP、软件和开发者工具整合为完整平台。

www.ithome.com · 2026-09-11T11:08:55+00:00

9 月 8 日,Arm 在上海举办年度旗舰活动 Arm Everywhere China,并在会上发布了第二代移动终端计算子系统 CSS for Mobile 2。这是一个面向智能体 AI 与 AI 原生图形的计算平台,集成了 Arm C2 CPU 集群、Mali G2-Ultra NX GPU 以及 SI L2 系统互连,同时将系统 IP、软件和开发者工具整合为完整平台。

如果只看新计算平台的命名,CSS for Mobile 2 看起来就是一次常规的更新迭代。但听完整场发布、又在采访中和 Arm 高管们聊过技术细节后,小编对于这次的新平台又有了新的认知。

CSS for Mobile 2 每一项技术细节的升级,Arm 其实都在回答一个更根本的问题:当 AI 从问答助手进化成能理解意图、规划任务、替用户干活的智能体,手机里的计算平台该长什么样。 Arm 的判断是,移动设备的性能取决于三个核心维度 —— 各任务阶段的执行速度、数据在不同计算引擎间的传输效率,以及系统对全任务流程的协同调度。

CSS for Mobile 2 据此从系统层面统筹优化,并把优化延伸到物理实现阶段,让合作伙伴在 SoC 集成之前就能把功耗、性能和面积与架构设计放在一起考量。组件上保留了弹性,可整套采用,也可与自研或第三方 IP 组合。

这背后其实是 Arm CSS 一贯的思路:把底层计算技术做成集成化、经过验证、可灵活配置的计算基础。换句话说,合作伙伴不必再把大量时间和工程资源耗在底层技术的整合上,而是可以站在 CSS 之上,把资源投向真正能形成差异化的地方 —— 自己的加速器、内存架构、互连技术、系统技术和软件能力,针对自己的目标市场和工作负载打造定制化芯片。

底层少走了弯路,开发进程更快、复杂性更低,差异化创新自然能更快推向市场,同时还能充分借力 Arm 生态系统的优势。下面我们具体来看。

C2 CPU 集群:双 SME2 与编排引擎 如今,智能体不再只是执行推理,还要保持上下文、运行应用、协调不同模型与服务,并在用户授权下自主完成任务,而这一切都得装进手机的功耗和散热约束里。手机里的计算任务,从“回答一个问题”变成了“独立跑完一整套流程”。

Arm 认为,在这条流程中,CPU 被重新定义为系统的编排引擎,负责维护上下文、调度负载、协调任务。新的 C2 CPU 集群由 Arm 迄今最强的移动 CPU C2-Ultra、面向能效的 C2-Pro 和双 SME2 引擎组成。

全新 CPU 集群在面对最新 AI 模型性能最高提升 1.7 倍,单线程性能提升 15%,相同性能下功耗最多降低 38%。进一步来看,在跑 Moonshine 和 Parakeet 语音转文本模型时,C2-Ultra 比上一代 C1-Ultra 延迟降低 40%,直接缩短智能体“开口回应”前的等待; 记忆阶段的内存检索性能提升 41%,推理阶段小语言模型生成指令的平均速度提升 25%。

端到端算总账,整条工作流性能提升 24%。这里需要解释一下的是,上面的 15% 来自 GeekBench 6.3 这类通用基准,1.7 倍对应特定 AI 模型上的矩阵运算吞吐,功臣是 SME2—— 这一代把 SME2 引擎从一颗增加到两颗,矩阵算力翻倍,才有这个量级的跃升。

此外,这一代平台还可以支持 2nm 等更前沿的工艺节点,合作伙伴也可以在更先进工艺上部署更多 SME2 单元,为未来留出进一步的性能空间。看到这,可能有朋友会好奇,这几年手机厂商都在卷 NPU 的 TOPS,智能体时代到来后,竞争中心是不是又回到了 CPU 和内存系统?

在采访中,也有媒体问了这个问题。对此 Arm 边缘 AI CPU 产品管理总监 Daniel Lu 的回答是,过去十年行业对不同负载的侧重一直随计算需求演进,永远在为不同设备和场景寻找最合适的算力平衡点。

当前旗舰 NPU 算力约 100 到 200 TOPS,搭载 SME 的 CPU 集群等效算力约 5 到 6 TOPS,计算密度极高的负载更适合交给 GPU 或 NPU,CPU 的战场是那些装得进本地算力预算的小语言模型。他特别强调 CPU 看重延迟而非峰值,一味追峰值反而可能拖累延迟。

此外,为了应对端侧普遍存在的内存密集型瓶颈,C2 CPU 集群采用了差异化的拓扑架构,私有 L2 缓存加上大容量共享 L3 缓存,通过两级缓存的容量优势减少访问 DRAM 的频次。 Daniel Lu 坦言,端侧内存密集型的问题其实比计算密集型更严峻,缓存拓扑是他们应对这一挑战的核心手段。

还有一个容易被忽略的角色是编排层。它负责维护任务状态、整合上下文,并决定工作流的每个阶段交给哪个计算资源,可能是本地应用、端侧模型,也可能是云端服务。

CPU 在其中统一协调权限管理和任务执行。进入智能体时代后,CPU 的角色已经从单纯的算得快,变成了管得好。

关于核心数量,Daniel Lu 透露 C2 CPU 集群最高可支持 14 个核心,合作伙伴可以根据实际工作负载灵活选择。有些合作伙伴评估后认为智能体工作负载至少需要十个核心,就会选十核配置。

Arm 并不替客户做决定,而是把灵活性交给他们。 SME2 的生态采用也在加速。

Arm 边缘 AI 智能终端计算副总裁 James McNiven 介绍道,目前几乎所有旗舰智能手机,无论安卓还是 iOS,都已采用 SME2 技术。围绕 SME2 构建的生态包括支付宝、Google AI Edge Gallery、OPPO 和 vivo 等。

阿里巴巴通义千问也在活动上展示了 Qwen-Audio 家族如何借助 Arm CPU 和 SME2 在端侧高效运行,为高质量语音生成提供所需的性能与精度。 Mali G2-Ultra NX:AI 原生图形架构,把神经网络嵌进着色器 说完 CPU,再看 GPU。

Mali G2-Ultra NX 是 Arm 首款 AI 原生 Mali GPU,最大的变化是把专用神经网络加速器直接嵌入了 GPU 着色器核心。这样神经图形工作负载可以和图形、计算任务并行运行,同时复用 GPU 的内存系统、一致性缓存和控制结构,减少数据在不同计算单元之间的搬运。

Arm 边缘 AI 高级产品经理 Deyan Lazarov 在采访中特意澄清了一个技术细节,他们用的是卷积神经网络,不是 Transformer。这套系统并不是像大语言模型那样凭空生成画面,而是从 GPU 渲染出的真实画面出发,用 CNN 做超分辨率和细节补全。

如果游戏有独特的美术风格,开发者还可以基于自己的游戏内容重新训练模型。 Mali G2-Ultra NX 支持三项神经网络加速技术。

其中神经超级采样 NSS 从低分辨率画面重建高分辨率图像;神经帧率提升 NFRU 通过生成中间帧提高帧率;神经超级采样与降噪 NSSD 则把超分和降噪结合,面向复杂光线追踪场景。在 Arm 与 Sumo Digital 基于虚幻引擎联合打造的演示游戏《光影新生》中,NFRU 与 NSSD 方案相比传统渲染实现了最高 4 倍的性能效率提升,外部内存流量降低多达 70%,也让虚幻引擎 MegaLights 等技术得以应用于移动设备。

对于大家可能比较关心的延迟问题,Deyan Lazarov 算了一笔账。以 30FPS 为例,单帧时间预算约 33 毫秒,开发者需要在这个窗口内既完成原始帧渲染,又完成 AI 生成帧插入,从而在 30FPS 的时间预算内输出 60FPS 的效果,同时配合帧步调方案应对渲染时间的波动。

目前这一代 NFRU 只支持在两个渲染帧之间生成一帧 AI 重建帧,但 Arm 已经规划了更丰富的路线图来扩展多帧生成能力。为了给开发者更多权衡空间,Arm 还引入了不同质量等级的模型,开发者可以在画质和性能之间灵活选择。

Deyan Lazarov 说,《光影新生》本身就采用低分辨率渲染,在生成帧流程中完成分辨率放大和重建,渲染压力大时还可以进一步降低原始渲染分辨率。传统图形性能也没有被忽视。

全新执行引擎是 Arm Mali 过去七代产品中规模最大的指令集架构升级,每个线程束的寄存器数量比上一代多达 2 倍,并采用动态寄存器分配减少溢出。第三代光线追踪单元对不透明度微贴图提供硬件级支持,使用 OMM 可使帧率提升 30%,光线追踪工作负载最多降低 70%。

与上一代相比,基准测试性能最高提升 24%,非 AI 游戏性能最高提升 14%,光线追踪场景下 DRAM 流量最多降低 13%,可支持最高 120 帧每秒的稳定运行。在采访中,也有媒体问到了与桌面端帧生成技术的对比。

James McNiven 坦言手机毕竟不同于 PC,受限于功耗和散热,可用资源有限,因此必须针对移动平台做专门的架构设计和优化。 Arm 的另一个不同点是开放策略,模型是开放的,手机厂商在验证后可以根据自身产品需求进一步优化和定制。

近期 Arm 还宣布与腾讯游戏开展合作,共同探索神经动态全局光照等未来技术。最后,SI L2 系统互连是整个平台的粘合剂,支持 LPDDR6、LPDDR5X 和 LPDDR5 等多种内存标准,在缓存一致性和大模型优化方面相比上一代有明显提升。

James McNiven 表示,Arm 的工作就是确保各类新型内存标准推出时 SI L2 都能高效适配。如果合作伙伴没有采用 SI L2,他们大概率也会通过类似的系统级优化来降低延迟、支持新内存类型。

芯片之外,一张让智能无处不在的网 单看硬件,CSS for Mobile 2 平台已经足够完整,不过关注行业的朋友可能还会进一步思考,除了技术本身之外,CSS for Mobile 2 这样的平台,究竟如何赋能当前的 AI 行业? Arm 执行副总裁兼首席商务官 Will Abbey 在活动开场给出了一个宏观数字,Arm 全球合作伙伴累计出货的基于 Arm 技术的芯片已超过 3500 亿颗。

这个体量意味着,任何发生在 Arm 架构上的技术演进,都会迅速扩散到海量终端设备中。 CSS for Mobile 2 正是在这样一个基数上,为智能体时代的边缘计算提供了一个统一的底座。

软件生态是 Arm 赋能边缘 AI 的关键支点。 CSS for Mobile 2 依托全球超过 2200 万的 Arm 开发者社区,通过 KleidiAI 与主流 AI 框架的深度集成,为 Arm CPU 提供优化的软件执行路径,开发者不需要改变现有开发流程就能利用 SME2 等底层能力。

Arm AI Portal 则在统一平台汇聚经过优化和验证的模型、性能数据、代码示例及部署资源,Arm MCP 服务器将这些能力引入智能体 AI 开发环境,帮助开发者加快从评估到部署的流程。产业合作方面,CSS for Mobile 2 已经获得了广泛的生态响应。

支付宝、OPPO 和 vivo 等合作伙伴已采用 SME2 技术; 神经网络图形技术方面,Arm 与叠纸游戏、网易、腾讯游戏、Unity 中国以及虚幻引擎等合作伙伴共同推进。网易《燕云十六声》计划今年推出支持神经超级采样的版本,腾讯游戏《暗区突围:无限》开展神经超级采样与降噪技术演示,叠纸游戏《无限暖暖》推进神经超级采样技术集成。

腾讯游戏公共技术线的 MagicDawn 和 Unity 中国团结引擎已将 Arm 神经网络技术集成到开发流程中。而对于第三方开发者而言,CPU 和 GPU 的通用性价值更突出。

Arm 表示,第三方开发者选择面向 CPU 开发的一个重要优势,是能够获得更好的跨平台、跨厂商兼容性。 CSS for Mobile 2 通过 SME2 增强 CPU 的 AI 能力,实际上是在降低第三方开发者接入端侧 AI 的门槛。

最后,物理 AI 是 Arm 在边缘之外的另一个方向。 Arm 正在将成熟的全面设计生态项目扩展至物理 AI 领域,汇聚了 AWS、Hugging Face、Liquid AI、QNX 等 80 多家行业领先企业,首项重点协作倡议聚焦于构建机器人能力分级框架,旨在建立一套统一的语言来描述和评估自主机器的能力发展水平。

结语 当然,最后小编想说的是,CSS for Mobile 2 是可灵活配置的基础平台,后续在终端芯片和整机上的落地进展仍有待观察。首批新平台旗舰机何时上市、纸面数据能兑现几分,还是要交给时间回答。

不过印象中手机行业上一次这么认真地讨论重新设计计算平台,还是在智能手机替代功能机的前夜。而这一次,Arm 正在用一个系统化的平台,把智能体时代的计算需求拆解成可交付的技术组件,再通过庞大的生态网络扩散到每一个终端。

智能无处不在,正在从愿景变成可以触摸的产品。剩下的悬念,留给时间和生态。

返回 AI 市场导读

来源:ithome.com