首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

摘要

快科技9月8日消息,过去两年,生成式AI让手机等终端能回答问题,如今的智能体(Agent)AI则要求终端能完成任务替人办事,这个转变看起来只差一步,对终端硬件的要求却是完全不一样。 生成式AI只需要处理一次请求,一次推理,一次响应,算力峰值过后系统回到低功耗待命。但智能体AI需要感知用户意图、检索记忆、推理规划、跨应用执行,整个过程涉及语音识别、向量检索、小模型推理、大模型调用等多个环节的串联。 ...

Ultra CPU集群 for Mobile SME2 LFM 快科技9月8日消息 过去两年 生成式AI让手机等终端能回答问题 如今的智能体
2026-09-08 1 阅读 约10分钟阅读 黑白
分享:
字号:
快科技9月8日消息,过去两年,生成式AI让手机等终端能回答问题,如今的智能体(Agent)AI则要求终端能完成任务替人办事,这个转变看起来只差一步,对终端硬件的要求却是完全不一样。 生成式AI只需要处理一次请求,一次推理,一次响应,算力峰值过后系统回到低功耗待命。但智能体AI需要感知用户意图、检索记忆、推理规划、跨应用执行,整个过程涉及语音识别、向量检索、小模型推理、大模型调用等多个环节的串联。 这种工作负载的特征是:延迟敏感、突发性强、内存密集、高度异构,没有任何单一计算单元能独立胜任,CPU负责编排调度,GPU负责并行计算,加速器负责特定任务,云端的超大模型随时待命。 问题在于,这些组件之间的数据传输效率、任务调度协同、内存访问延迟,才是决定用户体验的关键。 对此Arm在Everywhere China活动上,正式发布了第二代移动终端计算子系统CSS for Mobile 2,这也是首个AI原生移动计算平台,它集成了最新的Arm C2 CPU集群、首个AI原生Mali GPU G2-Ultra NX。 这并非一个单纯更快的CPU或GPU,而是从架构设计、物理实现到软件生态,共同展开的系统级协同优化。 C2 CPU集群 在CSS for Mobile 2平台中,承担中枢调度角色的是C2 CPU集群,旗舰参考配置采用2+6布局,两颗支持SME2可扩展矩阵延伸指令集的C2-Ultra核心,搭配六颗C2-Pro核心,通过DSU共享L3缓存。 C2-Ultra是Arm迄今最强大的移动CPU核心, 能效方面,根据Arm公布的数据,GeekBench 6.3单线程提升15%,多线程提升12%;Speedometer 3.1网页浏览性能提升15%;应用启动加速12%;而在相同性能输出下,C2-Ultra的功耗相比上一代C1-Ultra 大幅降低了38%。 从微架构层面看,相比上一代C1-Ultra,C2-Ultra的改进集中在三个方向: 更大的执行引擎。 C2-Ultra在4.45GHz+频率下实现了超过15%的峰值性能提升,核心能够同时容纳更多在途指令,具备更高的指令级并行度,配合智能推测机制,每个活跃周期能完成更多有效工作,因数据依赖导致的空闲等待周期明显减少。 更聪明的数据搬运。 数据加载效率提升,依赖数据返回后相关工作能更快启动;Load/Store缓冲区扩容,核心能同时跟踪更多内存操作;预取更精准,可预测的数据流在核心请求前就被拉近。这三项叠加,大幅减少了后端停顿。 更精准的分支预测。 在浏览器、应用启动及各类基准测试场景下,大幅降低了复杂工作负载中的分支误预测,减少错误路径执行造成的资源浪费。配合更强大的取指能力、目标地址预测,以及更快的误预测恢复机制,确保了核心拥有持续稳定的指令流供给。 SME2与LUTi SME2可扩展矩阵延伸指令集是C2 CPU集群AI能力的核心,要知道端侧智能体并不是一个大模型包办一切,而是一组各司其职的专用小模型,语音、记忆检索、推理各用各的模型,由CPU上的编排层统一调度,SME2 的价值正体现在这些轻量模型上。 C2-Ultra 还引入了对 LUTi查表指令的支持,该指令专为查找密集型工作负载设计,能够大幅减少频繁的内存访问,在2-bit超低精度量化模型下进一步释放内存带宽压力。 在实际运行中,编码阶段是计算受限,用SME2提高计算密度;解码阶段是带宽受限,用LUTi 负责内存与带宽优化,两者强强联合,完成了对端侧AI模型全链路推理的高效覆盖。这也是为什么Arm强调SME2“天然适合构成移动端智能体的轻量模型积木”。 实测数据显示,在语音识别(Moonshine、Parakeet)、个人记忆检索(LFM 2.5-Colbert-350M 多语言搜索)以及推理生成(LFM 2.5 1.2B、Qwen 3.5 0.8B/2B、MiniCPM 5 1B、Gemma 4 E2B 等端侧小模型)三类工作负载中,2×C2-Ultra + SME2相比2×C1-Ultra + SME2,实现了平均1.7 倍的性能提速。 Arm还用一个“策划周年纪念晚餐”Agent工作流演示了体验:语音转文字阶段, C2-Ultra比C1-Ultra提速40%;记忆检索阶段快41%;推理生成结构化提示词阶段提速25%。整个流程的总耗时从C1-Ultra的约450毫秒缩短至C2-Ultra的约280毫秒,而在启用SME2后,延迟被进一步压缩24%。 能在约200毫秒级完成“感知-记忆-推理-执行”的全链路闭环,这意味着端侧AI智能体的响应速度已正式跨入用户无感等待的即时交互区间。 还有一个值得注意的细节是C2 CPU集群的灵活性,Arm提供了从入门级2N到旗舰2U+6Pro的多种配置,三档不同微架构(Ultra/Pro/Nano)可在同一集群内混搭,每档核心独立调频,合作伙伴可以根据产品定位灵活配置。 Mali G2-Ultra NX:首款AI原生Mali GPU CPU之外,图形一侧的压力同样急剧攀升,更高分辨率、更大规模的开放世界、更复杂的光线追踪,负载复杂度的增速已经超过手机功耗预算的增长上限。在1–2W的功耗与散热约束下,全分辨率、逐帧完整渲染的传统渲染路径,已无法平衡桌面级画质与高持续帧率的需求。 Arm 给出的破局方案是神经图形(Neural Graphics):采用选择性渲染,并利用AI算法重建画面细节、中间帧及光照。原生渲染的像素占比可大幅降低至1/8,剩余7/8的画面全由 AI 重建,同时保持与原生渲染相媲美的画质水平。其设计目标是在1W的功耗预算内,实现高保真的神经图形渲染体验。 Mali G2-Ultra NX是首款AI原生Mali GPU,AI原生主要体现在三个架构层面的创新: 第一,神经加速器(NX)直接嵌入着色器核心。将专用神经加速电路与GPU的执行引擎、内存系统、控制结构紧密集成。NX单元支持INT8与INT16精度计算,运行频率最高可达GPU频率的2倍,支持完整张量运算与权重压缩,还集成了运动引擎与光流加速器。 这种深度集成使得神经图形任务能够与传统图形、计算流水线并行执行,并直接复用GPU的缓存与内存子系统,极大减少了跨单元的数据搬运开销。 第二,全新执行引擎(EE)。这是7代以来最大的ISA(指令集架构)重构,直接面向虚幻引擎5的Nanite虚拟几何体与Lumen动态全局光照而设计。面对日益复杂的现代着色器,寄存器溢出往往是导致性能暴跌的主因。 而新一代EE将每个Warp的寄存器容量直接翻倍,并支持16-Warp粒度的动态宽寄存器分配,大幅减少了溢出损失,GPU能更高效地运行更大规模的着色器程序,为更丰富的场景、更高视觉保真度与更稳帧率预留算力余量。 第三,第三代光线追踪单元(RTU v3)。移动端光追的核心瓶颈在于,随着场景几何复杂度激增,传统BVH结构中的三角形节点数据急剧膨胀,迅速挤爆缓存并吃满带宽。RTU v3引入了更紧凑的三角形存储结构,重复边与共享顶点不再需要重复存储,从而将更多数据塞进缓存,大幅释放DRAM带宽压力。 同时,硬件级不透明度微图(OMM)的引入,让光线与复杂透明/半透明几何体(如树叶、栅栏)的命中测试变得极度精确,降低了透明物
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱