智能AI
evening
小米发布玄戒 AI 芯片「全家桶」,还官宣了小米「阔折叠」
摘要
小米发布玄戒 AI 芯片「全家桶」,还官宣了小米「阔折叠」 下个月,苹果就要端出 iPhone 18 Pro 系列和首款折叠屏 iPhone。未曾想,就在这场「科技春晚」即将到来之际, 小米直接把桌子给掀了 。 就在刚刚结束的玄戒技术沟通会上,小米第二代自研 SoC「玄戒 O3」刷新了手机 SoC 跑分纪录:Geekbench 6.5 多核成绩冲上 1.5 万分,比目前行业的性能标杆苹果 A19 ...
SoC
CPU
Pro
GPU
iPhone
A19
522
24bit
64M
NPU
2026-08-24
1 阅读
约10分钟阅读
郑廷旭
字号:
小米发布玄戒 AI 芯片「全家桶」,还官宣了小米「阔折叠」 下个月,苹果就要端出 iPhone 18 Pro 系列和首款折叠屏 iPhone。未曾想,就在这场「科技春晚」即将到来之际, 小米直接把桌子给掀了 。 就在刚刚结束的玄戒技术沟通会上,小米第二代自研 SoC「玄戒 O3」刷新了手机 SoC 跑分纪录:Geekbench 6.5 多核成绩冲上 1.5 万分,比目前行业的性能标杆苹果 A19 Pro 还要高出近四成,实验室低温环境下的安兔兔极限跑分更是冲破了 500 万大关,达到 522 万分。 但这 522 万的跑分,还远远不是这次发布会的重点。 十颗全大核,又猛又省电 要达到如此恐怖的理论性能表现,小米给玄戒 O3 塞了一套规模相当凶猛的 10 核心 CPU 核心配置——由 6 颗超大核搭配 4 个大核组成,最高主频达到 4.35GHz。比起单纯追求极限的超高单核主频,O3 显然把更多筹码押在了多核并发的吞吐能力上。 要在寸土寸金的手机 SoC 里塞下整整 10 个全大核,首先得有足够的物理空间。在同样的 3nm 先进工艺下,O3 的芯片面积从上一代的 109mm² 扩大到了 133mm²,晶体管数量也由 190 亿硬生生推到了 240 亿(较 O1 提升 26%),硅片规模整整大了一圈。O3 在多核上的领先优势,很大程度上正是依靠这套 10 核全大核架构的并行效率换来的。 全大核架构的另一面,是功耗和发热更难压住。手机日常更多面对的是刷视频、回消息、看网页这类轻负载,如果这些大核心不能及时降下来,再漂亮的跑分也很容易变成续航和温度的负担。所以这次小米除了强调性能,也重点提到 O3 在覆盖 80% 日常中低负载区间里,功耗相比上一代降低了 25%。 图|小米官方 除了 CPU,GPU 这次给的提升同样扎实。玄戒 O3 换上了 16 核 G2-Ultra NX,官方称图形性能相比上一代提升 85%,光追性能提升 182%。GPU 内部还集成了 8 个 NX 神经网络单元,提供 36 TOPS 算力,用来处理游戏超分和插帧。 更重要的是,在相同性能点下,O3 的功耗最高比 O1 低了 64%。高性能可以维持得更久,发热和掉电也更容易控制。 除了计算与图形,影像也是 O3 的重点升级项。这颗芯片集成了小米第五代旗舰 ISP 架构,支持最高 4.32 亿像素单摄与 24bit 最大位宽,并具备 64M + 64M + 50M 的三摄并发处理能力;配合硬件级智能影像引擎,把 4K 60FPS AINR(AI 降噪)夜景视频做进了芯片底层,为后续旗舰机型的计算摄影留足了冗余。 芯片跑太快,内存快跟不上了 然而,当 CPU、GPU 和 NPU 的算力拉满之后,芯片设计师们很快就会撞上另一堵看不见的墙——数据搬运的速度跟不上了。 这就像一个顶级厨房,厨师越来越多、切菜翻炒的速度也快如闪电,但如果送菜的通道狭窄,或者食材仓库离灶台太远,厨师做完一道菜就只能端着空锅站在灶台前等。算力如果被堵在内存通道里,再漂亮的跑分也换不来流畅的体验。 为了给这群「厨师」拓宽通道,O3 在内存体系上也下足了功夫,行业首发支持了 4×24bit 位宽、10667Mbps 的 LPDDR6 内存,直接把带宽推到了 113.8GB/s,比主流的 LPDDR5X 提升了近一半; 同时,芯片内部的主要缓存总量被扩充到了约 60MB(包含 12MB CPU L2、16MB L3 以及 16MB 系统级缓存 SLC),相当于把最常用的一批食材直接整齐码放在了灶台旁边。 配合重构的自研统一融合总线与物理高层走线,O3 的静态访存延迟被压缩到了 82ns(后台带载动态延迟 177ns),比苹果 A19 Pro 的 92ns / 211ns、上一代 O1 的 121ns / 384ns 都要来得更快。 而这种对高带宽与低延迟的饥渴,在端侧 AI 场景下被放大了数倍。大模型每吐出一个 token,本质上都要把数十亿参数的模型权重从内存里完整读取一遍。 光有 200TOPS 的 A8W4 张量算力和 3.13TFLOPS 向量算力还不够,O3 专门针对定制的 Xiaomi MiMo 5 值量化模型,配备了硬件霍夫曼无损压缩技术,直接节省了 30% 的内存带宽占用;配合 28MB 的 NPU 近存,在官方实验室口径下,MiMo 3B 的首词响应速度提升 40%,推理速度提升 45%,运行功耗还降低了 26%。 在手机这颗需要顾及方方面面的通用 SoC 里,小米能做的优化基本已经拉满了。但如果跳出手机的条条框框,做一颗专门用来跑大模型的芯片,又该怎么解决这个数据瓶颈? 就在沟通会接近尾声的时候,小米掏出了 One More Thing——玄戒 O100。 玄戒 O100:高带宽 AI 加速芯片 与兼顾日常多任务的通用 SoC 不同, O100 是一颗完全面向大模型推理的高带宽 AI 加速芯片 。它的逻辑工艺虽然是相对成熟的 6nm,但封装方式却更为激进: 小米采用了 Wafer on Wafer 晶圆级 3D 堆叠与 Hybrid Bonding 混合键合技术,将两层高速 AI 专用 DRAM 晶圆与一层高性能 NPU 晶圆在垂直方向直接键合堆叠,把原本平面的数据通路变成了「垂直穿透」。 通过创新的 Face to Face 金属层直连结构,两层晶圆之间依托 258 万个物理键合节点相连,TSV 硅通孔孔径仅为 0.7μm,键合间距缩短至 1.4μm。微米级的物理互联距离,让数据能够以极短的路径在计算核心与专用内存之间高速流转,直接将 O100 的内存带宽推到了惊人的 1.22TB/s——达到目前主流旗舰手机 LPDDR5X 的 16 倍。 为了把这套惊人的带宽吞吐完全吃透,O100 还为 14 个 NPU 核心设计了不同的互联架构:处理长提示词的 Prefill 阶段走 Ring 环形网络逐级传递,逐字吐词的 Decode 阶段则切换到 All-to-All 广播网络让多核瞬间同步。在小米实验室测试中,O100 配合 Xiaomi MiMo 跑出了最高 330Tokens/s 的超高速本地推理成绩。 从 O3 到 O100,小米其实一直在解决同一个问题:算力越来越强以后,怎么让数据不「堵」在路上。手机如此,大模型如此,而当这套思路继续往更大的终端走, 下一站就是汽车 。 小米开始为自己的 AI,造一整套芯片 玄戒 D100:智驾高算力 AI 芯片 面向智驾场景的玄戒 D100 采用 3nm 先进工艺,配备了 20 核 CPU 与 16 核 NPU,最夸张的指标是最高支持 160GB 的统一内存,官方确认已经在本地成功部署 200B 参数规模的模型,并计划于明年正式商用。 图|小米官方 在智能汽车上,端侧算力的核心诉求是离线与低延迟。无论是端到端智驾还是座舱多模态交互,一旦驶入地库、隧道等弱网环境,单靠云端协同就会面临延迟甚至断连的问题。160GB 统一内存的意义,正是为了让大参数模型能够直接常驻在车机本地,在不依赖网络的情况下也能完成实时推理。 从手机、大模型专属加速卡到智能汽车,随着三颗芯片全部就位,玄戒也正式补齐了小米 AI 战略最底层
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱