汽车
morning
端侧 AI“小时代”
2026-09-08
1 阅读
约10分钟阅读
象先志
字号:
文 | 象先志 “小时代”的开场,是一阵Mac mini抢购潮。 2026年1月下旬,一个当时还叫Clawdbot、后来以“龙虾”之名为人所知的agent走红。然后,就引发了Mac Mini的抢购潮。 人们开始为一个随时能干活的 AI,单独准备一台电脑。 图 1|2024 年发布的 M4 Mac mini。图片来源:Apple Newsroom。 随后, 苹果已经开始在传播层面刻意转向agent。新款Mac mini不再只讲办公和创作,也开始强调全天候运行智能体;Mac Studio则继续向需要在本地运行大模型的人出售大内存。 小米也在近期展示了AI Cube。三颗玄戒芯片装进一个铝合金方盒,配上80GB统一内存,在本地部署大模型。 更早入场的英伟达,已于2025年10月开始交付DGX Spark。联想、华硕、惠普、戴尔也围绕GB10推出整机。 原本卖笔记本、工作站和小型电脑的公司,开始争夺一种新订单:用户希望把一部分AI算力留在自己手里。 端侧 AI 即将迎来大时代?别急,现在还只是“小时代”。 模型正在改写电脑规格 不过是在两年之前,AI PC最典型的配置还只是一块NPU。 微软给 Copilot+ PC划出的门槛是40 TOPS NPU、16GB内存和256GB存储。厂商拿实时字幕、图像处理等功能介绍本地 AI。这套标准可以放进原有的轻薄本,用户仍然按熟悉的方式使用电脑,只是多出几项由专用计算单元承担的功能。 但同时,由苹果的统一内存开始,用户们渐渐开始部署本地模型。2025年3月,苹果已把最高 512GB统一内存放进M3 Ultra Mac Studio,并以本地运行数千亿参数模型为卖点。在这个时间,本地部署还只是专业工作者们的选择,因为动辄大几万的Mac Studio,还远没能下落到普通消费者的购买区间。 到了今年,端侧 AI 的产品继续生长。小米 AI Cube原型机配备80GB 统一内存,DGX Spark和一批GB10整机是128GB,AMD Ryzen AI Max 300系列最高支持 128GB;新款 Mac Studio继续提供最高 512GB,内存带宽提高到1.2TB/s。 内存是重中之重,这已经不是什么秘密。模型权重、上下文缓存和运行时会迅速吞掉内存。以4 比特量化粗算,70B模型仅权重就约需35GB,尚未计入量化元数据、缓存和系统开销。 部署完成之后,速度又成了下一道门槛。 DGX Spark的128GB统一内存,搭配的是273GB/s 带宽。前者关系到能装下多大的模型,后者影响计算时搬运数据的速度。真正生成回答时,模型精度、上下文长度和推理软件还会继续影响结果。增加内存,并不能包办后面的工作。 即使模型已经跑起来,用户也未必用得起来。模型怎样下载和更新,应用怎样调用,读取文件之前需要哪些权限,持续运行出了问题由谁维护,都要有人处理。用户买回去的是一台电脑,这些环节却未必由同一家公司完成。 联想、华硕、惠普可以采用英伟达的 GB10 平台,完成整机设计、销售和服务;苹果可以同时调整芯片、系统和开发工具。小米则把自己的芯片装进原型机,尝试参与决定一台个人 AI 设备应当怎样计算。 这几条路线,反映的是各家公司愿意承担多少研发投入,又希望掌握多少产品决定权。采用现成平台的厂商,可以把更多精力放在产品化和交付上;自己设计芯片,则要先承担研发和验证投入,换取对内存架构、计算单元和功耗分配更大的调整空间。后续还要靠足够的产品销量,摊薄持续迭代的成本。 自研芯片因而是一种选择,而非所有参与者的入场条件。同样使用 GB10 的两台机器,底层能力可能很接近,安装体验、维护服务和客户关系却可以由不同公司掌握。 图 2|个人端侧 AI 的产业分工。一家公司可以参与多个环节,各款产品的集成程度仍有差别。制图:象先志。 新的电脑订单由此带出了一个更大的问题: 用户为本地 AI 多花的钱,最后会留给提供芯片的公司、提供系统的公司,还是把机器卖给他的公司? 苹果和小米,都在尝试让更多环节留在自己手里。只是它们手里已有的东西,以及还要花钱补上的东西,很不一样。 苹果握住整套系统,小米向底层伸手 苹果可以同时改芯片、系统和开发工具,它 不需要用户决策新买一台AIPC,就可以让模型部署在本地。 统一内存是苹果的杀手锏:苹果的 MLX 框架让 CPU 和 GPU 使用共享内存里的数组,减少在不同计算单元之间搬运数据的需要;MLX-LM 则提供模型运行、量化和微调工具。开发者下载第三方开放模型,也可以使用苹果为自己硬件优化的工具来运行。 这条路径主要使用 CPU、GPU,并不只靠专用 NPU。今年预览的 Core AI 框架又对统一内存和神经网络引擎进行优化。苹果能够围绕同一套硬件持续补软件,而不是每增加一项 AI 功能,就重新寻找一套计算平台。 8 月的更新进一步拉开了产品梯度。M6 Mac mini 6999 元起,内存最高 32GB;M5 Pro 版本最高 64GB。需要更大模型、更重开发任务的人,可以继续向 Mac Studio 的 128GB、512GB 配置走。新机已于 8 月 27 日接受预购,官方计划 9 月 22 日开始发售。 图 3|新款 Mac Studio 提供 M5 Max 和 M5 Ultra 配置。图片来源:Apple Newsroom。 用户本身是有分层的:普通用户需要的是已有应用里多几项好用功能;开发者在意能不能把自己的模型和代码放进去;研究团队、专业创作者才更可能为大内存和持续负载买单。但苹果可以用同一套系统承接不同预算,不必为每一层用户重建销售渠道。 掌握整套平台,也没有让苹果拒绝外部模型合作。6 月公布的第三代基础模型与 Google 合作开发,其中既有 3B 端侧模型,也有采用稀疏结构、按请求调动部分参数的 20B 端侧模型。 合作改变了模型的来源,系统和产品决策权仍然在苹果手里。哪些模型进入系统服务,开发者通过什么接口调用,应用读取文件之前如何获得许可,仍由它的平台安排。外部模型可以进入 Mac,用户不必因此离开 Mac。 因此,苹果的商业算盘并不只是在传统的 Mac 上卖内存。它也在给现有硬件增加使用理由,让开发者把新功能继续做在自己的系统里。模型和框架还在随系统版本、地区与测试进度逐步开放,但已有的产品线和用户关系,让苹果可以分批推进这件事。 小米想握住类似的主动权,但明显和苹果走的不是一条路。 AI Cube里三颗芯片的分工很能说明问题:O3面向个人智能终端,O100面向端侧 AI加速,D100面向智能驾驶。小米把几条芯片研发线放进同一台原型机,展示协同计算能力。按8月发布信息,O3已开启规模量产,O100和 D100计划明年商用。AI Cube本身仍是工程原型,没有公布价格和开卖时间。 图 4|AI Cube 工程原型机。图片来源:小米,IT之家转载。 自研的意义,首先在于小米可以自己组织一颗芯片的设计,并不意味着每个组成部分都从零做起。此前的玄戒O1就使用了Arm的Cortex CPU、Immortalis GPU和 CoreLink互连 IP。对小米而言,投入芯片设计,是在通用技术的基础上,为自己的产品安排计算能力、内存和功耗,而后还要接受制
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱