首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

科技爱好者周刊(第 404 期):你需要知道的 AI 内存知识

2026-08-01 1 阅读 约10分钟阅读 阮一峰
分享:
字号:
这里记录每周值得分享的科技内容,周五发布。 本杂志 开源 ,欢迎 投稿 。另有 《谁在招人》 服务,发布程序员招聘信息。合作请 邮件联系 ( [email protected] )。 封面图 上海某商场正在举办的"海绵宝宝"展览。( via ) 你需要知道的 AI 内存知识 自己在家运行 AI 模型,可以选择两种硬件。 一种是独立显卡,目前最顶级的消费级显卡是英伟达的 RTX 5090,带有 32GB 显存,售价3万元人民币左右。 另一种是采用板载芯片组(CPU + 板载显卡 + 板载内存)的家用电脑,比如采用 AMD 公司 Strix Halo 芯片组(具体型号 Ryzen AI Max+ 395)的迷你电脑,自带 128GB 内存,售价2万元人民币左右。 我问大家,哪种硬件更好? 大部分人可能不假思索,就会选择独立显卡,毕竟独立显卡的算力远大于板载芯片组。 根据我查到的资料,下面是两者的单精度32位浮点数算力(FP32)。 独立显卡(RTX 5090): 104.8 TFLOPS 板载芯片组(AMD Ryzen AI Max+ 395): 14.8 TFLOPS 可以看到,独立显卡的算力,足足是板载芯片组的7倍。如果是更小位数的浮点数计算(比如 FP16 和 FP4),算力差距就更大了。 但是,我告诉你,正确的答案其实是"不确定"。很多时候,板载芯片组的迷你 PC,才是更好的本地 AI 模型解决方案。 原因很简单,大多数的 AI 模型(只要参数规模稍大),RTX 5090 根本运行不了。 问题出在它的 32GB 显存实在太少了。一个 70B 参数的模型,如果每个参数使用4位精度,那么将所有参数的权重读入内存,大约需要 32.6GB 的内存,这超出了 RTX 5090 的显存大小,它根本跑不起来。 相比之下,AMD 迷你电脑的板载内存有 128GB,载入模型毫无困难。 板载芯片组的内存是显卡和 CPU 共用的,所以称为"统一内存" 。它的好处是可以分出尽可能多的内存给单个处理器,所以能处理内存消耗量很大的 AI 模型。 苹果的 M 系列芯片一直是这种"统一内存"架构,其他厂商现在也跟进了,AMD 的 Strix Halo、NVIDIA 的 DGX Spark、Intel 的 Core Ultra 和高通的 Snapdragon X 都采用这种架构。除了内存容量大,它的价格也比独立显卡低。 读到这里,你可能会问,既然板载芯片组有这些优点,还有必要购买独立显卡吗? 回答是,内存有两个指标,除了容量大小,还有一个指标"内存带宽"。 板载芯片组的弱点,恰恰就是内存带宽。 所谓"内存带宽",指的是内存向处理器传送数据的速度。虽然 RTX 5090 显存不多,但是内存带宽极大,达到了 1792GB/s,而 AMD 的内存带宽只有 256GB/s。 AI 模型每生成一个 Token,需要处理器从内存中读取整个模型,进行计算。如果内存带宽是 256GB/s,那么 40GB 大小的模型,处理器一秒只能读取6次(256除以40),也就是说每秒只能生成6个 Token(这是理论值,实际可能还达不到)。这样的龟速,谁能忍受? 即使是内存带宽最大的苹果 M3 Ultra 芯片,带宽为 819GB/s,每秒可以生成20个 Token,远不如 RTX 5090 的 1792GB/s。 所以,内存大小和内存带宽,两者都是 AI 模型的瓶颈。这也是高带宽内存(HBM)价格涨疯了的原因。 如果你选择板载芯片组的迷你电脑,就要做好心理准备,忍受非常慢的 Token 生成速度。 好在为了节省计算量,出现了"混合专家模型(MoE)"这种架构, 它计算 Token 时,不需要读取全部参数,只需要激活一部分参数即可 。 以 Qwen3-30B-A3B 模型为例,它包含 30B 个参数,但每次只激活 3B 个参数,因此每个 Token 需要读取的数据量不是 20GB,而是 2GB。那么在 AMD 迷你电脑上,每秒理论上可以生成100多个 Token,这样的速度就相当不错了。 因此,如果你用"统一内存"模式的迷你电脑,就选用 MoE 模型吧。 另外,迷你电脑还有一个很大的缺点,跟内存无关,而跟它的算力慢有关。 我们知道,模型必须先处理用户的提示词,然后才能生成 Token。因为迷你电脑的算力慢,所以它处理提示词也很慢。 根据 实际测算 ,AMD 迷你电脑使用 70B 的模型,提示词处理速度是每秒95个 Token。那么,用户提交4000个 token 的一个文档,大约需要40秒才能处理完,然后才能输出第一个 Token。 可以想象,一旦用户往上下文窗口塞入更多的内容,单单是处理提示词,就会变成几分钟到几十分钟。 总之,现阶段想在本地电脑运行大模型,无论是独立显卡还是板载芯片组,都有缺陷。你最多只能运行一些中等规模的 MoE 模型,而且提示词不能很长。 布尔变量如何起名 传说中,编程有两大难题,一个是缓存失效,另一个是变量起名。 其中,布尔变量尤其难起名。怎样才能贴切地表达,这个变量是表示"真"(true)和"伪"(false)的布尔值呢? 我最近读到一篇文章 《布尔变量起名的艺术》 ,提出使用四个前缀就能给布尔变量正确起名,我觉得很有启发。 (1) is- :描述事物的状态,后面跟形容词,比如 isActive,isDeleted,isEmpty。 (2) has- :描述事物的所有权或包含关系,后面跟名词,比如 hasAccess,hasChildren,hasValidationErrors。 (3) can- :描述事物的能力或权限,比如 canEdit,canDelete,canRetry。 (4) should- :描述事物的意图或逻辑,比如 shouldRetry,shouldCacheResponse。 除了这四个前缀,起名还有另一条规则:永远不在布尔变量名中使用否定词。 比如,不使用 isDisabled,而要用 isEnabled = false 。 科技动态 1、 OpenAI 键盘 OpenAI 公司刚刚推出了一款便捷键盘,方便操作 AI 代理。 键盘下方是一排快捷键,用于批准、否决、语音输入等操作。上方是一排 RGB 灯,表示 AI 代理目前的状态(思考、运行、等待、完成)。 这东西售价230美元,看上去毫无新意,也未必比普通键盘方便。 著名设计师乔纳森·艾维(Jony Ive)离开苹果公司后,现在负责 OpenAI 硬件设计。大家都盼望,他能拿出让人眼前一亮的智能硬件,但最先亮相的这个小键盘真是让人失望。 2、 小行星 2016HO3 天问二号探测器于2025年5月发射,经过约400天的飞行,终于到达了目标----小行星 2016HO3,并传回了照片。 这个小行星长度在20米左右,只比半个标准篮球场大一点,形状不规则,并有尖角,这表明它应该是碰撞后的碎片,而不是熔岩冷却形成的。 天问二号拍摄照片时,距离这个小行星20公里,下一步将按照计划,采集这个小行星的岩石样本,送回地球。 这件事的难点在于,天问二号翼展达到15米,只比这个小行星小一点,采样时可能会改变小行星的轨道。 3、 风力编织机 一个荷兰设计师发明了
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱