首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

新 Mac mini 首发实测:我的第一台「多 Agent」电脑

摘要

从今年 4 月开始,Mac mini 就逐渐成为「AI PC」的代名词。 Mac mini 除了被个人消费者疯抢,在企业市场同样供不应求,就连 OpenAI 都要买上数万台 Mac mini 和 Mac Studio 来进行模型的训练,Anthropic 也在亚马逊 AWS 上租赁大量的 Mac 服务器。 AI PC 的竞争,也开始从「能不能跑模型」,转向「能不能长期让 Agent 在这台电脑上工...

Mac mini Token Agent Studio 的主打 6999 APPSO Pro Mini
2026-09-21 1 阅读 约10分钟阅读 张子豪
分享:
字号:
从今年 4 月开始,Mac mini 就逐渐成为「AI PC」的代名词。 Mac mini 除了被个人消费者疯抢,在企业市场同样供不应求,就连 OpenAI 都要买上数万台 Mac mini 和 Mac Studio 来进行模型的训练,Anthropic 也在亚马逊 AWS 上租赁大量的 Mac 服务器。 AI PC 的竞争,也开始从「能不能跑模型」,转向「能不能长期让 Agent 在这台电脑上工作」。 LM Studio Bionic、设备端模型、AI 智能体、exo 集群都成了 Mac mini 的主打。苹果甚至直接把新 Mac mini 描述为一台可以「全天候」运行智能体的桌面电脑。 6999 元起,16+256 的 M6 芯片,一台最低配的 Mac mini 到手,你会拿它做点什么。 APPSO 也拿到了一台 M5 Pro 的 48GB + 2T 的新 Mac mini,这台 Mac mini到手需要 25749 元,或者免息分期 24 个月,每个月 1073 元。 说实话,这一点都不 Mini。 但如果看这一年的 PC 市场,几乎所有主打 AI PC 的电脑,都在讲统一内存,都在讲算力,Windows 那边有 AMD 和英伟达,开始把一些高性能的算力芯片下放到笔记本电脑上,而不是一味地在追求 5090 显卡等。 对比同参数级别的电脑体积,又会觉得这个放在桌子上,小小的,几乎是不占据太多地方的小盒子,是真的很 Mini。 运行专业软件当然还是高性能 Mac 最擅长的事情,但现在 AI 开始成为调用这些能力的新入口。 写代码不再只是打开 Xcode 自己敲;处理几十份资料,也不一定需要一个个打开文件;Blender、剪辑软件、终端和本地模型,都可能变成 Agent 完成一个任务时调用的工具。 而与 AI 更直接相关的,还有视频剪辑软件里 AI 的画质提升、照片和视频中的 AI 增强;以及我们都想通过一台电脑,就打造的个人智能终端。 我们手里这台 25000 元多的 Mac mini,大概率不会是普通消费者的选择。搭载 M6 芯片,16GB+256GB 的版本可能才是大多数人会入手的 Mac mini。 更高的配置可以让 Mac mini 拥有本地部署大模型的能力,但即便不拿它部署大模型,一台 6999 的 Mac mini 也会是当下适合给 Agent 使用的电脑,因为它很好地为 AI 提供了一个可以持续工作的地方。 就像 APPSO 之前说的,新 Mac mini 是一台为 AI 造的电脑,那我们这次重点看看它是否更好地为 AI 提供了一个持续工作的地方。 能装下 270 亿参数的 AI M6 看起来拥有这一代最完整的 AI 配置:12 核 GPU 的每一个核心都有 Neural Accelerator,同时还有双 16 核 Neural Engine。根据官方的对比显示,相比 M4 Mac mini,M6 Mac mini 的 AI 性能最高提升 4 倍。 但如果我们真的想要在电脑上运行大模型,另外两个经常被提起的数字可能更加重要: 内存容量和内存带宽。 M6 Mac mini 最高只有 32GB 统一内存,带宽最高 170GB/s;M5 Pro 则可以来到 64GB 和 307GB/s。 随着开源模型的能力逐步逼近 Fable 5、GPT-5.6 Sol 这类顶尖模型,开源实验室也开始推出从 10 亿参数到超过 700 亿参数的大模型,本地化 AI 变成 AI PC 的主打。 我们准备了几个不同体量的量化模型,从大约 8B、14B,一路增加到 30B 级别,再继续挑战接近机器内存极限的模型。 每个模型都执行同一组任务:给它一份长度固定的资料,要求阅读、总结、回答问题,再进行几轮连续追问。 记录模型载入时间、Time to First Token、Prompt Processing、Generation Speed,以及整个过程中占用了多少统一内存。 一开始先是用了 GPT 的 20B 开源模型,然后问一下它是什么模型,这一轮对话就处理了 72 个输入 Token,生成了 178 个输出 Token,整轮请求耗时约 3.64 秒,平均生成速度为 55.66 Token/秒。 继续测试千问的 Qwen3.8 27B 参数,量化到 4 比特的模型,能看到回复的速度还是很快,总用时 2.9s,生成的速度是 41.64 token/s。 当输入一份超长的文档时,我们发了 Attention is all you need 那篇论文给它,可以看到最终的处理速度也有 32 token/s,对于一个 27B 的本地大模型来说,Mac mini 的速度基本上是可以接受的。 再往上,更大的模型,是 Meta 最新的开放模型,300 亿参数,专为始终在线的本地智能体打造。同样的论文总结任务,能看到随着模型参数变多,Mac mini 的读入速度和生成速度都有变化,尤其是读入的速度从 473 token/s 降到了 只有 32 token/s。 而当面对 70B 的 Llama 3.1 模型时,虽然也能跑,但我们只是发了一句你好,总用时 2 分钟 48 秒,平均生成速度是 0.05 Token/s。 对本地大模型来说,除了不同参数量和量化的区别,针对 Mac 还有 GGUF 和 MLX 两种路线。 比如,同一个 Qwen 模型可以分别制作成 GGUF 版本和 MLX 版本。 它们可以来自同一个模型,区别在于如何保存参数、如何量化,以及用什么引擎运行。 GGUF 是模型文件格式,MLX 是苹果开发的机器学习框架。GGUF 路线的主要特点是支持多种硬件,跨平台使用方便,而 MLX 则是围绕 Apple Silicon 设计,利用统一内存架构。 图|mlx-framework.org 不过,虽然MLX 围绕苹果芯片设计,但具体哪个更快、更省内存,要看模型和运行时版本。 总的来说,对于一个 48GB 运行内存的 M5 Pro Mac mini,舒适区就是 200 亿到 300 亿参数附近的大模型,也可以试试 330 亿参数的 MiniMax H3,用来做视频生成。 打造自己的智能体 2026 年的今天,一台「AI PC」的性能如果通过「能跑 AI来体现」,明显有些不够了。 LM Studio Bionic 就是其中一个很典型的例子。它并不是单纯再做一个本地模型客户端,而是让模型获得读取项目文件、运行命令、修改代码和连续执行多步任务的能力。 在 LM Studio Bionic 内,我们可以直接使用本地模型,也可以在处理较重任务时切换到云端的付费开源模型。 其实我们手上的电脑,到底能安装多大的大语言模型,在 LM Studio Bionic 内就能直接看到。 在应用内,我们可以直接勾选「仅包括在已知设备上可运行的精选模型」,它会主动识别到设备的可用内存,以及针对每个模型,会显示「Full GPU Offload Possible」或「Likely too large」等提醒。 接下来我们准备让 Mac mini 真正干活。给 Agent 一个装有二三十份资料的文件夹,其中包括 PDF、Markdown、表格和此
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱