智能AI
morning
比《西部世界》还猛:83亿「接待员」开始上线
摘要
《西部世界》里的接待员,可能要失业了。 毕竟,人家一个乐园才养多少 NPC。这次,研究者直接照着地球人口规模,造了 83 亿个数字人。 最近,哈佛、MIT、斯坦福等一众顶尖机构联合推出 MatrAIx:一套人口规模的 AI 用户模拟系统。里面塞进了 83 亿份 Persona 档案,数量几乎和现实世界的人口打平。 名字听起来有点《黑客帝国》,玩法却更像《西部世界》: 先给每个「人」安排一套完整人设...
MatrAIx
Persona
1290
西部世界
MIT
专业能力
News
Agent
https
人格数据库
2026-08-11
1 阅读
约10分钟阅读
机器之心
字号:
《西部世界》里的接待员,可能要失业了。 毕竟,人家一个乐园才养多少 NPC。这次,研究者直接照着地球人口规模,造了 83 亿个数字人。 最近,哈佛、MIT、斯坦福等一众顶尖机构联合推出 MatrAIx:一套人口规模的 AI 用户模拟系统。里面塞进了 83 亿份 Persona 档案,数量几乎和现实世界的人口打平。 名字听起来有点《黑客帝国》,玩法却更像《西部世界》: 先给每个「人」安排一套完整人设:年龄、职业、地区、语言、性格、消费习惯、风险偏好、专业能力…… 最多 1290 个维度;再把这些人设塞进 GPT-5.5、Claude Opus 4.8 等大模型里,让它们真的出去「生活」。 有人负责逛网站,有人找 AI 聊天,有人填问卷,还有人直接打开 iPhone 上的 Apple News+,看完内容、瞅一眼每月 12.99 美元的价格,再决定:这钱,我掏不掏。 更离谱的是,不同「人」还真有不同脾气。 同样面对涨价,有人立刻犹豫,有人觉得无所谓;同一个 AI 助手犯错,有人愿意再给一次机会,有人直接跑路;有人嫌 News+ 没有自己熟悉的语言内容,有人嫌专业领域覆盖不够。研究团队一共跑了 18189 次测试,还发现这些 Persona Agent 在受控实验中,有 91.5% 的行为能跟设定的人格特征对上。 这下,产品经理熟悉的流程可能要多一步了。 以前一个 App 上线前,要找用户、发问卷、做访谈、跑测试。 现在可以先问一句:要不先放进这个数字西部世界里,让几十万种用户替我们用一遍? 论文地址:https://arxiv.org/pdf/2608.04205 项目地址:https://github.com/MatrAIx-ai/MatrAIx-Persona-8B 论文标题:MatrAIx: Simulating the World with 8.3 Billion Persona Agents 作者阵容同样堪称豪华。哈佛、MIT、斯坦福、伯克利、CMU、普林斯顿、牛津、宾大、康奈尔、哥大等顶尖高校集体出现,背后还有 OpenAI、Anthropic、Microsoft Azure、AWS、Meta 提供资金、算力、模型访问及项目支持,从研究机构到 AI 大厂,阵仗基本拉满。 论文刚发,学术圈已经坐不住了。 论文上线仅 1 天 5 小时,就被 Nature 的 Senior Editor 注意到,并主动联系研究团队。 X 上的讨论热度也迅速冲了起来。大家最先被震住的,还是这个数字:83 亿。 「差不多相当于地球上每一个活着的人,都有一个对应的数字分身。」 「83 亿个虚拟人的 AI 模拟系统,规模几乎相当于整个地球人口。」 接下来,我们具体看看 MatrAIx 到底做了什么。 这项研究首先瞄准了一个很现实的问题: AI Agent,究竟能在多大程度上模拟不同人群的行为和偏好? 研究者首先在评测场景中,探索了 agent 模拟人类偏好的可行性。一次高质量的用户研究,往往需要招募、筛选、评测和统计分析,覆盖几十人已经不易,更不用说同时比较上千个甚至更大规模的用户群体。若依靠真实用户完成大规模的测试,现实中时间和金钱成本都极高。 对此,MatrAIx 研究团队的核心思路是,通过赋予大模型人格,使其模仿多样的用户群体完成对大规模真人评测的模拟。MatrAIx 里 83 亿个带人格的虚拟用户能够高效准确地完成多种测试任务,解决产品测试成本高、耗时长、覆盖率低等一系列问题。 MatrAIx 评测平台主要包含三个核心部分:1. Persona-8B 人格数据库, 2. 四类仿真环境, 3. 多领域评测任务。 Persona-8B 人格数据库 人格维度 MatrAIx Persona-8B 数据库包含 83 亿份人格记录。每份记录都基于标准化的 1290 个人格维度。这些维度分为五个大类:背景信息 238 维、心理特征 210 维、能力信息 331 维、行为与交互习惯 124 维,以及生活方式 387 维。从人口与职业背景一直延伸到价值观、专业能力、交互偏好和日常生活。研究者可以按年龄、地区、专业能力或风险偏好筛选人群,也可以比较不同群体针对同一产品时的反馈。 Persona-8B 的五类人格维度。整套框架共包含 1290 个类别维度,覆盖背景、心理、能力、行为与交互习惯和生活方式。表中同时列出了各类别的维度数量、代表性属性及主要数据依据。 数据构建 Persona-8B 采用两种主要构建方法: 1. 生成合成人格,2. 从已有资料中提取人类画像。 针对人格数据合成,MatrAIx 团队建立了一张有向无环图 (Directed Acyclic Graph),用于描述属性之间的依赖关系。比如,教育水平与年龄相关,英语能力则与所在地区的主要语言相关。团队基于依赖关系依次采样,并用兼容性规则排除明显冲突的组合。以此方式生成的人格同时保留了单条人格的合理性和总体人口的多样性. Persona-8B 的合成人格依赖图。每个节点代表一个人格维度,连线表示两个维度之间存在条件依赖。生成人格时,按照从父节点到子节点的顺序逐项采样,使年龄、教育、语言、职业等相关属性能彼此协调。 合成方式可用公式概括。一份人格出现的概率,可拆成 1290 个条件概率的乘积。生成时沿着 DAG 顺序,根据当前属性的父节点计算下一个属性的概率分布。 公式说明:x 代表一份完整人格记录, 表示第 i 个属性在 DAG 中的父节点。给定候选值v, 是其在总体中的基础概率, 根据父节点信息上调或下调这一概率, 负责执行兼容性规则。以英语能力为例,主要语言和所在地区会通过 改变不同熟练度的权重;如果某个组合存在明显冲突, 就取 0,直接排除该选项排。 另一部分人格来自真实人类资料,包括 Wikipedia 人物百科、Amazon 用户评论历史、Stack Overflow 开发者调查、General Social Survey、PRISM Alignment,以及 355 名志愿者填写的 MatrAIx 人格问卷。这些资料被映射到同一套 1290 维度中,没有足够证据支持的属性会保留为空。 MatrAIx Playground:四类评测环境 MatrAIx Playground 提供四类环境:问卷、AI 聊天机器人、网页和应用。 问卷:人格 agent 可以回答产品概念、价格敏感度、消费意愿等问题。 AI 聊天机器人:环境会保留完整对话,观察用户是否追问、是否接受修正,以及在 AI 助手出错之后是否还愿意继续使用。 网页:允许 agent 浏览站点、搜索信息、比较选项并作出选择。 应用 App:agent 可以通过鼠标、键盘或触控操作例如 Linux、macOS 和 iOS 应用等。环境会记录交互过程、最终状态,以及文件、权限或设置发生的变化。 问卷关注选择和理由等概念测试,AI 聊天机器人关注多轮互动下 AI 模型的表现,网页与应用则提供沙箱环境测试 AI 与数字产品。MatrAIx 会保留完整的交互轨迹作为珍贵的数据资产,为后续评测分析或模型训练提供高质量的数据基础。 MatrAIx Playground 的实验运行与结果分析界面。上图展示人格
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱