首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

全世界最强的AI,都在“抄”这群普通人的作业

摘要

本文来自微信公众号: 爱范儿 ,作者:发现明日产品的,原文标题:《全世界最强的 AI,都在「抄」这群普通人的作业》 这两天,AI圈百家争鸣。GPT-6曝光、DeepSeek V4 Flash公测、SD2.5发布、MiniMax多模态开源视频模型发布…… 但爱范儿决定将今天的头条让位给一个名不见经传的人,《纽约客》的特稿称他为「互联网大脑的意外缔造者」。 一个普通人,编辑了维基百科600万次 202...

纽约客 超级编辑 本文来自微信公众号 爱范儿 发现明日产品的 原文标题 全世界最强的 这群普通人的作业 这两天 AI圈百家争鸣
2026-08-03 1 阅读 约10分钟阅读 虎嗅
分享:
字号:
本文来自微信公众号: 爱范儿 ,作者:发现明日产品的,原文标题:《全世界最强的 AI,都在「抄」这群普通人的作业》 这两天,AI圈百家争鸣。GPT-6曝光、DeepSeek V4 Flash公测、SD2.5发布、MiniMax多模态开源视频模型发布…… 但爱范儿决定将今天的头条让位给一个名不见经传的人,《纽约客》的特稿称他为「互联网大脑的意外缔造者」。 一个普通人,编辑了维基百科600万次 2021年1月,英语维基百科完成第10亿次可追踪编辑。这个里程碑没有诞生一篇宏大的新词条:编辑者只是在一张冷门电子音乐专辑的页面补上一条链接。 完成这项工作的人叫Steven Pruitt,他编辑维基百科超过600万次,创建了3万多篇词条,作为志愿者,他未曾从中获利一分。 它需要人类写过的书、新闻、论文、代码和网页,也需要有人提前完成最乏味的一步:给混乱的世界命名、分类、引用和纠错。 Pruitt今年42岁,白天替联邦政府管理档案。晚饭后,他回到弗吉尼亚州亚历山德里亚市的家中,坐进一间堆满书的房间,继续整理另一个更庞大的档案库:纠正日期、修复链接、统一分类,偶尔为一个被遗忘的人写下完整生平。 2004年,Pruitt第一次编辑维基百科。20多年后,他成了英语维基百科编辑次数最多的人,也被《时代》周刊列入「互联网最具影响力人物」榜单。 图自northernvirginiamag 他在网站上的用户名是Ser Amantio di Nicolao,来自普契尼歌剧《贾尼·斯基基》里的一个小角色。这个略显华丽的名字,与他所做的事情形成强烈反差。 随着维基百科日渐成熟,Pruitt已经很少再从零创作词条,更多时候是在检查引文、修正语法、清理过时的信息,或者把一位被遗漏的「十九世纪女性物理学家」放进正确的分类。 这些修改小到几乎不会被看见,却构成了维基百科的日常。 一项分析维基百科前十年、约2.5亿次编辑记录的研究发现,约77%的词条编辑来自约1%的活跃编辑者。 这群人被称为「超级编辑」。 他们有人在披萨店工作,有人接听热线电话,有人已经退休。他们没有统一的办公室,没有工资和署名,也很少得到平台时代最重视的粉丝与流量。 《纽约客》采访的另一位「超级编辑」Justin Knapp,是英语维基百科第一个完成一百万次编辑的人。有人问他,这些超级编辑是否在意排行榜,他回答: 「我实在不觉得,一个愿意把空闲时间用来编写百科全书的人,会特别在意自己是否成了小池塘里的大鱼。」 Women in Red项目让这种劳动显出另一层意义。William&Mary校友杂志曾记录,Pruitt为它建立了数千个分类,其中包括「历史小说家」「犯罪小说作家」和「来自莱索托、博茨瓦纳与厄立特里亚的女性作家」。 先把空白画出来,编辑者才知道该从哪里续写。 Pruitt提到尼日尔歌手Fati Mariko:她在本国卖出过数十万张唱片,互联网上却几乎只有几段演出视频。他说:「当我们讨论互联网上的系统性偏见时,遇到的就是这种情况。」 编辑一部百科全书,也是在为尚未被承认的知识争取位置,决定谁有资格被互联网记住。 用他自己的话说:「一群互联网上的人,正在重新设计知识的正典。」 Pruitt甚至不太关心AI。朋友告诉他,维基百科正在被大模型蒸馏,他只说: 「硅谷做的事情,有一半我都不懂。」 但当我们向ChatGPT、Gemini、Claude询问一位一个冷门概念,答案很可能经过了Pruitt和这群普通人多年的整理。 我们习惯把AI的能力归功于模型、芯片和算力。技术发布会也不断强化这种印象:更大的参数,更长的上下文,更复杂的推理,以及一座又一座耗资数十亿美元的数据中心。 但AI的「大脑」下面,还压着一整层近乎隐形的人类劳动。 谁才是AI的大脑 大模型经常给人一种错觉:它似乎读过全世界,理解人类文明,并且把这些知识储存在某个庞大的机器大脑里。 训练模型当然需要复杂的算法、昂贵的芯片和巨量电力,但模型首先要有东西可学。 维基百科覆盖的主题足够广,文本结构相对统一,词条之间彼此链接,每个判断还尽可能附有来源。人类编辑把一份报纸、一篇论文、一本传记里的零散事实,整理成机器能够识别和调用的形式。 如果把互联网比作一座杂乱无章的巨型仓库,维基百科编辑做的工作很像为货物贴标签、建立索引、核对批次。 后来,大模型开着叉车进来,当然可以比任何人更快地搬走这些货物。但仓库里的秩序,并非叉车创造的。 这种秩序不只存在于文字世界。 2009年,奠定现代机器视觉基础的ImageNet,在最初的论文中已经收录320万张图片、5247个语义类别,而数据收集依靠Amazon Mechanical Turk上的普通人的逐一分类和核验。 在机器视觉开始大规模辨认猫、汽车和椅子之前,已经有无数双手替世界贴上了名字。 AI时代最重要的数据,许多来自互联网仍然相信公共协作的年代。 维基百科诞生于2001年。那时「平台」还没有变成围墙,「用户生成内容」(UGC)也没有完全等同于给商业公司免费生产流量。人们愿意相信,知识可以由陌生人共同编写,成果可以让任何人自由阅读、复制和继续修改。 二十多年后,这份开放的公共遗产成了商业AI的知识地基。 维基百科成了AI的“海马体”,但记忆没有主人 维基百科早已超出一家百科网站的范畴。 在搜索引擎时代,它经常占据结果页前列,为人类提供一个快速理解陌生概念的入口。到了AI时代,它逐渐成为互联网的「海马体」:自己未必负责完成所有思考,却为机器提供较稳定的公共记忆。 维基媒体基金会已经推出Wikimedia Enterprise,为需要大规模、稳定调用维基百科数据的企业提供商业服务。Amazon、Meta、Microsoft、Mistral AI和Perplexity等公司都在使用这项服务。 这并不意味着维基百科开始把知识锁进收费墙。任何普通人依然可以免费访问和下载内容。收费针对的是商业公司对海量、实时、结构化数据的高强度调用。 这种区分十分重要。开放不等于公共资源没有成本。 维基百科的服务器需要运转,词条需要维护,恶意修改需要处理,争议需要协调。 维基百科披露,自2024年1月以来,下载多媒体内容所消耗的带宽增长了50%;在那些最昂贵、需要返回核心数据中心处理的流量中,至少65%来自机器人。 AI公司可以在极短时间内吞下人类二十多年积累的知识,而维持这套知识继续可靠存在,依然需要捐款、服务器,以及没有工资的编辑。 AI带走的还有人们抵达知识源的路径。维基媒体基金会在重新识别那些伪装成人类的机器人流量后发现,2025年部分月份的人类浏览量同比下降约8%。 基金会认为,生成式AI和社交平台正在改变人们寻找信息的方式:答案仍从维基百科而来,读者却越来越少抵达维基百科。 当访问减少,意味着更少的人有机会成为编辑,也可能带来更少的个人捐款。AI一边消耗公共知识,一边让维系它的人更难被看见。 维基百科开放了阅读权限,也开放了知识的生产过程。任何人都能检查来源,查看一个词条经历过哪些修改,进入讨论页理解争议,发现错误后亲手修正。知识被放在公共空间里,也把自身的形成过程暴露在公共审视之下。 商业AI继承了开放知识的红利,却常常把知识重新装进封闭模型。你能得到答案,很难知道一句话来自哪里,经过
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱