智能AI
morning
李飞飞最新访谈:AI咋能代替人呢?
2026-08-17
1 阅读
约9分钟阅读
一水
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 李飞飞最新访谈:AI咋能代替人呢? 一水 2026-08-16 18:45:47 来源: 量子位 文婷 发自 凹非寺量子位 | 公众号 QbitAI AI咋能代替人呢? 不错,这话是李飞飞说的。 在Huberman Lab最新一期访谈中,李飞飞还讨论了 “为什么苏格拉底是人类历史上最顶尖的‘提示词工程师’” 、 “为什么不能一刀切地禁止学生们用AI” 等非常有趣的话题,并给出了一个笃定的答案: 无论是在医疗、影视、还是教育等领域,AI都不是人类的替代者,而是个人能力的放大镜。 全程高能,重点笔记如下: 我觉得人类一直没吸取的一大教训,就是老一辈总爱哀叹下一代,仿佛年轻人什么都不懂,说他们没规矩、遗忘历史。但 纵观人类历史大脉络,我们整体其实是在向着更好的方向发展。 不能只让少数科技企业替整个社会做决定 ,单纯追逐市场收益的逻辑,绝不能凌驾于社会伦理与大众文化之上。 学术界和医学界有个不成文的潜规则,即掌握技术核心逻辑的人,会刻意回避向大众讲清底层原理,靠信息差守住话语权,可这种做法,对任何人都没有好处.. 只有让人们了解真相,大家才会更有安全感。 想要守护下一代, 一定要看见教师群体,帮扶老师与家长 ,才能真正引导青少年正确使用 AI。 技术变革时代,机遇和阵痛同时存在,我们需要理性、审慎地面对。 本文在不改变原意的基础上,由AI对访谈内容文字实录进行了精校。 看得开心! AI还缺什么? 主持人(Andrew Huberman): 飞飞,我们今天先从 视觉 开始聊聊AI吧。很多人觉得光线感知和AI离得很远,但它其实是AI发展的一大起点? 李飞飞: 没错, 视觉是智能的基石。 我们可以沿着生物演化和计算机视觉两条脉络来理解它。 从生物演化来看,5.4亿年前远古海洋生物第一次“看见”光,感光细胞的出现直接催生了寒武纪物种大爆发。对人类而言同样如此,我们大脑皮层一半的神经活动都与视觉相关,婴幼儿也是先学会“看”,再学会“说”。 对AI而言,视觉对它的贡献主要体现在 提供算法灵感 和 促进数据觉醒 两方面。 第一是 算法灵感 。上世纪50年代,科学家们发现哺乳动物的视觉系统具有层级神经结构,这直接启发了早期神经网络的设计。 如今,模型参数的规模虽已暴涨,但其根源仍可追溯至生物视觉研究。 第二是 数据觉醒 。本世纪初,算法效果始终不太理想,2006年我在普林斯顿做研究时才意识到, 卡脖子的可能并不是算法,而是训练数据太少了。 你想想看,一个孩子到6岁便能认出桌子、椅子、花等几万样东西,靠的就是成长过程中看过的海量画面。 受这个启发,我们才不再死磕算法,转而发起ImageNet项目,攒出了千万级的图片数据集。 等到2012年, 大数据集、深度神经网络和GPU算力三者碰头,现代AI才算真正迎来了转折点。 主持人: 2012年前后,AI的图像识别能力突然上了一个大台阶。以前连相似的人脸都分不清,2012年之后一下子就能精准认出谁是谁,这背后到底发生了什么? 李飞飞: 就是刚才所说的 “GPU并行算力提升、神经网络技术成熟、互联网带来海量数据”三要素集齐了。 拿ImageNet图像识别竞赛举个例子, 人去分辨一千种物品,识别错误率大概只有4% ,且我们认错大多不是看得太仓促,纯粹是东西长得太像,或是记混了品类。 而早年神经网络的错误率虽然下降了一大截,但始终比不上人类;一直到2016年,算法识别准确度才第一次超过人。 语音、听觉方向的发展路径,和图像识别几乎一模一样。 2016到2017年Transformer架构出来之后,性能很快就甩开了图像领域最早的经典模型AlexNet; 随后,靠着更完善的网络结构、海量文本素材,再加上GPU算力支撑,经过整整五年的迭代优化,ChatGPT才在2022年正式问世。 主持人: 我觉得人身上有个特别厉害的天赋,叫 物体恒存。 好比我们只看见一截猫尾巴,结合上房间里这个的环境便能立马能判断这是一只家里养的猫,而不是狐狸。 你觉得AI什么时候才能拥有这种结合场景自主推理的能力呢? 李飞飞: 现在的大模型依靠海量数据,确实能做出差不多的判断,但 底层逻辑和人脑完全是两码事。 小孩子只见过几只猫,就能举一反三认出所有猫;可AI得刷完网上几乎所有猫咪图片,依靠数据里的统计规律去分辨。 两者的学习逻辑天差地别 ,背后还有一大堆待破解的科学难题。 主持人: 后来AI还能让静态图动起来,比如让图片里的猫追着老鼠跑,这又是怎么实现的? 李飞飞: 关键就是 往训练数据里加大量新的视频素材 ,一个标志性的节点就是 2024年Sora发布。 不过, 当时的算法仍建立在神经网络框架之上,尚未出现颠覆性的技术革新。 所以模型还是看不懂猫的肌肉构造及身体结构 ,只能靠着海量的视频摸透了物体运动的统计规律,并生成看着符合常识的动作; 这也就解释了为什么AI生成的画面会经常出现别扭或不合理的bug了。 主持人: 那往更深一层说,像自主创造力、独属于个人的内心感受呢? AI所有训练素材都来源于网络,但人太多私密的内心体验根本不会发到网上。就像欣赏抽象画作时独有的情绪、想起小时候老家那种专属自己的感触, AI是不是永远都欠缺这部分感知? 李飞飞: 你问到了最核心的一点。 互联网汇集了人类图文、影像等各式各样的行为数据,这也是AI之所以强大的根本。 但那些高度私人化的思绪、情绪与心底的感触,没有任何形式的记录,网上自然找不到相关数据, AI根本没办法学习和体会。 举个例子,AlphaGo下出的第37手,看着好像具备了创造力,可围棋有一套完整严谨的数学规则; 反观不少 顶尖数学难题 ,需要人类跳出固有框架想出全新解法, 这类问题我更看好人和AI配合协作攻克。 至于看到一只杯子,瞬间勾起只属于自己的童年往事,这种 私人又主观的情感体验,是现阶段AI完全触碰不到的局限。 主持人: 那将来如果用上无创脑机设备,直接读取大脑里的信号,能不能补上这块短板? 李飞飞: 单从理论技术层面来讲有实现的可能,但有一个硬性前提是“人内心的心理活动信号,得能被传感器捕捉识别。” 要是连我们自己都没办法用语言或者动作把内心细腻的感受表达出来,机器自然也就获取不到对应的信息。 主持人: 那直觉、内心诉求、紧迫感这类发自本能的内在状态呢?AI有可能产生真正属于自己的内在驱动力吗? 李飞飞: 现在我们能通过设定目标函数,让AI模仿出近似的效果,像是深度思考模式、快速应答模式等等。 可这些说到底也 只是调整数学参数而已 , AI不会生出真实的恐惧、喜爱,更不存在发自本心的共情。 它说出那些安抚人的话语,只是套用学到的语言表达模式(learned language patterns),和人类发自心底的共情完全是两回事, 这一点很有必要跟大众好好科普清楚。 主持人: 那如今,AI技术迭代地这么快,监管部门、普通大众还有行业从业者,要怎么把握分寸,平衡技术创新和潜在风险? 李飞飞: 这也是我在斯坦福大学创办 HAI(以人为
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱