游戏
evening
AI时代,年轻人正在“忘记”打字
2026-09-06
1 阅读
约10分钟阅读
影子备忘录
字号:
文 | 影子备忘录 不知道大家有没有注意到,近年来身边越来越多的年轻人,聊天时不再低着头噼里啪啦地敲屏幕,而是对着手机麦克风,按住说话,于是一段文字便快速生成。 地铁上、咖啡馆里、甚至办公室工位上,随处可见这样的场景:一个人举着手机,嘴唇微动,屏幕上自动跳出一行行文字。“按住说话”这个曾经被视为“老年人不会打字才用的功能”,如今正在成为年轻人的新宠。 更夸张的是,在一些AI编程社区,开发者们已经不再敲代码了,而是对着麦克风说出需求,AI直接生成代码。 一款名叫Typeless的语音编程工具,公测3个月就收获了120万开发者用户,2026年3月完成1.2亿美元A轮融资,估值涨到8.5亿美元。 这不禁让人想问一个问题:在AI的加持下,未来的年轻人,还会打字吗? 从九宫格到“按住说话” 先看几组数据。 三年前,语音输入的日常使用率只有32%。三年后,这个比例已经要达到65%-70%。翻了一倍多。 腾讯搜狗输入法在2026年初宣布全面AI化,其AI用户规模已经破亿,日均语音使用次数接近20亿次,平均每秒超过2万人对着屏幕说话。 《2025年中国第三方输入法行业洞察报告》显示,AI语音输入功能的使用率在所有AI功能中排名第一,达到40.9%。 用户选择“动口不动手”的首要原因,是“避免手动输入繁琐”,占比高达48.60%。 全球范围内,约有84亿台活跃的语音助手,超过一半的智能手机用户每天都会进行一次语音搜索,约32%的消费者如今每天用语音而非打字来搜索。 更值得关注的是趋势。招商证券国际的研报指出,语音输入速度比打字快近3倍。 伦敦政治经济学院与Jabra联合研究预测,到2028年,语音AI将成为主要工作方式。 Jabra全球品牌传播负责人保罗·塞普顿甚至直言:“等到Alpha世代进入职场,AI将全面融入,他们的工作会在打字之前就通过口述完成。” 这些数字背后,是一场正在发生的交互革命。 打字,这个我们习以为常了半个多世纪的人机交互方式,正在被一种更原始、更本能的方式悄悄替代,而这种方式就是说话。 要理解这场变革的深度,有必要先回顾一下输入法走过的路。 中文输入法的历史,本质上是一部“降低输入门槛”的历史。 上世纪80年代,五笔字型横空出世。为了在26个英文字母的键盘上打出成千上万个汉字,王永民发明了一套形码方案,即把汉字拆成字根,再映射到键盘上。 这套方案效率极高,但学习成本也极高。一个普通人要记住上百个字根的键位,没有几个月的刻意练习根本做不到。 90年代,智能ABC和拼音输入法登场。相比五笔,拼音的门槛低得多,只要会拼音,就能打字。但代价是重码率极高,选字频繁,输入效率大打折扣。 进入智能手机时代,输入法迎来了第一次真正意义上的“大众化”,即九宫格和全键盘之争。 九宫格适合单手操作,全键盘更适合双手盲打。两种流派各有所爱,但本质上都是在“用手指在屏幕上点按”。 2010年前后,讯飞输入法率先将语音识别技术引入手机输入法。但那时的语音输入,充其量只是一个“辅助功能”,因为识别准确率堪忧,稍微有点口音就翻车,更别说方言和中英混输了。 大多数用户尝试几次之后,还是会回到键盘。 真正改变游戏规则的,是大语言模型的崛起。 过去的语音识别,是“听字”,只要机器努力听清你发的每一个音,然后机械地转写成字。 而AI加持下的语音识别,是“听话”,机器能够快速理解你在说什么,然后主动帮你组织成通顺的句子。 AI如何让语音输入“脱胎换骨” 2022年,OpenAI开源了Whisper语音识别模型,把通用语音识别的准确率拉到了98%以上。Whisper-1的平均准确率达到92.8%,最高可达98.3%。 这仅仅是个开始。 2025年,硅谷一家公司推出了Scribe v2 Realtime模型,实现了150毫秒的超低延迟和93.5%的高准确率,覆盖90多种语言。换句话说,你说完话的瞬间,文字就已经出来了,几乎感觉不到等待。 但AI带来的进步远不止“快”和“准”。 首先是“理解”。大模型让输入法不再只是“转写工具”,而变成了“理解工具”。过去你说“wo xiang chi fan”,输入法只能机械地给出“我想吃饭”。 现在你说“我想恰饭”,AI知道这是网络用语;你说“我肚子饿了,想搞点吃的”,AI能自动帮你润色成“我饿了,想吃点东西”。 其次是“纠错”。模型让输入法的实时纠错功能已能精准识别音近字、形近字错误,甚至纠正语法逻辑偏差。 再次是“多语言和方言”。如今的输入法大多支持30余种方言识别。豆包输入法实测中文、英文和粤语识别准确度“高得离谱”,粤语夹英文的句子如“Sorry啊,我地已经尽晒力啦”都能一字不差地识别。 字节跳动的Seed-ASR2.0模型在中英文测试集上的错误率比上一代降低了10%-40%。 最后是“场景适配”。豆包输入法提供了150MB的离线语音模型,无网时也能实现0.8秒低延迟语音转换。 电梯、地下车库这类弱网场景,照样能用语音输入。 这些技术进步叠加在一起,产生了一个质变:语音输入从“备胎”变成了“主力”。 年轻人正在“动口不动手” 技术准备好了,用户习惯的变化比想象中更快。 有用户分享了自己的经历:“我用了不到一周的时间,就改变了已经形成20多年的习惯,主要的输入方式从打字变成了语音。”用时53分钟输入5500字,每分钟155字,节省了2.5小时。 一位AI语音输入法的使用者写道:“自从用上它,我已经不想再用键盘打字,不想再用已经有腱鞘炎的手指去编写冗长的Prompt。” 曾经他觉得打字比语音更有逻辑,因为打字迫使他慢下来边写边整理思路。 但现在的AI语音输入法,能够在输入环节把不连贯、缺乏结构的口头表达优化成清晰的提示词。 极客公园的一位编辑也经历了类似的转变:“如果几年前有人跟我说,你以后写稿可能不怎么需要键盘了,我大概会把这句话当成一句玩笑。” 但高频使用AI App的这两年,他越来越清晰地感觉到:“在越来越多的场景里,我不再想‘敲一段字问它’,而是更想‘按住麦克风直接说’。” 这种转变背后的逻辑其实很简单——说话比打字快,也比打字省力。 普通专业人士的打字速度约为每分钟40到60个词,而说话速度高达130到150词。 语音AI听写将这一速度差距转化为实实在在的生产力增益。人类的思维速度约每分钟400字,而打字仅有40字。打字是思维的瓶颈,不是表达的瓶颈。 更关键的是,和AI交互时,用户不用在意错别字、不用在意格式、不用一上来就组织成一段“体面”的文字,甚至可以中途换一个角度,AI依然能跟得上。 这种“低门槛、高容错”的交互方式,天然更符合年轻人的使用习惯。 有观察者发现,很多年轻人(后90后到00后)打字指法都不规范,能盲打的是少数。 Z世代虽然被称为“数字原住民”,但因成长环境偏重移动端,电脑操作能力普遍薄弱。 对于这些“移动互联网原住民”来说,语音输入不是“替代方案”,而是“默认选项”。 大厂押注的“隐形竞赛” 资本和巨头的动向,往往是最敏锐的风向标。 海外市场,Wispr Flow累计融资金额已达8100万美元,估值7亿美元。如果2026年5月的2.6亿美元B轮融资洽谈成功,估值将攀升至20亿美元。 Typeless在2026年3月完成1.2亿美元A轮融资,投后估值达8.5亿美
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱