医疗健康
morning
中国大模型简史03:百模大战开场,不是每张牌都长得一样
摘要
文 | AI资本观 从2023年春天开始,中国科技圈几乎每隔一阵子就会冒出一个新的大模型。 发布会越来越多,模型的名字越来越多。有人看发布会演示,有人申请内测,也有人已经能通过API或者开发者工具试到其中一些能力。 但对大多数普通用户来说,它们仍然隔着一层。 不少产品仍停在邀请测试或有限开放。于是我们不断听说“大模型来了”,却一直很难像打开一个普通网站或App那样,直接进去问一句。 这种情况,一直...
ChatGLM
AI资本观
从2023年春天开始
中国科技圈几乎每隔一阵子就会冒出一个新的大模型
发布会越来越多
模型的名字越来越多
有人看发布会演示
有人申请内测
也有人已经能通过API或者开发者工具试到其中一些能力
但对大多数普通用户来说
2026-09-08
1 阅读
约10分钟阅读
AI资本观
字号:
文 | AI资本观 从2023年春天开始,中国科技圈几乎每隔一阵子就会冒出一个新的大模型。 发布会越来越多,模型的名字越来越多。有人看发布会演示,有人申请内测,也有人已经能通过API或者开发者工具试到其中一些能力。 但对大多数普通用户来说,它们仍然隔着一层。 不少产品仍停在邀请测试或有限开放。于是我们不断听说“大模型来了”,却一直很难像打开一个普通网站或App那样,直接进去问一句。 这种情况,一直持续了几个月。 8月底,几款此前还需要邀请资格或有限测试的国产生成式AI产品,开始直接向普通用户开放。 半年前,投资人一天看二十个项目时,许多团队还在组队、融资,真正把模型发布出来、开放测试的还不多。那时候,能把东西拿出来就已经算上了桌。 等大家陆续都上了桌,人们才发现:这些牌是不是有点多?而且打法也不一样。 这段“百模大战”却“见不得人”的故事,可以从3月14日开始讲。 01|模型走出实验室 2023年3月14日,OpenAI发布了GPT-4。距离ChatGPT上线才三个多月。GPT-4已经可以接收图像和文字输入,OpenAI公布的多项专业测试成绩也明显高于GPT-3.5。 也是在这一天,从OpenAI出走的达里奥·阿莫代伊,带领Anthropic团队结束早期小范围闭测,推出了其旗舰大模型助手Claude及轻量版 Claude Instant,正式迈入前沿大语言模型的公众竞争舞台。 中国这边,同一天发生的另一件事看上去小得多——清华和智谱团队在GitHub公开了ChatGLM-6B的模型文件和代码。 几个月前,GLM-130B还是一个1300亿参数的大模型,团队曾经为训练发散和推理门槛吃过不少苦头。ChatGLM-6B只有62亿参数,单看数字,它甚至像是在往回走。 但它的意义不一样。团队同时给出了训练好的模型文件、调用方式、Web Demo和命令行Demo。开发者可以把模型下载到本地运行,也可以围绕自己的任务继续调试和开发。 2023年3月,ChatGLM-6B开放权重和代码 这个首发版本还远谈不上“谁的电脑都能跑”,默认版本大约需要13GB显存,许可证也仍然限定在非商业研究,但模型文件和代码真正到了开发者手里。 随后一周多里,更省显存的量化版本、API部署和更省资源的微调方式陆续补进项目,外部开发者也开始提交新的网页Demo等工具,其中一个量化版本把显存需求压到大约6GB。ChatGLM-6B成为当年开发者最先“可以玩起来”的中国大模型之一。 接着动起来的是百度。2022年底,李彦宏在百度内部已经说过,“这个事情很难,但百度必须要做”,并启动了内部冲刺。 3月16日,百度召开文心一言发布会,李彦宏走上台亲自介绍。但发布会上展示的文心一言几项核心能力,采用的都是提前录好的视频,而不是现场输入Prompt实时演示。 李彦宏自己测试过产品,也知道还有不少问题,他上台以后甚至直接承认:“不能说百度完全准备好了。” 至于为什么不再等,百度给出的理由是“有市场需求”。百度内部的产品线和合作伙伴都在等。李彦宏认为有了“真实的人类反馈”,也能够帮助产品继续迭代。 发布会进行期间,百度股价一度跌了约10%,后来收盘跌幅有所收窄。尽管股价变化很难只归到这一件事上,但外界当时对用录制的视频演示有不少讨论。 这一天之后,文心一言先进入邀请测试,少数用户可以通过邀请码体验,但真正向全社会全面开放还要再等五个多月。 02|“距离ChatGPT发布,已经第131天了” 也是在这一周,新一批创业者开始逐渐“上桌”,其中声势最盛的,来自创新工场创始人李开复和前搜狗CEO王小川。 3月19日,李开复公开宣布自己“正在亲自筹组Project AI 2.0”,并称“资金、算力陆续到位”。 3月14日一次创新工场活动上,他刚把这一轮变化称作“绝对不能错过的一次革命”,几天后招聘已经开始,招聘方向包括大模型、多模态、NLP、算法研究和工程、分布式计算与Infrastructure等。 那时公司还没有后来定下的“零一万物”这个名字,但李开复已经把目标说得很大:一家面向全球的AI 2.0公司,既想做新的AI平台,也想做以AI为核心的生产力应用,而不是只做一个“中文版ChatGPT”。 王小川的团队动作也很快。 4月10日,北京海淀,搜狐网络大厦二层,王小川穿着一件橙色帽衫,走进一间不到30平方米的会议室。 2023年4月10日,王小川首次公开介绍百川智能|图源:红星新闻 没有PPT,他拿着一台iPad讲,楼上不时传来电钻声——楼上正在装修的,正是王慧文的新公司光年之外。他们几天前刚搬进来。 二月中旬,王小川回复外界追问时还在说“正在快速筹备中”。现在,公司已经成立,名字叫百川智能。 公司主体在3月24日完成注册。4月10日这天,王小川第一次公开亮相。当天公开信的开头,他先数了一遍时间:“今天距离ChatGPT发布,已经第131天了。” 接着他写, 百川准备了5000万美元启动资金,一部分来自王小川个人,一部分来自好友个人支持。王小川说,这笔钱足够公司完成从0到1,他也不希望一开始就背上太大的资本压力。 公司筹建还不到两个月。王小川当时预计,到4月底团队会接近50人,模型训练也已经启动。 王小川公开谈到的方向也不只是一款基础模型,还有搜索、多模态、教育、医疗,以及未来可能出现的超级应用。整个沟通会期间,楼上的电钻声仍不时响起。 03|百模大战,“像在炼丹” 王小川公开亮相百川智能前后,大模型消息突然密了起来。 4月9日,360智脑开始面向企业用户开放内测。4月10日,商汤发布“日日新”大模型体系,昆仑万维宣布“天工”3.5。4月11日,阿里正式展示通义千问,钉钉、天猫精灵将率先接入,阿里云还向企业开放测试,让客户可以用自己的数据做定制模型。 加上百川智能,同期媒体报道把这几天新大模型亮相概括成“3天4款”,说AI赛道已经变得“熙熙攘攘”,国产大模型进入了密集发布期。 再后面,4月13日,知乎和面壁智能公布共同训练的中文大模型“知海图AI”,并开始尝试把它用于知乎热榜摘要;还有5月6日科大讯飞发布讯飞星火,把它接进学习机、办公和汽车等既有产品。 与这些IT、互联网背景的公司不同的“异类”,是来自量化投资行业的幻方——4月11日宣布下场以后,一个多月里,它没有先发布产品。 直到5月24日,幻方创始人梁文锋第一次面向科技媒体36氪比较完整地解释他们准备怎么做。此时,新公司的名字已经出现:深度求索,DeepSeek。 梁文锋当时说,他们“不会过早设计基于模型的一些应用”,准备先把精力放在大模型本身。他也谈到,VC的钱有退出要求,会关心什么时候能够产品化、什么时候形成价值;如果先把很长时间花在基础研究上,双方的周期未必一致。 这种选择有一个重要前提:幻方已经有自己的资金、算力和技术团队,这是作为国内量化投资头部玩家的家底。梁文锋说,人不够时会从幻方临时借调;核心技术岗位里有不少应届或毕业一两年的年轻人,他更看重基础能力、创造性和兴趣。 梁文锋把这种条件说得很直白: 他顺手讲过幻方积累计算卡的过程:最初1张,后来100张、1000张,再到1万张。至少在那次采访里,梁文锋谈得更多的仍然是研究,而不是先选一个行业做应用。 到了5月,零一万物成立。 它就是李
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱