智能AI
morning
五年前的一次选择,成了中国智能时代的王炸
摘要
新智元报道 2022年12月,ChatGPT的横空出世点燃了AI时代的烽火,人们一下发现,机器似乎真的拥有了智能。 「ChatGPT时刻」就成了智能起点的代名词。 然而这个 算法 ,漏掉了一台中国的机器 。 曙光8000 。 近日,央视大型纪录片《超级工程》再度回归,这一次中国算力基础设施走向台前。 纪录片复盘了首个全国产十万卡AI超集群曙光8000(登峰)从技术路线选择、关键技术攻关到工程交付、...
新智元报道
2022年12月
ChatGPT的横空出世点燃了AI时代的烽火
人们一下发现
机器似乎真的拥有了智能
ChatGPT时刻
就成了智能起点的代名词
然而这个
漏掉了一台中国的机器
曙光8000
2026-09-26
1 阅读
约8分钟阅读
新智元
字号:
新智元报道 2022年12月,ChatGPT的横空出世点燃了AI时代的烽火,人们一下发现,机器似乎真的拥有了智能。 「ChatGPT时刻」就成了智能起点的代名词。 然而这个 算法 ,漏掉了一台中国的机器 。 曙光8000 。 近日,央视大型纪录片《超级工程》再度回归,这一次中国算力基础设施走向台前。 纪录片复盘了首个全国产十万卡AI超集群曙光8000(登峰)从技术路线选择、关键技术攻关到工程交付、科研应用的全过程。 2021年底,曙光8000立项时,人工智能还处在「小模型时代」。 受限于算力(GPU尚未普及)、数据规模和算法架构,模型参数通常在百万级甚至更低。 它们主要执行的是判别式任务——比如人脸识别、语音唤醒词识别,基本不具备生成和理解复杂语义的能力。 当时几乎没人想到,智能时代很快会需要一台「超级机器」。 中科曙光团队却果断决策, 花5年时间,用10万张国产智能计算芯片,建一台既能做高精度科学计算,又能训练 AI 大模型的AI超集群 。 两年后,大模型引发的智能海啸席卷全球。 在无人区里押中一条路 曙光8000的 第一个难题,不是怎么造,而是决定要造一台什么样的机器 。 超集群的研制周期很长,方案落定时似乎看的是当下,真正建成时却要赌几年后的技术环境与市场需求。选早了,技术可能还不成熟;选晚了,机器落地就会过时。 曙光8000正式立项时,主流AI仍以「小模型」为主,传统高性能计算最擅长的是依靠数学模型进行高精度计算,而智能计算则追求更高数据吞吐的低精度算力。两条路原本各有自己的系统,混合计算往往意味着跨平台调度和频繁搬运数据。 时任中科曙光总裁的历军预判,等机器建成时「数学的方法和数据的方法同等重要」,也就是既要算得准,也要算得快。 中科曙光因此提出超智融合路线,让高精度科学计算和低精度智能计算运行在同一套系统里 ,从FP64到INT8覆盖多种计算精度。 这个决定并不轻松。 因为,方向一旦确定,技术路线很难中途更改。团队用了至少一年,反复与业界专家、科学家和产业伙伴沟通,最终超智融合这条技术路线被确定下来。 但很快,这个需要反复解释的判断,开始显出独特战略价值。 2021年,破解蛋白质折叠难题的重磅论文登上《自然》;紧接着,ChatGPT正式发布,震撼全球。由此,人们第一次看清,支撑这场智能革命的,不再是传统的数学推演,而是由超级算力托举的全新智能计算方法。 如今,当世界模型、物理AI、多模态、AI for Science等更加复杂的应用场景成为趋势,未来的算力标准恰恰是「算得准」与「算得快」兼得——训练推理需要低精度算力的吞吐,科学验证、模拟物理世界又离不开高精度计算的可靠。 凭借超智融合路线的精准「押注」,曙光8000把从FP64到INT8的全精度计算放进同一套系统, 一台机器,既能模拟气候变化、探索生命密码,也能训练大模型 。 十万卡背后,每一道坎都要自己过 路线正确只是开始。要把图纸上的超智融合变成一台可以稳定运行的机器,团队面对的是一整套放大后的难题。 从曙光7000的6万卡跨向10万卡,多出来的绝非只是芯片数量。曙光8000工程难度在于,横跨60多个细分学科、800多道工业工序,全流程管控参数数以亿计。 节点之间的网络传输要达到每秒800G,数据读写时间要压到0.202毫秒, 10万张芯片运行一小时产生的热量,约等于12吨标准煤燃烧的放热量 。计算、网络、存储、供电、散热,任何一环跟不上,整台机器都会等待。 更棘手的是,一些关键环节在国内没有现成答案。 为了8颗智算芯片的高速互联,系统需要一枚能够高效汇聚和调度数据的交换芯片。 当时国内在这一领域还是空白 。不把它做出来,全栈自研就会卡在最核心的数据交换处。 团队只能继续往下拆。从芯片、计算系统、存储、高速网络到液冷散热,把每个薄弱环节逐个补上。 规模越大,小概率故障越会成为日常。曙光8000的网络团队, 在交换芯片里设计了可自主避险的「智能开关」,一旦链路发生故障,信号可以在毫秒级切换到备用路径,不必等待中央调度 。存储和散热团队也在同时解决自己的极限问题。 最终,整套系统覆盖「芯片、计算、存储、网络、散热、应用、服务」全链路, 主要核心技术全面实现了国产化 。 80多组高密度机柜,10万张智能计算芯片,超过1万个计算节点,但它的真正难度藏在数字背后: 一秒钟的设计运算量,相当于全球80亿人昼夜不停连续计算200年 。如此庞大的系统,仍要在漫长运行中保持稳定。这不能寄望于某一项技术的灵光一现,必须让整个系统都没有明显短板。 三十年憋着的一口气 曙光8000这张张巨大的工程清单背后,站着一支做了三十多年高性能计算的队伍。 20世纪80年代, 国内曾因租用超级计算机,不得不在严格监控下完成操作 。那段经历让中科曙光创始人李国杰和同行们很难忘记。 1991年,他带领团队开始研制曙光一号。出发前,几个年轻人在研究中心小楼的黑板上写下七个字: 「人生能有几回搏」 。 不到两年,曙光一号研制成功,峰值运算速度达到每秒6.4亿次,改变了当时国内高性能计算受限的局面。 三十多年后,当年需要曙光一号运行整整一天的计算,一部普通手机不到一秒就能完成。但研发人员的日常没有因此变得轻松。 中科曙光现任董事长历军形容这些年的工作:「每天就追(进度),哪个不行就搞哪个,差不多几年就是一代。」 起步稍晚,就试着跑得更快一点 。三十年,就这样一代接着一代走了过来。 到曙光8000,这些积累被一次性调动起来。超智融合路线需要架构研发,十万卡规模需要网络、存储和散热协同, 落地 运行还需要建筑、供电、装配和联调联试团队接力。数千人、上千个日夜,最后汇聚在一次整机测试上。 当曙光8000达到预期最大峰值,完成的不只是一台新机器,还有三十多年技术、经验和人才的集中验证。 「好钢用在刀口上,用在真正解决国家最急需要解决的一些问题上, 曙光,是个好钢 。」这一点中科曙光做到了! 比起超集群本身,中科曙光团队那次提前押下的选择,以及把选择一寸寸落地的三十年积累,才是这个项目最难复制的部分。 所以并没有什么「赌赢了AI时代」, 中国科技的每一次飞跃,答案都藏在一代代科技工作者用青春作出的选择与坚持 。 关于曙光8000的故事还不止于此。从技术攻关到整机落地,再到它真正服务科研的时刻,更多答案,正在纪录片接下来的篇章里慢慢展开。 编辑:摩西 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 文章原文
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱