首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

亮出“中国最强AI芯片”还不够,平头哥又甩出一手开源

摘要

亮出“中国最强AI芯片”还不够,平头哥又甩出一手开源 henry 2026-09-25 18:00:14 来源: 量子位 大厂造芯,正在从交付芯片,走向更广泛的开放共建阶段。 henry 发自 凹非寺 量子位 | 公众号 QbitAI “这是目前中国算力性能最强的AI芯片,性能达到M890的3倍。” 9月22日的云栖大会上,阿里巴巴集团CEO吴泳铭这样介绍新一代真武V900。 这款最强AI芯片的出...

Head for SAIL henry 量子位 走向更广泛的开放共建阶段 sail FlashAttention 中国最强AI芯片 还不够
2026-09-25 1 阅读 约9分钟阅读 henry
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 亮出“中国最强AI芯片”还不够,平头哥又甩出一手开源 henry 2026-09-25 18:00:14 来源: 量子位 大厂造芯,正在从交付芯片,走向更广泛的开放共建阶段。 henry 发自 凹非寺 量子位 | 公众号 QbitAI “这是目前中国算力性能最强的AI芯片,性能达到M890的3倍。” 9月22日的云栖大会上,阿里巴巴集团CEO吴泳铭这样介绍新一代真武V900。 这款最强AI芯片的出鞘,将平头哥的算力「硬实力」推到了聚光灯下。但对于考虑换用真武的客户,还有另一件事要确认:过去写下的代码、积累的工具和开发经验,能不能一起带过来? 芯片之外,软件生态的「软实力」同样决定着客户的选择。 一天后的9月23日,平头哥公布了AI软件栈 T-Head SAIL 的最新开源进展,进一步扩大框架适配、加速库、工具链和通信库等领域的开放范围。 在平头哥的比喻里,AI芯片是发动机,软件栈则相当于“变速箱+传动系统+驾驶系统”。 发动机性能再强,最终能发挥多少,还取决于软件能否让模型顺利迁移、运行和优化。 现在,这套配套软件正进一步向开发者开放。 据悉,真武AI芯片已服务20多个行业的650多家客户,蚂蚁、小红书、小鹏汽车等头部企业已经开始使用 T-Head SAIL 。 其中,小红书还基于T-Head SAIL开源代码,开发了模型迁移与算子优化Agent,用来加速生成式推荐模型在真武上的部署。 可以说,平头哥提供基础软件能力,客户则把自己的业务经验写进工具,继续做迁移和优化,芯片背后的生态软实力,也在这样的参与中逐渐积累。 而以阿里为代表的大厂造芯,也正在从交付芯片,走向更广泛的开放共建阶段。 这次,平头哥具体打开了什么? 简单说来, T-Head SAIL 可以理解为阿里平头哥围绕真武AI芯片打造的一套类“CUDA”软件栈。 它连接PyTorch等上层AI框架和底层真武硬件,负责模型迁移、编译执行、计算加速和开发调试。 今年7月WAIC上,平头哥宣布启动 T-Head SAIL开源 ,并向开发者提供SDK、驱动、性能分析与调试工具,以及相关技术文档的下载。 两个多月后的云栖大会,团队公布了进一步的开源进展。已开源项目包括PyTorch-for-sail框架适配、sailify源码迁移工具、Triton-for-sail算子开发工具,以及DeepGEMM-for-sail、FlashAttention-for-sail等计算加速项目。 从调试工具、技术文档到开源框架,随着更多工具和资源的开放,SAIL让开发者能够深入了解软件的具体实现,并根据业务需要查看、修改代码。 而这些工具和资源,回应的正是开发者在实际业务中遇到的几个关键问题: 1、先解决迁移:过去攒下来的东西,别因为换芯片全重来。 “最大的诉求,从业务角度来说,就是迁移成本有多大。”在公开演讲时,平头哥半导体软件生态资深总监陆生华这样表示。 这并不难理解。不少客户的软件已经在线上跑了很多年。代码改过一轮又一轮,工具早就用顺手了,团队也有自己的一套调优经验。 换一款芯片,意味着这些积累都要重新接受检验,业务还不能因此中断。 框架适配、源码迁移和算子开发工具,首先要做的就是尽可能保留这些积累。开发者可以继续沿用熟悉的模型开发方式,由迁移工具辅助处理已有代码,再根据新硬件的特点完成必要的适配。 只有过去的积累越容易带走,中国芯片才更有机会成为实际可用的选择。 2、模型跑起来之后,还得继续抠性能。 然而,迁移跑通,只是第一步。如果换了芯片之后,效率只剩原来的30%-40%,那即便模型能跑起来,实际业务里也很难接受。 所以接下来马上就会碰到第二个问题: 同一个模型,能不能跑得更快?资源还能不能再省一点? 这时候,只靠厂商把工具做好还不够,DeepGEMM-for-sail、FlashAttention-for-sail这类计算加速项目开源的意义,也就显现出来了。 开源之后,开发者不只是把现成工具下载下来用,还可以直接看到里面是怎么实现的,再根据自己的模型和业务负载继续改。 过去需要交回芯片厂商的问题,现在业务团队有机会自己定位、自己优化。更了解模型的人,可以直接参与决定模型怎样在芯片上运行。 换句话说,T-Head SAIL开源不是多了一个下载入口,而是让开发者真正参与到芯片性能优化里。 3、新模型出来后,最好Day 0就能跑。 对于不少开发者来说,还有一个迫切需求就是—— 新模型发布当天,最好就能在自己的算力平台上试起来。 现在模型的更新节奏基本上是几周一更。如果适配慢了一轮,业务团队尝试新技术的时间也会跟着推迟。尽快支持新模型,甚至做到Day 0可用,已经成为客户对算力平台的期待。 平头哥也在持续提供面向真武适配的模型资源。按照现场演讲披露的数据,截至2026年9月,其在ModelScope上已提供 39个量化模型,覆盖Qwen、DeepSeek、Kimi等系列,累计下载超过34.8万次。 这些已经完成适配的模型,可以减少用户自行准备的工作,让部署和测试更早开始。 与此同时,TensorFlow、JAX适配版本、自研推理引擎,以及PCCL、DeepEP-for-sail等通信组件和调试监控工具,也还在推进开源。 未来,随着更多代码和工具开放,开发者能够参与的工作也在增加:把原有业务迁到真武上,再按自己的需求修改、优化,甚至开发新的工具。 而这种变化,已经能从小鹏、蚂蚁和小红书等客户的实践中看到。 代码打开之后,开发者开始自己动手 小鹏解决的,是把已有业务迁到新平台上。 借助SAIL,小鹏将原先运行在GPU平台上的业务模型迁到真武云端集群,开展智能驾驶模型训练。 迁移之后,团队继续利用SAIL的性能分析工具定位训练瓶颈,再围绕算子和框架进行优化。 训练任务换了硬件,开发者仍希望沿用熟悉的工作方式。SAIL支持C++、Triton、TileLang等开发方式,目的就是减少重新学习的负担,让团队把精力放在模型和业务本身。 蚂蚁面对的,则是模型适配之后的持续调优。 目前,蚂蚁集团推理服务团队已经基于SAIL,在真武810E和M890上完成主要前沿模型的推理适配。接下来,量化、推理阶段分离、专家并行负载均衡、稀疏注意力接入等工作仍在继续。 模型能返回正确结果,只解决了功能问题。面向真实的推理服务,团队还需要不断改善处理效率和资源开销,软件优化会伴随业务持续进行。 小红书又往前走了一步,把迁移和优化做成了自己的工具。 基于SAIL开源代码,小红书面向真武架构开发了模型迁移与算子优化Agent,用自动化方式辅助优化,加速生成式推荐模型的部署上线。 在这个过程中,客户可以把自己的模型经验和业务需求写进工具,形成适合自身场景的优化方法。厂商提供的基础实现,成为了下一轮开发的起点。 这也回应了陆生华在采访中提到的一个矛盾: 客户想针对芯片开发高性能算子,往往又需要保护自己的算法和知识产权。算法细节不方便交出去,芯片厂商却需要了解这些细节,
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱