首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

成立九年,中科类脑把积累装进Token工厂

2026-09-24 1 阅读 约9分钟阅读 衡宇
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 成立九年,中科类脑把积累装进Token工厂 衡宇 2026-09-24 08:48:02 来源: 量子位 乔不迟 发自 凹非寺 量子位 | 公众号 QbitAI 卡数、算力规模和PUE(电能利用效率)。 大模型进入规模化推理阶段后,这套标准开始 转向产出端。 同样一批芯片、同样一度电,最终能生成多少 满足质量、时延和稳定性要求的Token(词元)。 芯片通电,只代表生产开始。 计算、存储、网络、模型部署和任务调度,只要有一个环节卡住,昂贵的芯片仍可能低效空转。 中科类脑 瞄准的,正是这段从 资源到智能产出 的转化过程,让同样的芯片、同样的电, 产出更多、成本更低、质量更稳定的Token。 它将自己的体系称为 “算电协同型Token工厂” ,把异构芯片、模型、用户任务和电力放进同一套系统调度,用更少的资源产出更多有效Token。 对外,这套能力落在 BitaHub 彼塔云平台 ; 对内,由 一个决策大脑统筹,电力、算力、Token三个子系统 共同驱动。 算力之上,交付Token 中科类脑合伙人、副总经理常峰,给我们算了一笔价值账,来解释“Token工厂”。 一度工业用电的采购价通常只有几毛钱,转化成算力后,价值可能达到几十元; 进一步形成Token后,部分模型每百万Token的价格可以超过百元。 这里的关键并非简单涨价。 算力是生产设备,电力只是原料,用户提交的提示词和任务进入Token生产线,模型负责完成智能转换。 调度系统决定任务在什么时间、什么地点、使用哪类芯片和哪个模型运行。 客户最终购买的是能够 完成任务、符合指标 的Token服务。 这也确定了中科类脑在产业链中的位置。 传统IDC交付机柜、电力、网络和空间,云厂商提供算力实例与模型接口;中科类脑向上再走一层,即 Token生产运营层 ,试图对Token的生产效率、成本和任务结果负责。 △ 图片由AI生成 常峰将这套商业逻辑概括为两件事: 效能和场景化 。 效能决定每颗芯片、每度电能 生产多少Token ;场景化则决定这些Token能够 产生多大 价值 。 在常峰的规划里,效能和场景同样重要,集中研发资源解决效能问题,组织业务资源解决高价值场景问题,再把产生的高质量token结合业务场景, 实现应用价值的最大化 ,目前已经在AI4S及能源领域形成了可规模化的商业闭环。 BitaHub承担前台角色。 它统一纳管英伟达、昇腾等不同架构的算力,聚合模型API和Token服务,并连接企业私有算力池与公共资源池。 以平均30张、峰值100张芯片的需求为例,企业按日常负载自建,高峰缺口由平台补齐70张芯片,相当于获得了一条 可以弹性扩缩的Token生产线 。 据中科类脑介绍,截至目前平台已接入逾3000个算力节点,总规模超过5000P,累计服务超8万企业及科研用户。 后台则是公司与中国科大团队联合研发的决策大脑,负责 电 算Token一体化系统 从监控、预测到调度、运营的闭环运转 。 因此,中科类脑的核心产品并非某一座机房、某一款芯片或某一个模型。 它提供的是一套跨域生产组织能力:在满足安全、时延和稳定性的前提下,把分散的算力与模型资源组合成可以 持续高质量交付的Token 。 产业链上并不缺资源供给者,稀缺的是把多种资源转化为 稳定高质量产出 的运营者。 先把异构算力跑起来,再叠加电力优化 中科类脑最核心的技术落在 AI系统软件层 :把 算力资源、芯片、模型、电价和任务 纳入同一套决策系统,基于电力条件对算力、模型和任务进行 柔性调度 。 这套系统被概括为 “1+3”架构 :一个决策大脑连接算力、Token和电力三个子系统,先匹配算力、模型与任务,再把电力信号加入全局优化。 首先,它是一套预测与决策模型。 中科类脑CTO、研究院院长丁海松将这套系统的工作节奏拆成三步。 第一步是 监控 ,实时监测Token需求、集群负载、新能源的发电功率、电价以及每份算力的Token产出效率; 第二步是 预测 ,判断未来15分钟、1小时甚至更长时间内绿电出力、电价和任务需求的变化; 第三步才是 决策 ,调整三个子系统的运行方式。 所有决策都以 用户体验、结果质量和系统稳定性 为边界。 同时,它也是能真正执行调度的工程系统。 调度 的核心,是从算力任务中找出 “ 柔性负荷 ” 。 对 首Token时延敏感 的实时任务留在原地;可排队、可断续的批处理任务,则可以转移到电价低谷时段异地运行。 任务可以选择地点,芯片也要重新分工。 常峰将异构芯片调度比作管理一群说着不同语言的员工。 每类芯片的计算能力、显存大小、互联带宽和软件栈各不相同,直接放在一起很难协作。 因此,中科类脑为每种芯片配置了一个 “包工头”式插件 ,调度层只负责分发任务,插件负责指挥同类芯片; 同时插件给每张芯片 建立能力画像 ,记录它擅长什么任务、和谁组合效率更高。 △ 图片由AI生成 解决不同芯片“能否协同”之后,系统还要进一步拆解推理流水线,解决“怎样协同效率更高”。 在大模型推理中,系统还可以把Prefill和Decode拆开,并通过KV Cache迁移把两个阶段连接起来。 Prefill阶段计算密集,交给 计算能力更强 的芯片; Decode更依赖显存和带宽,交给 大显存、高吞吐 芯片。 两阶段之间的KV Cache必须高效迁移,否则长上下文需要重算,时延和吞吐都会受影响。 高端芯片不必包办整条推理链,新旧芯片、国产芯片和海外芯片都能在同一座Token工厂中各司其职。 对长上下文任务,KV Cache相当于模型已读内容的“工作记忆”。让它随任务跨节点迁移,可以减少重算。 另外,训练作业跨集群调度还要同步检查点、优化器状态和数据进度,并控制任务中断时间。 这套系统真正接受检验,是在一次跨上海、芜湖和乌鲁木齐的调度测试中。 整个跨三地调度的控制响应保持在 200秒以内 ,跨域迁移成功率 达到100% ,能耗预测精度 达到98% 。 这次测试验证的不只是搬运:而是把异构适配、跨域迁移、长上下文KV跨节点协同、绿电预测和 SLA 约束放进同一条生产链联动,电力信号让任务按电网压力和绿电供给调整运行地点。 测试体现了系统跨经营主体的调度能力,还额外带来了电力成本的下降。 这也是 全国首个 跨三地算电协同智能调度测试。 现在,这套调度能力有了 常态化运营 的实体载体。 9月17日,皖疆人工智能科技产业园在乌鲁木齐正式开园。园区按照“三中心一平台”布局规划建设,首个突破千P的融合算力中心已经建成投运。 对中科类脑来说,比区域布局更根本的问题,是 壁垒在哪里 。 丁海松的回答很直接:核心壁垒是对 算电Token一体化 的运营能力和理解。 “算力、电力单看,我们可能都在第一梯队。但真正的壁垒不是单项能力,而是 叠加之后的系统级能力 。” 他进一步表示,异构调度和推理优化等算侧能力,也可以追赶, 绿电出力预测 等电侧能力,竞争对手可以补上; 真正困难的部分,是把两套技术语言、两批工
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱