智能AI
morning
4.8亿美元砸向端侧算力!Agent芯片新贵冲出重围
摘要
4.8亿美元砸向端侧算力!Agent芯片新贵冲出重围 思邈 2026-08-13 20:34:42 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号 QbitAI 成立不到三年,首颗AI芯片进入量产,又拿下 1.3亿美元 B轮融资,Acrab正在成为亚洲AI芯片市场里最值得关注的新贵之一。 据DealStreetAsia报道,这家总部位于新加坡的AI计算基础设施公司近日完成B轮融资,Vert...
量子位
8亿美元砸向端侧算力
Agent芯片新贵冲出重围
2026
凹非寺
公众号
QbitAI
成立不到三年
首颗AI芯片进入量产
又拿下
2026-08-13
1 阅读
约9分钟阅读
思邈
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 4.8亿美元砸向端侧算力!Agent芯片新贵冲出重围 思邈 2026-08-13 20:34:42 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号 QbitAI 成立不到三年,首颗AI芯片进入量产,又拿下 1.3亿美元 B轮融资,Acrab正在成为亚洲AI芯片市场里最值得关注的新贵之一。 据DealStreetAsia报道,这家总部位于新加坡的AI计算基础设施公司近日完成B轮融资,Vertex Growth等机构参与投资。 完成本轮融资后,Acrab累计融资已经超过4.8亿美元 。新资金将用于扩大产品产能、拓展技术生态,并加快下一代AI计算平台的研发。 Acrab成立于2024年。不到一个月前,该公司刚刚发布 第一代端侧AI芯片GΞLIX 1 ,以及搭载这颗芯片的 个人AI中心Agent Box 。首代产品已经开始客户导入,并进入规模化生产准备阶段。 对于一家芯片创业公司来说,这样的速度并不常见。 过去两年,AI基础设施最确定、也最拥挤的故事几乎都发生在云端。 大模型越来越大,GPU越来越贵,微软、谷歌、Meta、亚马逊继续加码数据中心,英伟达则站在这一轮算力扩张最核心的位置。 但AI不会永远只待在数据中心。 随着模型持续压缩、推理效率提升,PC、汽车、机器人以及更多智能终端能够承担的AI任务正在增加。 下一轮算力需求,也开始从“训练更大的模型”,向“让智能真正进入每一台设备”延伸。 Acrab押的,就是这部分正在增长的计算需求。 云端已经很挤,下一轮AI算力开始往端侧走 大模型时代的第一场基础设施战争,是一场典型的重资本游戏。 训练和运行更大的模型,需要更多GPU、更高带宽和更复杂的数据中心。 随着模型规模不断上升,资金、供应链和工程能力都在迅速抬高门槛,云端算力越来越成为少数巨头能够长期参与的竞争。 相比之下,端侧AI过去承担的任务要轻得多。 拍照、降噪、语音识别等固定功能,一块NPU已经足以覆盖大部分需求,真正复杂的大模型推理仍然主要发生在云端。 但这两年,这个边界开始移动。 一方面,模型量化、压缩和推理优化不断推进,相同算力能够运行的模型越来越强; 另一方面,PC、汽车和机器人本身的内存、带宽和AI算力也在持续提升。 过去因为模型太大、设备算力不够,只能送到云端完成的任务,开始有条件留在本地。 Agent又进一步放大了这种需求。 个人文件、长期记忆、日程、设备状态和实时交互,本身就产生在终端。 一个长期工作的Agent,如果每读取一份文件、调用一次工具、更新一次状态都需要往返云端,不仅会不断累积延迟,推高Token账单,也意味着大量个人和设备数据需要持续上传。 随着Agent从偶尔问答转向全天候运行,按Token计费的云端模式给用户带来了难以持续的成本压力。 这并不意味着端侧会取代云端。 更可能出现的是新的分工:最复杂、最重的推理继续留在数据中心,而 高频、隐私敏感、需要低延迟和长期保持状态的任务 ,逐步向 终端 迁移。 这会直接抬高终端对AI算力的需求。模型能力越强,能够留在本地完成的任务越多;本地任务越复杂,对内存、带宽和计算性能的要求也越高。 硬件厂商已经开始为这种变化做准备。 AMD提出Agent Computer,高通和NVIDIA也开始把更完整的本地AI能力放进PC和边缘计算平台。 产品形态不同,但方向相近:下一轮AI基础设施竞争,不会只发生在越来越大的数据中心,也会发生在越来越强的终端上。 Acrab选择的正是这个位置。 它没有进入已经高度拥挤的云端GPU战场,而是从一开始就依托大型服务器芯片系统经验,围绕端侧大模型和Agent设计计算平台,切入高端端侧AI服务器市场,押注 模型能力持续下沉后对端侧算力的长期升级需求 。 这个技术门槛,也远高于传统消费电子产品。Acrab将一支具备 大规模服务器芯片与系统软件经验 的团队,带入了传统3C团队难以触及的技术深水区。 Agent起来之后,终端需要的不只是一块NPU 端侧模型能力往前走的同时,AI本身消耗算力的方式也在变化。 过去的大模型应用,大部分时候仍然是一问一答:用户给出输入,模型完成推理并生成结果,一轮计算随之结束。Agent真正开始工作以后,一次请求却会被拉长成一条持续运行的任务链。 微软Azure研究团队近期发布的《Architectural Implications of Agentic AI Workflows》,正是在生产环境里观察到了这种变化。 研究发现,Agent任务会不断在模型推理、工具调用和任务编排之间切换,反复跨越CPU与GPU边界; 与此同时,算力需求也不再像传统推理那样相对稳定,而是出现明显的等待、恢复和短时峰值。 这意味着,Agent时代的端侧芯片不能只比一个TOPS数字。 CPU、NPU、内存和软件环境需要一起工作,一台设备能不能长时间承载Agent,越来越像一道系统题。 这与Acrab CEO Ken Phua的判断不谋而合。 他曾在Arm UK负责亚太应用工程并参与全球IP策略制定,之后担任 Arm China联席CEO 。 在他看来,AI进入异构计算阶段后,执行效率不仅取决于NPU,也取决于CPU与NPU能否顺畅协同。 因此,Acrab最近发布的AI芯片 GΞLIX 1 不只强调 700TOPS峰值算力 。 统一内存、CPU与NPU协同、Prefill(输入处理)和Agent编排,也被同时放进了产品设计里。 这套产品思路也写在了公司名称里。Acrab取自Agentic Compute、Reasoning、Action与Brain的首字母, 也来自天蝎座β星这一多恒星系统,寓意不同计算单元协同运行 。 Acrab还公布了一组长上下文测试。 在运行Gemma 26B A4B模型、4万Token上下文缓存和1万Token输入的条件下,GΞLIX 1的平台Prefill速度达到1416 Token/s,比业界领先的端侧AI计算平台快7倍。 值得一提的是,这组数据来自公司自测,实际表现还会受到模型加载、软件调度和具体任务影响,仍需第三方进一步验证。 但Acrab把Prefill、统一内存和异构协同放在核心位置,也说明它瞄准的不只是模型能不能跑起来,而是长上下文和Agent任务真正进入终端之后,对整套计算效率的要求。 换句话说,Acrab押的不是“端侧还需要一颗更快的NPU”,而是当本地AI从一次推理走向长期工作, 终端会需要一套新的计算底座 。 从GΞLIX 1到Agent Box,Acrab开始走向量产 GΞLIX的名字取意于“Helix(螺旋)”,公司借用DNA演化与适应的意象,表达这套计算平台支持AI持续演进、适应环境和进行长期规划的目标。 基于GΞLIX 1,Acrab还做了 Agent Box 。 它被定义为Personal AI Center,是一台可以直接放在桌面上的小型端侧AI设备,搭载GΞLIX 1,可以在本地运行千亿参数级模型,并整合长期
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱