首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
游戏 morning

万亿市场背后,AI数据基础设施的竞赛已经开始

摘要

文 | 新眸,作者 | 鹿尧 AI正在进入一个有点反直觉的阶段:模型越来越强,企业却越来越发现,真正卡住AI落地的,不一定是模型。 刚刚结束的2026 Inclusion·外滩大会上,IDC中国企业软件市场研究经理王楠发布了一份关于AI数据基础设施的研究。报告给出的一个判断值得琢磨:在越来越多企业级应用中,大模型本身的能力已经不再是唯一的主要瓶颈,真正卡住AI从试点走向规模化落地的,正在变成数据能...

音视频 AI正在进入一个有点反直觉的阶段 模型越来越强 企业却越来越发现 真正卡住AI落地的 不一定是模型 刚刚结束的2026 Inclusion 外滩大会上 IDC中国企业软件市场研究经理王楠发布了一份关于AI数据基础设施的研究
2026-09-17 1 阅读 约10分钟阅读 新眸
分享:
字号:
文 | 新眸,作者 | 鹿尧 AI正在进入一个有点反直觉的阶段:模型越来越强,企业却越来越发现,真正卡住AI落地的,不一定是模型。 刚刚结束的2026 Inclusion·外滩大会上,IDC中国企业软件市场研究经理王楠发布了一份关于AI数据基础设施的研究。报告给出的一个判断值得琢磨:在越来越多企业级应用中,大模型本身的能力已经不再是唯一的主要瓶颈,真正卡住AI从试点走向规模化落地的,正在变成数据能力。 这个变化放在两年前很难想象。 那时候行业的注意力全在模型和算力上,基座参数一路往上堆,推理芯片一卡难求,企业采购清单里GPU占了大头。 但到了2026年,企业AI落地的真实痛点正在发生变化。 邓白氏覆盖32个国家1万家企业的调查显示,97%的企业正在推进AI项目,只有5%认为自身的数据做好了充分准备。Forrester在今年初的研究里给出更具体的归因,大部分RAG实施失败可以追溯到数据质量问题,而非检索算法或语言模型本身。 行业的瓶颈正在换位置。AI上半场拼模型和算力,下半场拼的是数据基础设施。 模型够用了,数据卡住了 一个越来越普遍的现象是,模型买回来、算力租好了,AI项目却卡在了试点到生产的那一步。 Databricks的调查显示,仅有37%的高管认为其生成式AI应用已经具备投入生产的能力。IDC的调研把这个问题拆得更细,46%的企业表示AI数据准备工作是2026年的首要任务,企业新生成的数据资产大约90%是非结构化形态,文档、图片、音视频、向量数据大量涌入,但传统数据架构主要服务于交易、分析和报表,处理不了这些新东西。 再加上跨部门的数据孤岛、口径不一致导致的AI回答失真、高延迟支撑不了Agent的实时响应,每一个都是硬骨头。 企业不缺AI的意愿,缺的是让AI能用起来的数据。 问题不只是数据更多了,而是数据的使用方式也变了。过去,数据主要服务业务系统和人;现在,Agent也开始成为数据的使用者。过去,数据库主要处理结构化数据;现在,文档、图片、音视频、向量等非结构化数据不断进入生产系统。过去,数据能存、能查就够了;现在,AI需要的是实时、统一、可理解、可调用的数据。 这几种变化叠在一起,传统架构的缺口被进一步放大。 中国数据生成量的增速也在加剧这个矛盾。IDC预计,中国数据生成量将从2025年的76.05ZB增长到2030年的146.65ZB,五年接近翻倍。数据量在涨,数据形态在变,传统架构的处理能力却没有跟上。 Databricks在一篇博客里把话说得更透彻,银行没有AI问题,它们有数据平台问题。客户、风险、产品的数据碎片化且不一致,AI再强也跑不出结果。 换句话说,AI的瓶颈正在从“有没有模型”,变成“AI能不能拿到正确的数据”。 这件事的底层逻辑是,AI的成本结构变了。上半场成本主要在算力,买更多GPU就能训练更大的模型。下半场成本主要在数据工程,找数据、洗数据、管数据、让数据能被AI理解和调用,占了AI项目大部分的时间和预算。 当模型不再是唯一稀缺资源,如何把企业自己的数据真正变成AI可以使用的资源,开始成为新的竞争点。 被重构的数据底座 如果说大模型时代的数据需求还停留在RAG检索层面,Agent时代就完全不一样了。 Agent要替人干活,要实时查库存、调订单、做决策、执行操作。它需要的已经超出了静态知识库的范畴,是一个能实时、可靠、统一管理多模态数据,还能被AI理解和调用的底座。 IDC把这个新市场定义为AI数据基础设施,划成三大主要领域。 AI数据平台负责多模态数据的统一管理和处理,是AI应用的数据底座。AI数据智能利用AI提升数据治理、分析和使用效率,是增速最快的细分市场,2025到2030年复合增长率达到48.2%,增长动力已经从传统治理工具升级转向大模型和Agent驱动的数据价值迁移。AI数据服务则从传统标注走向知识库运营、评测数据、合成数据等持续性服务,复合增长率30.7%。 王楠在发布会上说,未来竞争的关键在于谁能率先形成覆盖数据管理、数据智能、数据服务到Agent消费的完整闭环,关键路径是小模型加多模态底座。 行业玩家已经开始沿着这条路径调整。 今年6月,Databricks在Data+AI Summit上发布了LTAP架构,把交易、分析、流处理和运营数据统一到湖仓的一份存储上,从设计上消除了ETL和数据管道。Databricks CTO Matei Zaharia在会上讲了一个观点,把数据放到正确的位置,然后叠加通用智能体,系统就会运转,但前提是数据要到位。同期发布的Lakebase和Agent Bricks,本质上都是在补数据平台这一层。 国内的动作几乎同步。 6月29日,OceanBase在线上发布会上推出了面向AI时代的湖库一体AI数据库,同时亮相的还有Lakebase、DataStudio、DataPilot等产品。OceanBase CEO杨冰在发布会上说,这已经超出了传统数据库功能升级的范畴,是面向AI时代的一次基础设施重建。 OceanBase给这套产品的定位是三层。 底层Lakebase融合数据库、开放存储、分析和多模态数据处理,构建企业全量数据的一体化底座。中层DataStudio覆盖数据接入、加工、编排、语义建模到Agent协作,把分散的数据资产转化为可调用的数据服务。上层DataPilot让业务人员用自然语言就能查数据、做归因分析、生成看板,把数据能力从工程师手里释放到业务人员和Agent手里。 从这个路径看,OceanBase想解决的已经不只是数据库本身的问题,而是企业数据如何被AI真正消费的问题。 这背后其实是一次数据架构的变化。 过去四十年,数据库行业一直是OLTP和OLAP分离的架构,交易系统跑交易,分析系统跑分析,中间靠ETL搬运数据。 这个架构在给人做报表的时代够用,但到了Agent时代就成了负担。Agent需要实时拿到完整的业务上下文,交易数据和分析数据割裂、结构化和非结构化数据割裂、数据库和向量库割裂,每多一次搬运就多一层延迟和不一致。 湖库一体试图解决的正是这个问题:让交易、分析、多模态数据和AI应用尽可能建立在更统一的数据底座之上,减少数据搬运,让AI能够更直接地获得业务上下文。 所以,AI数据基础设施并不是给传统数据库简单增加几个AI功能,而是在重新定义数据底座应该承担什么。 数据库过去主要解决“把数据存好、把数据取出来”,未来则需要进一步回答:如何让AI理解数据、调用数据,并基于数据持续完成任务。 一个万亿市场正在打开 IDC给这个新市场算了一笔账。 2025年,中国AI数据基础设施市场规模约149亿美元。2025到2030年复合增长率37.7%,2030年达到738亿美元。到2035年有望达到1548亿美元,约合1万亿人民币,较2025年增长超过10倍。 作为对比,沙利文预测中国分布式事务型数据库市场2030年约129.3亿元人民币,2025到2030年的复合增长率约为18.5%。 两个数字放在一起,更值得关注的其实不是市场规模的差距,而是市场边界正在发生变化。 过去,数据库厂商竞争的核心问题是:谁能承接更多企业核心业务。AI时代,问题开始变成:谁能进一步承接企业的数据处理、数据智能,以及Agent对数据的持
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱