开发者生态
morning
当Agent开始“吃数据”,传统湖仓不够用了:华为云重构数据基础设施
2026-09-03
1 阅读
约7分钟阅读
褚杏娟
字号:
当Agent开始“吃数据”,传统湖仓不够用了:华为云重做AI时代数据基础设施 过去数据平台主要服务人、BI系统和传统应用,如今,模型与Agent正在成为新的数据消费者。而数据消费主体的变化,也在反向推动企业数据基础设施从传统湖仓向多模态湖仓、AI数据湖和数据智能体演进。 华为混合云总裁顾雪军在2026中国国际大数据产业博览会上表示,Agentic智能体时代,数据不仅用于传统分析,还将直接参与模型训练、推理和Agent执行。企业原本分散在云、数据中心、生产线和办公系统中的数据,如果无法统一接入和使用,Agent就很难真正进入核心业务流程。 为此,华为云提出基于“混合云+Data+AI”和华为云Stack构建AI-Ready数据平台,并将整个数据链路划分为可靠管数、高效供数、智能用数和可信流通四个环节。 AI能不能持续、稳定地“吃到数据”? 相比传统数据平台,AI场景对数据供给提出了更高要求。 一方面,模型训练需要持续获取大规模数据;另一方面,Agent推理过程中又需要低延迟访问企业内部数据、知识和业务状态。因此,传统以结构化数据和离线分析为中心的数据湖仓,在数据类型、供给速度和实时性上都面临新的压力。 华为云AI DataLake多模智能数据湖针对模型训练和Agent推理两类场景,对数据供给链路进行调整,重点解决传统方案中供数速度慢、数据规模受限、精度不足以及不同AI任务适配能力不足等问题。 与此同时,数据的类型也开始从传统IT数据扩展到更多企业生产数据。华为云DataArts目前可以统一接入IT系统数据、OT生产数据、ET工程数据和KT企业知识,并内置40多种数据处理算子,同时支持自演进本体构建和高性能计算。其核心思路是减少数据搬移,让企业不同系统中的数据能够直接参与数据处理和智能决策。 从技术路径上看,企业数据的用途正在从传统“Data”进一步向“Logic”和“Action”延伸:数据不再只用于生成报表和分析结果,而是成为模型理解业务、形成判断并驱动Agent执行动作的输入。 当数据只在企业内部使用时,核心问题更多是治理和效率;但当多个组织、模型和Agent需要协同使用数据后,数据主权、身份认证和操作留痕成为新的基础设施问题。 华为云通过构建数据可信流通环境,来解决三个问题:数据由谁控制、参与数据使用的主体是否可信,以及整个数据操作过程能否被验证。据悉,相关能力已经用于上海城市数据空间、南通家纺行业数据空间和云南交投等项目。 这类可信数据空间可以在不完全脱离原有控制范围的情况下参与跨组织计算和业务协作。对于拥有大量行业数据、生产数据和企业Know-how的机构而言,这也成为其将内部数据提供给AI使用的一种基础架构。 在企业完成数据治理之后,并不意味着现有数据可以直接用于模型,高质量数据集正在成为数据治理与AI应用之间的中间层。 这种情况下,徐工集团自2023年启动“智改数转网联”战略转型,通过“1+4+2”框架和四大工程,将数据逐步接入产品、制造和运营环节。其数据治理目标也从传统的“统一管理数据”,进一步转向为智能化应用建立数据基础。广东电网则围绕模型可用数据构建“壹万万”多维标签体系,通过“预标注+人工精标+多维标签”的方式形成训练和业务使用所需的数据。在客服场景中,智能推荐标准话术日调用超过2万宗次,准确率达到98%。 相对传统数据治理更关注数据完整性、标准化和可查询,AI数据则进一步要求数据具备明确语义、标签和任务适配能力。 Token开始成为新的数据价值出口 数据基础设施的另一个变化,是价值出口从传统报表、API和数据产品进一步延伸到模型调用和Token。 比如,长三角数链目前构建了以“区块链+隐私计算”为核心的“1+1+1+X”架构,已接入232个机构,覆盖140个应用场景,区块链使用量达到43亿笔,并打通9省40市物流节点。 贵州数据宝CEO周林在会上提出,“数据的终点不是报表,而是Token”。数据宝目前基于50多个部委厅局数据源和1800多个数据产品,构建“数据+算力+Token”平台,其TopenRouter独立Token交易平台日均调用量超过千亿级。 可以看出,数据价值链因此从过去的“采集—治理—分析—报表”,开始向“采集—治理—模型—Agent—业务动作”迁移。 大会期间,贵州省公共数据资源“一个湖”项目联合创新启动,同时发布“数据要素场景联合创新行动”,国泰新点、四方伟业、贵州数据宝、华傲数据、星尘纪元、数鑫科技、永洪科技、数语科技、普元信息等企业参与。 华为云此前还与贵州大数据集团建设省级公共数据“一个湖”,并发布AI可信数据空间相关成果。这些项目背后的技术方向较为一致:企业和政府的数据不会因为AI出现就全部迁移到单一云平台。大量核心业务数据仍然存在于本地数据中心、生产系统和行业专网中,因此AI基础设施需要同时处理本地数据保护与模型能力接入的问题。 华为云Stack的混合云架构,其思路是连接分布在云、数据中心和生产现场的数据,在既有安全边界内向模型训练、Agent运行和智能决策提供数据。 随着Agent持续进入业务系统,数据本身还会形成新的循环:企业原有业务数据进入AI数据湖,用于模型和Agent;Agent在执行过程中又会产生新的交互数据、业务结果和决策经验,这些数据重新沉淀到企业数据体系中,并继续参与后续模型和Agent优化。 从传统湖仓到多模态AI数据湖,再到连接业务系统的数据智能体,正在成为AI进入行业之后,数据平台演进的一条新路径。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱