欧洲新闻网 | 中国 | 国际 | 社会 | 娱乐 | 时尚 | 民生 | 科技 | 旅游 | 体育 | 财经 | 健康 | 文化 | 艺术 | 人物 | 家居 | 公益 | 视频 | 华人 | 闽东之光
投稿邮箱:uscntv@outlook.com
主页 > 财经 > 科技 > 正文

二十年攒下的数据,为什么喂不饱一个Agent?

2026-08-31 10:57 凤凰网  -  浏览量:566838

文|周享玥 赵艳秋

编|牛慧

为什么同一个大模型,用英文回答科学和工程问题时,常常更顺、更有条理?

答案不只在模型,也在数据。现代科学体系中,大量论文、代码和工程文档最初就用英文写成,不仅记录结论,也保留了研究过程和论证关系。模型从中学到的,不只是一门语言,也是一套知识和逻辑的组织方式。

模型越来越强之后,胜负手正在重新落回数据。

尤其当Agent开始进入企业核心业务,数据也从模型训练的原料,变成AI运行过程中持续调用的基础设施。

过去二十年,我们解决的是“怎么把数据存下来”;Agent时代,新的问题变成了“怎么让数据持续供给智能”。

现在,华为想做的,是把过去二十年的“大数据”再重做一遍。

01

新用户:Agent来了,数据的消费者变了

去年,沃尔玛中国一度严禁员工用外部大模型讨论工作,数据泄露风险让大型跨国企业对AI极为谨慎。但今年五六月份后风向突变,企业开始认真将核心业务推进到企业级智能体时代。

变化背后,是企业使用AI的方式变了:从员工调用外部工具,变成企业系统性引入AI。

Coding助手、办公Agent已经证明能提升个人效率,但企业真正要解决的是跨部门、跨系统的长流程问题,需要多个Agent共享上下文、调用企业系统并协同完成任务。

Gartner已将多智能体系统列入2026年十大战略技术趋势,并预计到2028年,超过1/3的企业软件将具备自主Agent能力。

这种变化已在互联网、金融、制造等行业出现。互联网头部企业正密集整合办公Agent与企业工作流;2026年上半年,金融大模型中标项目达到406个,国有大行、头部股份行开始从知识助手、代码助手向信贷、风控、合规等业务型Agent推进;制造、能源企业也开始把Agent带进质检、研发和调度。

问题也随之出现。

Agent不是“偶尔查一次数据的人”,而是一个24小时不停读取、检索、推理和行动的数据消费者。

人查数据是低频、有节奏的;Agent执行任务,却需要不断检索知识、读取实时状态、调用历史信息,再根据结果继续推理和行动。

数据因此不再只是躺在系统里的资产,而开始成为Agent的上下文、记忆,甚至是它做出下一步行动的依据。

8月28日,在“从数据到Agent:数据价值链的重构与创新”数据要素大会上,华为混合云总裁顾雪军直指这一问题:“企业没有自己的数据,智能体就只是一个通用的聊天机器人,永远触不到核心业务。”

 

企业真正的竞争,也因此不再只是“有没有模型”,而是谁能把自己的数据、流程和行业Know-how持续沉淀进智能体。

埃森哲调查显示,88%的中国企业已跨过AI试点阶段,但取得显著业务价值的只有14%。

模型决定了Agent聪不聪明,企业数据决定了它懂不懂你的生意。

而企业数据本身也在发生变化。过去的数据平台最擅长处理数据库里的表和字段,但文本、图片、音频、视频、设备日志等非结构化数据,正在成为企业AI最重要、也最难处理的数据来源。Gartner预计,到2028年,中国企业对AI-Ready数据、尤其是非结构化数据的投资将达到2024年的20倍。

新的数据消费者,正在倒逼一代新的数据基础设施。

02

新断代:大数据从1.0走到3.0

顾雪军判断,Agent时代,大数据平台的服务对象正从“人和BI”扩展为“人+大模型+Agent”。

服务对象变了,数据基础设施就必须跟着换代。

华为将这一过程概括为大数据1.0、2.0和3.0三个阶段。

1.0时代,服务人。

数据库、数仓和数据湖把结构化数据存下来、管起来、算起来,通过BI和报表交给人分析决策。华为从2008年开始布局大数据,此后推进存算分离、湖仓一体,解决的核心问题都是如何把数据存好、管好、算快。

2.0时代,模型成为新的数据消费者。

图片、视频、音频、文本等非结构化数据大量进入AI训练,传统湖仓向多模态湖仓演进,多模计算、异构算力调度、自动标注和高质量数据集生产成为新的基础能力。

行业格局也随之变化。海外Databricks迅速从Data公司转向Data+AI公司;国内华为推出DataArts、DataArts Fabric以及城市和行业数据空间,数据平台开始从治理工具走向“Data+AI”。

3.0时代,Agent成为新的数据用户。

与人看报表、模型吃数据集不同,Agent需要在运行中持续获得企业数据和业务知识,并据此推理、决策和行动。

如果说大数据1.0解决“人怎么用数据”,2.0解决“模型怎么吃数据”,那么3.0真正要解决的是“Agent如何一边工作,一边持续获得数据”。

数据平台开始从“存储数据”走向“持续供给智能”。

徐工全球数字化中心主任付思敏在大会现场提到,徐工的数据体系过去主要面向内部决策运营和BI,如今已经开始转向以高质量数据集支撑AI模型和产品应用。

围绕这一变化,华为今年将数据能力重新组织为四个环节:可靠管数、高效供数、智能用数和可信流通。

过去的大数据平台像仓库,今天的数据基础设施更像一套供血系统:数据不仅要存得住,还必须随时流向正在工作的Agent。

03

新范式:数据平台开始长出“记忆”

可靠管数、高效供数、智能用数和可信流通,本质上,就是形成一套持续向智能体“供血”的系统。

可靠管数是地基。Agent最终仍要查数、计算、调用业务数据,因此传统湖仓并没有失去价值,反而要求底座更快、更稳。

真正发生质变的是“供数”。

模型和Agent有着不同的“数据胃口”:模型需要规模和质量,Agent则需要持续检索、记忆和共享。

顾雪军将这种变化概括为,让数据从“静态治理资源”转变为“动态赋能AI的生产力”。

华为云今年推出AI DataLake,一边加快TB/PB级训练数据集构建,一边在数据湖中引入向量和记忆引擎,为Agent提供“知识检索+记忆检索”,支持长期记忆和多Agent共享。

这意味着一个非常重要的变化:数据基础设施第一次开始系统性地管理“记忆”。

过去数据库保存订单、客户和库存,数据湖保存文本、图片和视频;未来还要保存Agent做过什么、哪些办法成功、哪些办法失败,再把这些经验用于下一次推理。

企业数据不再只是“发生过什么”的记录,还将成为“下一次怎么做”的经验。

另一个重新受到重视的概念是“本体”。

大模型能找到数据,却未必知道企业如何运转。本体要补上的,就是业务语义:把企业里的人、财、物、事及其关系和规则,用机器能够理解的方式重新描述。

一条生产订单背后,可能同时关联ERP里的IT数据、设备产生的OT数据、研发系统中的ET工程数据,以及规章制度和专家经验形成的KT知识。华为的智能数据决策平台DataArts,正试图通过本体语义建模,把这些数据重新组织成业务对象、关系和规则。

AI真正进入企业,难点不是让它“看见数据”,而是让它“看懂生意”。

微软Fabric、Snowflake、Palantir等也都在强化本体或业务语义层,目标相似:让AI找到数据之后,还能理解数据背后的业务关系。

顾雪军此次演讲中出现了一条值得注意的链路:Data→Logic→Action。

过去是Data→Insight,数据产生洞察,再由人判断和执行;Agent时代则进一步走向Data→Logic→Action。

比如发现供应链交付风险后,Agent不只是提示异常,还要关联库存、采购、产能和物流判断原因,生成方案并调用业务系统执行。

过去,数据的终点是“让人看懂”;Agent时代,数据的终点正在变成“让机器行动”。

这个闭环还在向企业外部延伸。国家数据局今年提出通过可信数据空间等推动数据安全流通,华为也将可信数据空间纳入大数据3.0,让外部数据在“可用不可见”的条件下进入企业AI体系。

至此,数据平台正在从存储和分析系统,进一步变成AI的实时供应系统、长期记忆系统和决策底座。

04

新证明:数据开始形成两个飞轮

大数据3.0已经不只停留在架构和产品层面,第一批验证开始进入真实生产。

“没有高质量的数据集,再强的模型在任何一个行业其实都跑不出好结果。”广东电网数据运营中心平台管理部部长杨永娇直言。

工业场景尤其如此。要让AI进入生产,首先要通过清洗、标注、合成和评估,把工业现场的“数据原油”炼成可供模型使用的“数据汽油”。

一些结果已经体现在生产指标上:宝钢将数据工程和模型用于宽展预测、高炉炉温预测,单炉成本每年降低千万级;中铝仅氧化铝生产每年节约成本1100万元;中国石油将油田测井周期从周级缩短至天级,准确率达到95%。

徐工则从场景反推数据建设,把AI落地分成“AI+产品、AI+制造、AI+企业运营”三条线,仅制造环节就梳理出82个核心场景,并围绕这些场景建设约30个高质量数据集。

这意味着企业建设数据的逻辑也在反过来:不是“有什么数据就做什么AI”,而是“AI要解决什么问题,就生产什么数据”。

一些企业甚至开始把数据做成持续运转的“生产线”。

广东电网把高质量数据集建设拆成“采、治、标、训、评、用”六个环节。模型上线产生的低置信度样本和误判数据重新回流,进入下一轮训练。目前已积累超过3000万份多模态样本,在输电巡检场景中,识别准确率超过90%,缺陷误报率降至5%以内。

这形成企业内部的第一个飞轮:业务产生数据→数据训练模型→模型进入生产→生产产生新反馈→反馈再次改善数据和模型。

数据不是越存越多,而是越用越好。

第二个飞轮则开始越过企业边界。

华为已参与贵州省级“公共数据一个湖”和AI可信数据空间建设;云南交投采购外部通用数据,与自身交通数据组合,形成“建、管、养、运、服、安”六类高质量数据集,不仅用于行业大模型训练,还在深圳数据交易所挂牌交易。

国家数据局将类似过程概括为“场景牵引数据、数据驱动模型、模型赋能应用、应用创造价值”的“数据飞轮”。

于是,一个更大的循环出现了:企业内部,数据和Agent互相增强;企业外部,数据通过可信流通进入更多场景,再创造新的数据与价值。

当两个飞轮同时转动,数据才真正从“沉淀下来的资产”,变成“持续生产智能的生产资料”。

过去二十年,企业一直在问一个问题:我们积累了这么多数据,价值到底在哪里?

Agent或许第一次给出了一个非常具体的答案。

数据的价值,不在于企业“拥有多少”,而在于有多少能够被AI理解、调用,并最终变成行动。

模型表现出来的能力,终究要落到它吃到了什么数据。

而当Agent真正进入企业核心业务,决定它能走多远的,也许不再只是模型有多强,而是企业过去二十年攒下来的数据,能不能从一座沉默的“矿山”,变成一套持续运转的“智能供给系统”。

这也是为什么,Agent时代,大数据不是过时了,而是必须重新做一遍。

  声明:文章大多转自网络,旨在更广泛的传播。本文仅代表作者个人观点,与美国新闻网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。如有稿件内容、版权等问题请联系删除。联系邮箱:uscntv@outlook.com。

上一篇:mRNA肿瘤疫苗的胜负手,不在mRNA
下一篇:NASA与SpaceX因飞船泄漏推迟国际空间站任务发射

热点新闻

重要通知

服务之窗

关于我们| 联系我们| 广告服务| 供稿服务| 法律声明| 招聘信息| 网站地图

本网站所刊载信息,不代表美国新闻网的立场和观点。 刊用本网站稿件,务经书面授权。

美国新闻网由欧洲华文电视台美国站主办 www.uscntv.com

[部分稿件来源于网络,如有侵权请及时联系我们] [邮箱:uscntv@outlook.com]