首页 > 科技 > 正文
Qzone
微博
微信

AI下半程关键在数据,华为提出AI DC数据基础设施参考架构

科技 极客网 2026-08-10 16:39

 

极客网·人工智能 2026年8月6日,在太湖之滨的江苏无锡,2026华为数据存储用户精英论坛盛大举行。来自金融、制造、教育、医疗等核心领域的500余位深度用户、技术大咖与生态伙伴齐聚一堂,共探数据存储产业未来发展之路。

会上,华为公司副总裁、数据存储产品线总裁袁远开门见山地抛出一个核心判断:AI的下半程,决胜关键在于数据。这一观点为正处于算力军备竞赛与模型百家争鸣中的AI行业点明了下一个战略高地,引发热烈反响。

image001.jpg

华为公司副总裁、数据存储产品线总裁 袁远

算力、模型、智能体之后,数据是AI的“终极燃料”

回顾AI近年来的发展脉络,算力是开路先锋,大模型是引爆点,智能体是落地引擎,三者共同勾勒了AI产业发展的主线。

数据显示,过去五年,国内算力“大力出奇迹”,规模翻了6倍;截至2025年,我国在测大模型已超过1500个,“千模大战”成为现实;2026年被视为推理元年,智能体(Agent)作为推理落地的核心载体,正以“千军万马”的姿态加速渗透千行百业。

当算力、模型、智能体逐步就位之后,一个更深层的瓶颈开始浮现,那便是贯穿其中的数据。袁远指出,模型训练需要高质量的语料,推理需要高精度的知识,智能体更需要大量的上下文、多轮次的准确记忆和语义检索能力——驱动AI下一阶段进化的关键是数据。

“我们的数据本身能力和管理水平,相对于现在的模型、算力、智能体,实际上是落后的。”袁远直言不讳地指出,从数据管理、数据治理、数据使用的方方面面来说,都还不能够匹配现在对AI的应用落地诉求。

 

有效数据语料短缺,中国AI发展的“阿喀琉斯之踵”

会上,袁远援引几组触目惊心的数据,揭示了中国数据能力与AI落地诉求之间的巨大落差。

第一,语料贡献严重不足。中文语料在全球语料中的占比不足2%。虽然当下各类模型理解中文已无障碍,但中文对世界语料的贡献、对模型训练的支撑远远不够。

第二,数据留存率极低。我国数据留存率不到3%。看似海量的数据,真正被存储下来的只有极少数,大量数据被白白浪费,没有被利用起来。

第三,数据“沉睡”严重。数据“沉睡”率高达40%。企业超过一年未使用的数据占比接近四成,大量已存数据未被挖掘使用。

第四,数据共享率偏低。数据共享率仅约25%。大量城市与企业数据仍储存在“孤岛”上,无法有效流通与整合。国家大力推动的数据要素、高质量数据集战略,正是要破解这一困局。

种种数据表明,中国已是全球数据大国,但在数据语料建设和数据治理能力上还存在差距,远不能匹配AI规模化落地的迫切需求。

 

破局之道:构建以数据为中心的AI DC数据基础设施

毋庸讳言,没有充足的高质量数据支撑,再强的算力,再大的模型,再多的智能体,都难以在行业场景中真正兑现商业价值。如何破局?在袁远看来,数据基础设施作为AI的坚实底座,其建设思路、硬件体系与软件能力亟待系统性重构,以推动智能体加速融入全场景应用,兑现商业价值。

基于多年沉淀而来的实践经验,华为在会上提出了AI DC数据基础设施参考架构。这一五层架构层层递进、协同强化,推动数据从“基础资源”升级为“核心生产要素”,为AI规模化落地提供坚实底座。

第一层,AI数据湖层,解决AI系统的语料生产与供给问题。基于全闪分布式存储与统一数据空间,实现全局数据可视可管、千亿千维向量秒级检索。它既是训练语料的“原料仓”,也是知识储备的“转化器”,同时承载AI推理产生的新数据,形成数据飞轮。

第二层,AI数据平台层,承载模型的知识与记忆能力。面向超大规模推理中心,华为推出业界首个支持异构算力的CMS上下文记忆存储,构建PB级共享KV Cache池,将推理首Token时延降低90%;面向企业级推理场景,首创“3+1”AI数据平台,集成超95%检索精度的知识库、KV Cache加速与持续进化的记忆库,提升推理准确率30%。

第三层,算力层,决定模型迭代速度与训推效率。通过智算虚拟化技术,实现GPU/NPU资源按需调度、细粒度切分,最大支持1:10的算力卡切分,资源利用率提升30%。

第四层,模型层,覆盖模型的部署、适配、增量训练和微调。ModelEngine提供模型开箱即用与模型网关能力,支持零代码适配新模型与一键部署。

第五层,Agent框架层,支撑低代码开发与智能化部署。ModelEngine Nexent智能体平台支持通过自然语言交互直接生成Agent,显着降低开发门槛。同时内置Skill、提示词、记忆的自动优化能力,助力Agent持续演进、越用越聪明。

围绕这一参考架构,华为构建了完善的AI DC数据基础设施全栈方案,并内置贯穿全流程的AI数据安全解决方案,以抵御Agent、模型、平台与基础设施等多层级数据安全风险,构建防滥用、防投毒、防篡改、防勒索的端到端数据保护能力,全面守护企业核心数据资产安全。

小结:

从算力竞赛到模型比拼,再到智能体引爆推理应用,AI的上半程拼的是速度与规模,而下半程无疑要拼数据的规模和质量。构建以数据为中心的AI DC数据基础设施,让数据“存得住、管得好、用得了”,方能让每一比特数据都能成为AI进化的养分,加速AI规模化落地!

 

【以上内容转自“极客网”,不代表本网站观点。如需转载请取得极客网许可,如有侵权请联系删除。】

 

延伸阅读:

 

 

责任编辑: fjq4191

责任编辑: fjq4191
人家也是有底线的啦~
广告
Copyright © 2018 TOM.COM Corporation, All Rights Reserved 新飞网版权所有