VicroCode
让代码创造价值
VicroCode是一个轻量级代码在线发布、交易平台,开箱即用,免部署、免服务器、免备案,支持接入智能体、通用管理系统、游戏等多种项目
稍候片刻,您可先学习AI编程手册
正在加载中...

市场信息

自主数据工程:迈向真正智能体成熟度的五个阶段 | 技术趋势

点击查看原文>

www.infoq.cn · 2026-09-29T10:36:23+00:00

2026 年,智能体将在企业级应用中取得哪些实质性突破?点击下载 《2026 年 AI 与数据发展预测》白皮书,获悉专家一手前瞻,抢先拥抱新的工作方式!

数据工程是一项艰难的工作——一觉醒来发现任务运行失败,往往需要花上数小时排查;业务团队的各种请求和需求不断堆积;财务团队还会追问,为什么这些数据管道的成本一直在上涨。从很多方面来看,AI 正让这项工作变得更加复杂。

它带来了数量更多、类型更加多样的数据,也让公司内部更多人可以通过编程智能体和对话智能体使用这些数据,这些智能体甚至可以直接替他们编写 SQL。大多数数据工程团队都在尝试通过采用 自己的编程智能体 来跟上变化,但即便如此,他们似乎依然在被越甩越远。

MIT Technology Review 发布的一份《AI 时代的数据工程再定义》(Redefining Data Engineering in the Age of AI)报告发现,虽然 80% 的组织已经部署了基于 AI 的数据工程工具,但数据工程师同时也在应对更高的复杂度。其中,被提及最多的挑战是保障数据安全和隐私,占比达到 55%。

我们需要一次更加根本性的转变。与其用 AI 让现有流程跑得更快,不如重新思考这些流程本身,逐步摆脱手工构建和维护数据管道的模式。

这样一来,数据团队可以把更多时间放在数据工程的产出,也就是数据产品,而不是逐步转换原始数据的具体过程上。与此同时,团队还需要确保数据不仅能被人使用,也能被 AI 使用,并且在整个过程中保留完整的业务上下文和治理能力。

未来的数据工程,将取决于能否创造真正可用的数据产品,为业务决策提供支持;同时,由真正具备自主能力的智能体构建、维护并优化保持这些数据产品持续更新所需的一切,而人类则继续作为关键决策者和最终裁决者。这些智能体会持续关注新的数据产品需求、现有产品中的问题和故障,并主动寻找改进、清理和优化的机会。

人类当然依然至关重要,但角色会进一步升级:定义最重要的业务问题,引导智能体采用正确的整体架构,并确保业务上下文被准确地纳入数据产品之中,供后续使用这些数据产品的智能体理解。迈向自主数据工程 这是一次巨大的转变,团队既不可能在一夜之间完成,也没有必要如此。

更合理的方式,是先明确这是不是正确的目标,再以渐进、审慎的方式向前推进。在每一个阶段,团队都会进一步了解智能体和模型究竟具备哪些能力,也会逐渐建立信任:哪些工作可以安全地自动化,哪些地方仍然需要额外的“人在回路”(Human in the Loop)检查、工具或流程。

事实上,许多企业已经走在这条路上。任何采用了软件定义生命周期、版本控制、声明式数据管道或 AI 辅助开发的团队,都已经向未来迈出了一步。

自主数据工程成熟度曲线 在智能体时代,重新定义数据产品的构建方式 推动这一变化的一项重要转变,是从“数据管道思维”转向“数据产品思维”。数据产品包含的不只是数据本身,还包括语义、质量,以及智能体使用这些数据完成任务所需的一切。

例如,一个客户忠诚度数据产品中,可能包含客户流失风险数据。它会把每个账户的活动数据,与一套语义视图结合起来,明确企业如何定义“高风险客户”,同时还会附带已经文档化的数据质量检查。

这样一来,无论是智能体还是分析师,只要访问这个数据产品,在开展客户忠诚度相关工作时,都能够得到一致、可信的答案。传统模式从基础设施开始,自下而上地构建:先搭建数据基础,定义 Schema,创建数据管道,最后再满足某项业务需求。

当数据产品数量较少、变化相对稳定时,这种方式是有效的。现代数据团队正在反过来运行这一过程:先从业务问题出发,找到能够解决这一问题的智能体工作流;再确定这个智能体需要哪些数据,并围绕这些需求构建相应的数据产品。

这样一来,企业的数据体系会围绕业务结果,而不是技术层级重新组织,也形成了一种更加纵向的数据产品构建方式:数据管道围绕最终结果设计,而不只是围绕 Schema 设计。在真正的自主数据工程中,平台的重要性与智能体框架的选择同样重要。

高绩效团队首先需要打牢版本控制、自动化测试和 CI/CD 流水线等基础——这些也是优秀数据团队多年来一直采用的最佳实践。治理、互操作性和统一数据,是企业能够安全信任自主工作流的前提条件。

打好基础,自主数据工程自然会随之而来 向自主数据工程转型,已经成为一种运营层面的必要选择。最快达到成熟阶段的团队,并不会只是因为拥有最好的模型。

他们之所以能够更快走向成熟,是因为把数据工程师的角色提升到了业务伙伴的位置,同时构建了足够坚实的平台基础,使自主智能体能够在其上运行,并通过足够完善的治理机制建立信任。想要在这一过程中取得成功,客户需要选择一个平台:它不仅能够满足今天的需求,也能够持续演进,并不断吸收数据工程和 AI 领域的新创新,而不需要企业自己把大量不同组件拼装起来,或者从头构建一切。

了解 Snowflake 如何通过 Data-eng-benchmark 数据工程智能体基准测试 ,建立用于衡量自主数据工程任务质量和 Token 效率的标准。如果希望进一步了解如何开始实践自主数据工程,包括架构模式、治理框架,以及如何通过工程实践提升 智能体工作流的可靠性 ,可以阅读 《为 AI 构建数据管道:迈向更智能数据工程的必备指南》(Build Pipelines for AI: An Essential Guide to Smarter Data Engineering) 。

原文地址: /ai-market-guide/ utm_campaign=Industries&utm_source=linkedin&utm_medium=Snowflake&utm_content=1786029659 点击链接立即报名注册: /ai-market-guide/ 更多 Snowflake 精彩活动请关注 专区

返回 AI 市场导读

来源:infoq.cn