Daily Tech Briefing
AI 科技速览
每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。
InfoQ AI · 2026/8/5 10:00:00

从工具调用到生产级 Data Agent:Context 与治理闭环|AICon深圳
AI 中文解读
Data Agent火了:光会调用工具还不够,得能“闭环干活”才算真本事。在即将举办的AICon深圳大会上,云器科技专家将分享如何让AI从“会说”变“会做”,真正管好企业数据这台“大机器”。
通俗来说,以前AI助手更像是“一问一答”的工具,你问它查数据,它查完就结束,可一旦数据出错,它就束手无策了。这次分享的核心是给AI装上“业务理解”和“动手能力”:让它不仅懂“新增用户”是什么意思,还能像老员工一样,顺着数据管道找问题、自动修复、检查质量,最后再给你一份诊断报告,全程不用人盯着,也更安全靠谱。
这项技术一旦落地,最直观的改变就是企业里“做报表、理数据”的活儿会轻松很多。过去半夜数据管道崩了得拉人起来修,未来AI能自己诊断解决。普通员工也能用大白话向AI要数据,不用再学复杂的数据库语言。对企业来说,数据出错率会大幅下降,决策能更快更准,尤其在金融、零售这些重度依赖数据的行业,影响会尤其明显。
Agent 时代,哪些方向正在成为行业关键变量?50 + 实战案例揭晓答案!模型参数规模不断突破,推理成本持续下降,开源生态日益繁荣。当模型能力逐渐成为行业共识,一个新的问题开始浮现:当人人都能获得强大的模型能力之后,真正的竞争力还剩下什么? 答案正在从模型能力本身,转向围绕模型构建可规模化的智能系统;从单点能力提升,转向系统工程与组织级落地能力。在这一背景下,2026 年 AICon 人工智能开发与应用大会 · 深圳站正式启动。本次大会将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。云器科技 AI 产品总监巴志欣已确认出席 “智能体时代的数据供给与治理” 专题,并发表题为《从工具调用到生产级 Data Agent:Context 与治理闭环》的主题分享。本次演讲主要分享如何在数据平台内构建生产级 Data Agent:通过语义层完成数据加工管道生成,通过知识库构建智能任务运维能力,通过三层递进的 DQC 治理闭环提升数据质量规则建设效率,并在统一安全边界和行业规则库下实现可控落地。巴志欣,现任云器科技 AI 产品线负责人,主导 Data Agent 智能体产品的架构设计与商业化落地;曾任快手流量分析产品负责人,拥有丰富的大规模数据产品实践经验。长期专注于将大模型能力与企业数据资产结合,推动语义层、数据质量等基础设施向“AI 原生”演进,致力于让企业数据真正“活起来、用得上”。她在本次会议的详细演讲内容如下:演讲提纲:1、从一个真实问题开始:为什么今天报表没数据Tool-calling Agent 能查日志、查状态、执行 SQL,但很快会卡住因为真实数据问题不是单点操作,而是跨报表、指标、任务、血缘、质量和权限的综合判断引出主论点:生产级 Data Agent 的核心能力是 Context + 长工作流闭环2、生产级 Data Agent 的设计原则:Context + 闭环Context:让 Agent 更懂用户、业务、数据对象、指标口径、血缘依赖、任务状态和权限边界闭环:让 Agent 不只生成建议,还能诊断、执行、验证、修复、发布、监控和留痕安全边界:Agent 默认不直接访问原始明细数据,而是优先使用元数据、语义层、血缘、任务状态、日志摘要和 profiling 统计信息这个安全原则贯穿全篇:既提升 Agent 判断能力,也避免它越权访问、误操作生产数据或泄露敏感信息3、场景一:基于语义层构建数据加工管道用户表达的是业务目标,不是表名和字段名Agent 通过语义层理解指标、维度、口径、过滤条件和数据对象映射基于上下文判断应该生成临时查询、ETL 任务、Pipeline、动态表还是调度任务闭环包括:生成 SQL/管道配置、试运行、修复报错、校验结果、创建任务、配置调度和依赖证明点:语义层提供 Context,执行链路提供闭环4、场景二:基于知识库构建智能任务运维回到开场问题:“今天报表没数据”Agent 需要结合任务日志、错误码、历史处理记录、调度依赖、血缘链路、资源状态和平台规则它不只是解释报错,而是沿着链路定位根因:报表任务、ADS 表、DWD 表、上游同步、调度依赖、资源队列、质量拦截闭环包括:定位原因、生成修复方案、执行或引导修复、验证数据恢复、输出诊断报告证明点:知识上下文决定 Agent 是否能从“解释错误”升级为“解决问题”5、场景三:DQC 治理闭环:三层递进的质量规则生成DQC 的目标不是让 Agent 随意扫描数据,而是在安全边界内降低质量规则建设成本第一层:普通规则创建。用户用自然语言描述规则,Agent 转成空值、唯一性、值域、波动阈值等 DQC 配置第二层:字段类型推荐。Agent 基于字段名、字段类型、字段注释、主键/分区属性等元数据推荐规则第三层:Profiling 生成。Agent 基于空值率、唯一值数、分布、最大最小值、分位数、数据量趋势等统计画像生成更贴近业务的规则补充能力:行业规则库可作为增强项,针对金融、零售、制造、互联网等场景提供规则模板证明点:DQC 场景体现了“安全 Context + 治理闭环”的产品化能力6、产品体验:让闭环真正可用用户不需要知道底层工具和参数,只需要表达业务问题Agent 在关键步骤提供预览、确认、风险提示和回退长工作流支持检查点、中断恢复、执行记录、审批确认、失败重试和结果验证好体验不是界面包装,而是让用户相信 Agent 能稳定、可控地完成数据工作7、效果评估与指标数据开发:Pipeline 创建数、任务创建数、SQL 生成采纳率、开发周期缩短智能运维:诊断次数、平均定位时长缩短、自动修复/辅助修复成功率DQC 治理:规则创建数、规则覆盖率、异常发现率、误报率、问题闭环率平台经营:Token 消耗、查询增长、计算资源消耗、Agent 活跃用户数演讲痛点工具调用只能完成单步操作:很多 Agent Demo 能查表、跑 SQL、调用 API,但一旦进入真实数据开发、任务运维、质量治理场景,就缺少持续推进复杂流程的能力Agent 不懂业务语义:用户说的是“新增用户”“转化率”“今天报表没数据”,但平台里对应的是指标口径、字段、任务、血缘、调度和质量规则,普通工具无法自动建立映射数据平台上下文割裂:元数据、血缘、任务日志、知识库、DQC 规则、权限审计分散在不同模块,Agent 如果只会调用工具,就很难综合判断问题原因生产环境不敢放手给 Agent 执行:企业担心 Agent 访问原始数据、误改生产任务、生成错误 SQL、影响下游报表,因此需要安全边界、审批、审计、回滚和验证机制数据治理建设成本高:DQC 规则依赖人工经验,规则创建慢、覆盖率低、行业适配弱,导致质量问题经常在报表或业务侧暴露后才被发现长工作流无法闭环:真实数据工作不是一次问答,而是“理解需求 → 生成方案 → 执行 → 验证 → 失败重试 → 发布 → 复盘”,普通 Agent 很难保留状态并持续推进听众收益理解生产级 Data Agent 与工具调用的本质差异:听众可以明确判断,什么场景适合三方工具调用,什么场景必须在数据平台内构建专属 Data Agent获得一套 Data Agent 能力框架:从 Data for AI 和 AI for Data 两个维度,理解语义层、知识库、元数据、血缘、任务状态如何共同支撑 Agent 落地看到三个可落地场景:包括基于语义层生成数据加工管道、基于知识库做智能任务运维、基于三层递进方法构建 DQC 治理闭环掌握 Data Agent 的产品壁垒设计思路:重点理解 Context、长工作流、安全边界和产品体验,如何让 Agent 从 POC 走向生产可用获得可参考的建设路径和指标体系:知道如何从 Pipeline 创建、任务诊断、DQC 规则生成等场景切入,并用任务创建数、规则创建数、诊断采纳率、Token 消耗等指标衡量效果降低企业落地风险:通过“不直接访问原始数据,只基于元数据、统计信息、知识库和规则模板工作”的设计,帮助听众理解如何在安全合规前提下引入 Agent除此之外,本次大会还策划了AI Infra、推理工程与异构计算、超级个体与蜂群智能的共生进化、迈向机器人 AGI 的关键技术与产业实践、Agent 安全:从风险到可控、大模型效率工程与 Agent 系统实践、AI Agent 高价值商业场景实战等 10 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 50+资深专家在现场带来前沿技术洞察和一线实践经验。AICon 全球人工智能开发与应用大会·深圳站,限时 9 折专属优惠,现在报名立减 580,更多详情可扫码或联系票务经理 13269078023 进行咨询。
分享
阅读原文 ↗