Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
InfoQ AI · 2026/8/4 09:59:56
给 Agent 装上方向盘和刹车,Harness 时代的工程新范式

给 Agent 装上方向盘和刹车,Harness 时代的工程新范式

AI 中文解读
【给 Agent 装上方向盘和刹车,Harness 时代的工程新范式】Agent 已成为 AI 应用发展的重要方向,从简单的信息问答走向代码生成、系统操作和业务流程执行。但当 Agent 进入真实业务环境,它需要理解复杂系统、调用各种工具、遵守业务规则,同时还要能被验证和持续优化。这就带来了一个新的工程问题:如何构建适合 Agent 工作的工程环境?近日,InfoQ《极客有约》X AICon 直播栏目特别邀请阿里云技术专家张鑫、NoDesk AI CTO 王仿、腾讯...
Agent 已成为 AI 应用发展的重要方向,从简单的信息问答走向代码生成、系统操作和业务流程执行。但当 Agent 进入真实业务环境,它需要理解复杂系统、调用各种工具、遵守业务规则,同时还要能被验证和持续优化。这就带来了一个新的工程问题:如何构建适合 Agent 工作的工程环境?近日,InfoQ《极客有约》X AICon 直播栏目特别邀请阿里云技术专家张鑫、NoDesk AI CTO 王仿、腾讯高级后台开发工程师/项目组 Agent 落地负责人任磊达一起,在 AICon全球人工智能开发与应用大会2026 深圳站 即将召开之际,共同探讨 Agent Infra 从“可用”走向“高效可规模化”的关键路径。部分精彩观点如下:就像发动机马力不大的时候不需要方向盘和刹车,马力强了才需要配套安全防护。Harness 不是消灭幻觉,而是用工程系统承接和约束不确定性。核心两点:让 Agent 做正确的事,以及正确地做事。可观测也很关键,只有观测到 Agent 的执行逻辑,才能从数据中学习它为什么错、错在哪,形成飞轮效应。企业内部的数据、知识、系统都是给人构建的,现在要让数字员工上岗,首先要把给人看的上下文翻译成 Agent 能理解的语言,这就是本体论。Agent 只会道歉,没办法背锅。专业性是人的核心价值,也就是判断力。在 8 月 21-22 日将于深圳举办的 AICon全球人工智能开发与应用大会2026 深圳站上,我们特别设置了【Harness Engineering:模型之外的智能体工程】专题。该专题将邀请一线团队分享他们在构建、运行、演进 Agent Harness 过程中的真实经验与教训。查看大会日程解锁更多精彩内容:https://aicon.infoq.cn/2026/shenzhen/track以下内容基于直播速记整理,经 InfoQ 删减。完整直播回放可查看:https://www.infoq.cn/video/4a2B42u4btbcGi6295ut为什么需要 Harness Engineering?张鑫:从大家目前的实践来看,Agent 当前最大的可靠性挑战是什么?为什么需要 Harness Engineering?张鑫:Agent 当前最大的可靠性挑战,不应该简单归结于模型幻觉或推理能力不强。模型能力越来越强,但进到真实业务环境以后的失败,绝大部分发生在模型之外。比如 Agent 怎么知道正在操作哪些业务对象?对象是什么状态?跟别的对象有什么关系?有哪些可靠数据来源?可以执行哪些工具?执行完怎么确定达到了预期状态?如果这些问题没解决,换更强的模型也是盲人摸象,甚至会以非常专业、非常确定的语气告诉你任务完成了,实际上并没有。真正的挑战是怎样让 Agent 在持续变化的环境里,形成理解、行动、观察、验证的闭环。从我做 UnifiedModel 的角度出发,我更关注怎么样让 Agent 真正理解一个真实的业务系统——把业务对象的关系、状态和证据组织起来,而不是面对一堆零散的文档和数据。它需要的是一个可以被理解、被观测、被操作的系统世界。王仿:今年大家都在讨论 Harness,背后说明模型能力确实越来越强了。就像发动机马力不大的时候不需要方向盘和刹车,马力强了才需要配套安全防护。Harness 本质上不是限制模型能力,而是让它在可控范围内发挥作用。实习生答错问题有人兜底,但正式员工真的把款退了或做了不可控操作,影响就非常大了。不光应用公司在做,OpenAI、Anthropic 也在做模型之上的 Harness 能力建设。任磊达:最近争议比较大的 Fable,从技术角度看它有个很有意思的地方——把读写 KV 存储的能力加进去了,本质上是在吸收工程技巧到模型里。这其实是一个跟模型互利共生的关系:一方面从好模型里学怎么让成本更低的模型 work 起来,另一方面在尝试怎么驾驭模型。我昨天一不小心烧了七八亿 token,给我吐了四万行代码,就一个很小的模块,这就是典型 Harness 失控。Harness 从二三月份火起来后,一开始说得很虚,什么都像 Harness。真正接触多了之后,我的感觉是,Harness 包括 Loop,本质上是一个人机交互的工程:我怎么跟 Agent 交互?我要做什么?Agent 吐什么能让我满意?怎么让产出有正向 ROI?找到跟模型交互的协同模式,就是所谓的 Harness。王仿:实践上,面向企业的 Harness 工程核心要解决几件事。一是上下文管理,在什么阶段注入什么上下文。二是跨系统集成,企业有 ERP、OA、WMS,要在可控环境里调用。三是 skill 调度,复杂场景下 skill 越多模型反而越差,因为经常调错。企业任务不是跑通一次就完了,是每天几百上千个任务要稳定执行。还有权限、可观测、评测体系,企业要发展,市场在变,怎么通过 Harness 让 AI 快速适应变化。张鑫:Harness 不是消灭幻觉,而是用工程系统承接和约束不确定性。核心两点:让 Agent 做正确的事,以及正确地做事。可观测也很关键,只有观测到 Agent 的执行逻辑,才能从数据中学习它为什么错、错在哪,形成飞轮效应。任磊达:Harness 在我理解里是两层:一层是架构层面,聚焦怎么做 Agent,包括可观测性等底层架构;另一层是用 Agent 的层面,更关注流程,人在什么时候接入,怎么促进飞轮转起来。这也是我下个月 AICon 上的分享的主题,在真正的研发流程中,人怎么接入。当架构更清晰之后,人在里面的效率会更高,产出也更稳定可控。张鑫:任老师现在还在用 RAG 做专有领域的知识检索吗?任磊达:RAG 本身也是 build agent 的一个过程。我们更多是用 Agent 去 build 业务逻辑和流程,在现有流程下把 Agent in loop 放进去。之前推 Tokenmaxxing 的时候要求 Agent 100% in loop,但这是不是最好的形态?人在什么时候进去?包括最近 OpenAI 很火的 RSI 模型自进化,当模型自己能进化了,人在里面的价值是什么?我们最后要维护什么、掌控什么?我们会更关注这些边界问题。Agent 需要什么样的“工作环境”?张鑫:如果把 Agent 看成一个新员工,企业过去提供给员工的是文档、系统、流程和权限。进入 Agent 时代,我们需要为 Agent 构建怎样的工作环境?任磊达:我们要给 Agent 结构化的信息、正确的边界。一开始推 Tokenmaxxing 的时候让大家 100% all in AI,去搞清楚 AI 的边界到底在哪里。搞明白了之后才发现,有些事情让它做能提效,有些事情让它做它负不了责。边界的定义一定要从试错中产生,没有一两个生产事故,可能感受不到这个边界到底会影响到什么地方。张鑫:适合 Agent 的工作环境至少解决四个问题,跟新员工进公司是一样的。第一,看得懂,理解系统里的业务对象、模块关系和代码是怎么组织的。第二,做得到,有没有足够清晰的 tool description 交给它去完成这些事。描述是有边界的,给太细了上下文会被撑爆,给太大了它理解的东西和你的会有偏差,又陷入幻觉,给到适中是一个很关键的设计权衡。第三,可证明,怎么证明改动没有出问题,这有点像 TDD,测试优先,夹具要提前写好。可观测能力要强,假设没有观测到,它可能就触发 P0 级别的 bug 和故障出来,到时候它只会说“对不起,这是我考虑不周”。第四,做不坏、能回滚,关键步骤一定要人参与。我们一个同事把所有权限开放给 Agent,Agent 直接把他根目录删了,然后去恢复系统。现在企业的问题通常不是没有数据或工具,而是工具和数据比较割裂,有的在 A 系统,工具在 B 系统,整个 loop 不起来。看到日志不知道跟哪些应用关联,看到告警不知道是不是做了变更。理想的工作环境不是一次性把信息塞给 Agent,而是围绕任务持续渐进式披露,交给它去正确地干事。王仿:前面两位老师更多从 coding 角度讲,我从企业数字员工的角度来思考。比如做一个智能导购的数字员工,过去我们招一个人进来,有大量培训资料教他怎么用系统、怎么回复客户、依据什么标准。企业内部的数据、知识、系统都是给人构建的,现在要让数字员工上岗,首先要把给人看的上下文翻译成 Agent 能理解的语言,这就是本体论。这些有了,技术才入场。另一个维度是,coding 本身是封闭环境,有 IDE、编译器,浏览器操作、手机电脑操作都是封闭环境。大模型解决 agentic 能力就是从这几个大的封闭场景切入,把人在环境里做各种任务的语料定义出来去训模型。但企业本身也是一个环境,有它的系统、流程和知识,我们没法把这个环境训到模型里,只能通过 Harness 加大模型的方式来做。要把企业里的上下文和模型能力通过 Harness 结合起来,让它变得像今天写 vibe coding 这么爽。任磊达:今年 ROI 特别明显的一个点是 SDD,先跟 Agent 把流程澄清清楚,澄清是 AI 跟我一起做的,直到足够清楚了再拆分成子任务或 DAG 图去执行。做完要 review,我们也在探索怎么跟 AI 共建 review。现在一个 MR 少则几百行,多则上万行,已超出人的思维负担,逼着每个环节都要调教 Agent 的协同能力。为什么“更多数据”并不一定让 Agent 更可靠?张鑫:企业拥有大量数据资产,但 Agent 仍可能无法正确理解业务。Agent 时代真正重要的是数据、知识,还是更高层次的语义和结构?王仿:数据告诉你过去发生了什么,知识告诉你当前的客观业务事实,语义和结构告诉你它们之
分享
阅读原文