



进入智能体阶段后,大家对模型的需求也发生了改变。不再只是关注聊得怎样,而是看模型能不能理解目标、调用工具、执行操作,并持续调整。模型要接住的,是一整段业务流程,而不只是单次的问答。
而当智能体真正嵌入到企业流程后,各类实操问题会集中暴露出来:上下文缺失会误解任务、运行中途停止会丢失进度、权限没管好可能会越界操作。如果只是更换一个更强的模型,这些问题多半解决不了。
北京市四部门7月23日公开发布的《北京市关于加快智能体引领发展的若干措施》,正好体现了这个变化。第1条强调基础模型和工具调用、长上下文、记忆这些能力。第2条则提出,要布局驾驭层和中间层软件,让系统具备任务规划、工具使用、长程执行和异常恢复的能力。
驾驭层工程(Harness Engineering)这个说法,来自Mitchell Hashimoto,于今年2月提出。它的核心想法其实很直接:先把模型固定下来,再去调系统提示、工具和中间件,靠这套组合,去提升智能体做真实任务的表现。
早期的实验就证实了这个问题。LangChain 固定用GPT-5.2-Codex 这个模型,只去调系统提示、工具和中间件,结果Terminal Bench 2.0的任务完成率,从52.8%涨到了66.5%。模型一点没换,结果却明显不同。
北京政策做的,正是把驾驭层这件事,和跨模型、跨芯片的适配,以及软件栈、协议、工具、安全、标准串到一起。并且给了它一个清晰的定位,就是建设通用基础设施,支撑规模化的真实应用。

政策分为四部分。
基础模型与芯片——提供能力基础。
驾驭层及中间层软件栈——组织任务怎么跑。
协议、工具链、安全和标准——解决跨系统协作和治理。
行业智能体——面向具体场景落地。
这四部分合起来,从底层算力一直盖到上层应用,是一条完整的链。
换个视角看,harness engineering 把评价对象换成了完整的执行过程。对于结果的评价不再只是单纯的看问答质量,而是能直接看到事情到底办没办成,工具调用是否正确,异常能否自主修复,失败后能否恢复。
政策还强调了跨模型、跨芯片、跨框架,并提了互联协议、工具链、能力组件开源、技能市场以及标准规范。用意是把任务状态、工具注册、权限和计费这些环节打通,让能力能够被复用,也能被灵活组合。
基础模型仍然决定了推理能力的上限。但实际应用效果怎样,越来越取决于模型加上运行系统的这个组合。模型企业之间的竞争,也会慢慢延伸到稳定接口和开发支持上。
中间层软件和专业工具,会慢慢长成独立的产品。上下文管理、任务编排、运行观测、安全沙箱、身份权限、异常恢复,都算这一类。它们要么被大平台收编,要么自己单独活下来。价值重心,也会从模型参数,挪到工程能力上。
行业应用企业的壁垒,也在变。过去比的是谁更会写提示词,以后要比谁能把业务流程、数据和权限组织得更好。还有一点,就是能不能对任务结果持续改进。
企业验收,也不能只盯模型性能。系统能不能兼容不同模型,能不能接进现有业务系统,有没有审计和人工接管的能力,这些都要看。政策里提的智能体即服务这个思路,会把交付方式从卖模型推向卖结果。

共性底座建设,对朝阳智能原生产业园载体来说,首先是重新识别企业能力的一把尺子,落到企业服务上,园区后续将做三类支撑:
帮企业摸清能力位置


基础模型与算力、驾驭层与工具、评测与安全、行业智能体、场景工程团队,顺着这些环节走一遍,就能精准识别园区企业能力。
围绕具体问题组织专业资源
不同企业发展阶段和实际困难可能完全不同,园区可在评估和记录后,根据具体问题,引入模型平台、开发工具、评测安全、数据服务和场景交付等专业机构。对于具备试点条件的项目,园区可以协助对接场景方、组织需求沟通和推动小规模合作。
把试点成果接入到后续企业服务中


对于已经形成初步成效的项目,园区可以继续提供政策匹配、项目申报、融资对接、客户拓展和宣传展示等服务;同时记录企业在试点中的真实问题和资源需求,不断调整服务清单。

供稿 | 企业服务部
编审 | 品牌市场部
