Harness开发Agent的完整闭环
恒利 Harness 工程方法把企业智能体开发拆成“业务建模、Agent设计、知识与工具、流程编排、评测验证、上线运维、持续优化”七个阶段。每个阶段都有明确输入、工程动作和交付物,避免智能体停留在聊天演示层面。
业务目标定义
明确智能体服务哪个业务、替代或增强哪个岗位、解决什么问题、用什么指标证明价值。
任务边界建模
拆分用户意图、任务类型、输入输出、异常情况、人工接管条件和不可执行范围。
Agent角色设计
定义智能体身份、职责、权限、记忆范围、工具清单、对话风格和业务规则。
知识增强建设
接入企业文档、制度、产品资料、订单、客户资料和业务数据库,形成RAG知识能力。
工具与系统接入
通过API、MCP或业务适配器,让智能体安全调用CRM、ERP、OA、工单、库存、搜索等系统。
工作流编排
把“理解、检索、判断、调用、确认、执行、反馈、记录”编排为可追踪的任务链路。
评测与验收
用标准测试集验证准确率、召回率、工具调用成功率、任务完成率、安全性和稳定性。
部署与运营
上线后持续观察成本、延迟、错误、用户反馈、知识命中率和业务转化效果。
从需求到上线的工程交付表
| 阶段 | 关键问题 | Harness工程动作 | 交付物 |
|---|---|---|---|
| 需求分析 | Agent到底为谁服务?解决什么业务问题? | 梳理岗位、流程、痛点、指标和权限边界。 | 业务目标说明、任务清单、ROI指标。 |
| Agent设计 | 智能体应该扮演什么角色?能做什么?不能做什么? | 定义角色、系统提示词、工具权限、上下文策略和人工接管规则。 | Agent规格说明书。 |
| 知识建设 | Agent回答和判断依据从哪里来? | 清洗文档、切片、向量化、权限过滤、召回测试。 | 知识库、RAG策略、知识命中测试集。 |
| 工具接入 | Agent如何执行真实业务动作? | 封装API、定义参数、增加鉴权、幂等、审计和失败回滚。 | 工具目录、接口协议、调用日志。 |
| 流程编排 | 复杂任务怎样拆解和流转? | 设计Workflow、状态机、条件分支、异常处理、人工确认节点。 | 工作流图、状态流转表。 |
| 评测验收 | 怎样证明Agent可上线? | 构建测试集,验证回答、检索、调用、流程和安全边界。 | 评测报告、上线验收清单。 |
| 上线运营 | 上线后如何持续优化? | 监控日志、反馈、成本、命中率、完成率和异常样本。 | 运行看板、优化迭代计划。 |
Harness开发Agent的推荐目录结构
/agent-project
/agents # 智能体角色定义
sales_agent.yaml
customer_service_agent.yaml
/prompts # 系统提示词、任务提示词、工具提示词
/workflows # Agent Workflow流程编排
/tools # 工具封装、API适配器、MCP连接器
/knowledge # 文档、切片规则、向量库配置、权限策略
/memory # 会话记忆、任务状态、用户画像、长期记忆
/evals # 测试集、评测脚本、验收标准
/observability # 日志、调用链、成本、错误追踪
/deployment # Docker、配置、环境变量、私有化部署一个企业客服智能体的开发示例
以企业客服智能体为例,Harness不是只让模型回答问题,而是让智能体完成“识别问题—检索知识—判断是否需要查订单—调用系统—生成答案—必要时转人工—沉淀案例”的完整闭环。
用户问题:我的订单什么时候发货?
Harness执行链路:
1. Intent识别:订单物流查询
2. 身份校验:手机号 / 订单号 / 用户登录态
3. 工具选择:query_order_status(order_id)
4. 知识增强:读取售后政策、发货规则、异常说明
5. 结果生成:结合订单状态与政策生成答复
6. 异常处理:订单不存在 / 权限不足 / 接口失败时进入人工接管
7. 记录沉淀:写入会话日志、问题分类和后续优化样本上线前必须回答的10个问题
恒利观点
真正可商业化的企业Agent,不是“会聊天的模型”,而是“有角色、有知识、有工具、有流程、有权限、有评测、有运营”的智能体工程系统。Harness框架的价值,就是把这些能力组织成可复制的开发方法。
用 Harness 方法开发可落地的企业智能体
恒利科技围绕需求分析、Agent设计、工具接入、知识增强、流程编排、评测验收、部署运维与持续优化,帮助企业把AI智能体从演示样机建设为可交付、可运营、可创造价值的业务系统。
获取Harness智能体开发方案