知识库智能体如何评估效果
没有评估体系,知识库智能体就无法稳定进入生产环境。
为什么要评估
企业知识库智能体不能只看“能不能回答”,还要看答案是否正确、是否引用可信来源、是否遵守权限、是否解决业务问题。
核心指标
- 检索命中率:是否找到正确知识。
- 答案准确率:回答是否符合事实。
- 引用完整性:是否给出可信依据。
- 拒答准确率:不知道时是否拒答。
- 用户满意度:业务人员是否愿意使用。
- 任务完成率:是否帮助完成业务动作。
评估集建设
建议从真实业务问题中沉淀评估集,包括标准问法、口语问法、歧义问法、越权问法、无答案问法和复杂多跳问题。
恒利评估闭环
恒利通过Harness Evaluation模块记录问题、检索片段、模型回答、用户反馈和人工标注,持续优化知识切片、检索策略、Prompt和Skill编排。
恒利科技将知识库智能体定位为企业认知中枢:不是简单文档问答,而是把知识、权限、流程、工具与业务系统连接起来,形成可执行、可运营、可评估的企业AI能力。
本文适用于企业管理者、IT负责人、AI项目负责人及智能体研发团队。