能力评估
手一滑改了 Agent 配置,上线后客户投诉「怎么突然不会说话了」——测试就是给 Agent 出的「模拟考」,提前准备好问题和标准答案,每次改完配置先跑一遍,避免翻车。
一、测试管理
创建测试问题模拟对话(开发者视角)
在 Agent 配置页右侧,有测试窗口。你可以测试运行:
一个测试用例由两部分组成:问题和回答准则。
问题: 客户会怎么问。比如「你们能提供什么服务」「500 件 T 恤发洛杉矶多少钱」「美本计算机专业推荐哪些学校」。问题越接近真实客户,测试越有价值。
**填写准则:**不需要写完整的标准答案,只要列出关键点——Agent 回答命中了这些关键点就算通过。

-
选择想测试的问题(ai拟也可以自己加上问题)

-
填写问题后也可以直接进入到试一试,看agent在没有提示的情况下给出的答案。
-
填写准则:关键点(非全文匹配,关键词命中即可)

如何编写好的测试用例
问题要真实
不要编造问题。把客户真问过的问题拿来做用例。编出来的问题太理想化,Agent 答得再好也没用——因为客户根本不会那样问。
不好的问题: "请提供产品 A 的 FOB 报价"(太标准,客户不会这样打字) 好的问题: "500 件 T 恤发洛杉矶,最低多少钱能做"(接近真实客户口气)
关键点要具体
期望回答的关键点不是越多越好,是越准越好。一个用例 3-5 个关键点足够。
不好的关键点: "回答要专业、准确、友好"(太模糊,无法判断是否命中) 好的关键点: "产品名称""单价""物流方式""交货时间"(可以明确判断命中了没)
覆盖边界场景
除了常规问题,还要覆盖容易出错的边界场景:
- 模糊问题:客户说得不清楚怎么办?"那个东西多少钱"
- 无关问题:客户问了跟业务无关的怎么办?"今天天气怎么样"
- 敏感问题:客户问了不该问的怎么办?"你能帮我查一下隔壁公司的报价吗"
按优先级分 P0/P1/P2
| 级别 | 含义 | 举例 |
|---|---|---|
| P0 | 核心业务场景,挂了就是事故 | 报价、产品信息、联系方式 |
| P1 | 常见场景,挂了影响体验 | 行业咨询、流程说明 |
| P2 | 边缘场景,挂了影响不大 | 闲聊、无关问题 |
从真实会话中提取用例
最好的测试用例来自真实客户。你不需要从头编——从对话记录里找。
提取流程
- 浏览对话记录:在会话列表中,找到有代表性的对话
- 找到好案例:Agent 回答准确的对话,一键加入测试集作为正面用例
- 自行记录坏案例:Agent 回答出错的对话,添加到测试集作为反面用例,标注期望的正确回答
- 定期补充:每周从新对话中挑 5-10 条加入测试集,用例库会越来越贴近真实场景
找什么
- 客户反复问的问题:同一个问题被问了 10 次,说明它是高频场景,必须有测试用例覆盖
- Agent 答错过的对话:翻过车的场景,一定要补进测试集,防止下次再翻
- 客户表达不满的对话:客户说"不对""不是这个意思""你再看看"——这些是 Agent 的薄弱环节
二、回归测试
手动触发
- 一键跑全量:已就绪问题点击「测评」,系统自动对所有测试用例逐一提问,记录 Agent 的每次回答
- 单用例测试:调试某个具体问题时,可以只跑一个用例,不浪费全量跑的时间

回归测试界面

测试结果与过程显示以及失败原因详情
持续优化
- 针对失败项调整 Agent 配置,辅到训练

- 在训练里给你想给答案,重新跑回归测试,验证修复效果

- 调整后测试评分

什么时候跑
- 每次修改 Agent 配置后:改了知识库、Skill、本体,跑一遍确认没改坏
- 定期跑:Agent 即使没改,客户问法也在变,建议至少每周跑一次
结果展示
- 通过/失败列表:展开查看每个用例的状态——绿色分数通过,红色分数失败
- 失败原因详情:点击失败用例,展开看「预期命中什么」vs「实际答了什么」的对比,一目了然
测试报告
每次回归测试跑完后,系统自动生成一份测试报告,不用你手动整理。报告跑完即刻生效,包含以下内容:
整体表现
- 测试时间:报告生成时间(如 2026/9/8 10:40)
- 通过/需优化统计:几项通过、几项需要优化,一眼看清整体情况
主要问题
系统自动识别 Agent 表现最弱的地方,给出具体分析。
优化建议
针对发现的薄弱项,报告给出具体可操作的优化方向,不是泛泛的「建议优化」,而是指向具体问题
逐项评分
每个测试用例单独打分,通不通过、得多少分,一目了然:

测试报告预览
测试结果解读与行动
测试跑完了,不是看一眼分数就完事。看懂结果,才知道下一步该做什么。
常见的失败模式
| 失败模式 | 表现 | 可能原因 | 怎么修 |
|---|---|---|---|
| 知识缺失 | Agent 说"我不知道"或给出空洞回答 | 知识库里没有相关资料 | 补充知识库文档 |
| 信息错误 | Agent 回答包含错误的产品信息或价格 | 本体数据过时或有误 | 更新本体数据 |
| 答非所问 | Agent 的回答跟问题不相关 | 意图识别错误 | 调整话术配置 |
| 格式问题 | 内容正确,但格式不对(缺少必要字段) | 输出模板不完整 | 调整回复模板 |
| 幻觉 | Agent 编造了不存在的信息 | 知识库覆盖面不够 | 补充知识库 + 设置「不知道就说不」的约束 |
试一试功能
「试一试」是训练页的预览/测试面板。你在这个面板里扮演客户,给 Agent 发消息,感受它的回复速度、语气和内容质量。这是在发布之前最后一次验证——确保 Agent 在真实对话场景里表现合格。

agent拥有者视角,可以看到思考过程

客户视角
三、扫码分享(客户视角)
在做完 Agent 配置后,就可以把二维码分享给客户
• 分享里有二维码:网页、微信、飞书
• 用手机扫码或其他渠道扫码,以客户身份发起对话
