跳到主要内容

能力评估

手一滑改了 Agent 配置,上线后客户投诉「怎么突然不会说话了」——测试就是给 Agent 出的「模拟考」,提前准备好问题和标准答案,每次改完配置先跑一遍,避免翻车。

一、测试管理

创建测试问题模拟对话(开发者视角)

在 Agent 配置页右侧,有测试窗口。你可以测试运行:

一个测试用例由两部分组成:问题和回答准则。

问题: 客户会怎么问。比如「你们能提供什么服务」「500 件 T 恤发洛杉矶多少钱」「美本计算机专业推荐哪些学校」。问题越接近真实客户,测试越有价值。

**填写准则:**不需要写完整的标准答案,只要列出关键点——Agent 回答命中了这些关键点就算通过。

这张图片对应的是能力评估模块中创建测试问题的页面,页面显示共设置了2道测试问题,分为全部、就绪、草稿三类。页面右上方有一个被红色框标出的“+添加问题”蓝色按钮,还有两个功能图标,用于添加测试问题或进行相关操作。该界面对应了文档中创建测试问题的操作环节,供开发者选择或添加想测试的问题,后续还可直接进入测试环节查看智能体的回答内容。

  • 选择想测试的问题(ai拟也可以自己加上问题)

    图片展示的是“测试管理”中“创建测试问题模拟对话(开发者视角)”部分的内容。画面中有一个“添加问题”弹窗,提示先挑几个最值得练的问题,最多选5个,也可自己加,加的不占名额,答完这几题就能开始正常对话。弹窗内列出了4个问题,分别是关于卧室采光、儿童房环保漆、阳台改造及承重墙装修的咨询,每个问题右侧有对应标签,如“色彩搭配”“环保材料”等。底部有“已选0”显示,以及“就选这几道”蓝色按钮。

  • 填写问题后也可以直接进入到试一试,看agent在没有提示的情况下给出的答案。

  • 填写准则:关键点(非全文匹配,关键词命中即可)

图片展示了测试管理中创建测试问题模拟对话的界面。左侧为问题示例,包含固定案例、正向个例、反向个例等内容。右侧是测试问题列表,显示共12道题,其中50分,可添加问题、试一试、报告等操作。红色框突出显示“试一试”按钮,箭头指向其所在位置。该图片与上下文紧密相关,直观呈现了填写问题后可直接试一试,看agent在没有提示情况下给出答案的操作场景。

如何编写好的测试用例

问题要真实

不要编造问题。把客户真问过的问题拿来做用例。编出来的问题太理想化,Agent 答得再好也没用——因为客户根本不会那样问。

不好的问题: "请提供产品 A 的 FOB 报价"(太标准,客户不会这样打字) 好的问题: "500 件 T 恤发洛杉矶,最低多少钱能做"(接近真实客户口气)

关键点要具体

期望回答的关键点不是越多越好,是越准越好。一个用例 3-5 个关键点足够。

不好的关键点: "回答要专业、准确、友好"(太模糊,无法判断是否命中) 好的关键点: "产品名称""单价""物流方式""交货时间"(可以明确判断命中了没)

覆盖边界场景

除了常规问题,还要覆盖容易出错的边界场景:

  • 模糊问题:客户说得不清楚怎么办?"那个东西多少钱"
  • 无关问题:客户问了跟业务无关的怎么办?"今天天气怎么样"
  • 敏感问题:客户问了不该问的怎么办?"你能帮我查一下隔壁公司的报价吗"

按优先级分 P0/P1/P2

级别含义举例
P0核心业务场景,挂了就是事故报价、产品信息、联系方式
P1常见场景,挂了影响体验行业咨询、流程说明
P2边缘场景,挂了影响不大闲聊、无关问题

从真实会话中提取用例

最好的测试用例来自真实客户。你不需要从头编——从对话记录里找。

提取流程

  1. 浏览对话记录:在会话列表中,找到有代表性的对话
  2. 找到好案例:Agent 回答准确的对话,一键加入测试集作为正面用例
  3. 自行记录坏案例:Agent 回答出错的对话,添加到测试集作为反面用例,标注期望的正确回答
  4. 定期补充:每周从新对话中挑 5-10 条加入测试集,用例库会越来越贴近真实场景

找什么

  • 客户反复问的问题:同一个问题被问了 10 次,说明它是高频场景,必须有测试用例覆盖
  • Agent 答错过的对话:翻过车的场景,一定要补进测试集,防止下次再翻
  • 客户表达不满的对话:客户说"不对""不是这个意思""你再看看"——这些是 Agent 的薄弱环节

二、回归测试

手动触发

  • 一键跑全量:已就绪问题点击「测评」,系统自动对所有测试用例逐一提问,记录 Agent 的每次回答
  • 单用例测试:调试某个具体问题时,可以只跑一个用例,不浪费全量跑的时间

这张图呈现的是回归测试相关的操作界面,上方有标注“测试”的功能按钮,旁边配文“所有问题一键测试”,对应文档中手动触发回归测试的一键跑全量功能;界面下方的单个用例测试区域,标注有“单个问题测试”,设置了“小”“助手”等测试相关的操作选项,和文档中针对具体问题进行单用例调试的内容相呼应,清晰展示了手动触发回归测试的两种操作路径,用于辅助测试Agent在不同场景下的回答情况。

回归测试界面

这张回归测试相关的界面中,清晰展示了两个用例的测试评分结果:第一个关于卧室选色的用例评分为40分,第二个关于厨房橱柜的用例评分为80分,还有下方一条同主题的测试记录评分为0分。界面里每个用例下方都配有“测评”“转为草稿”“试一试”“附加训练”的操作按钮,同时明确标注了测试的时间,还有测试结果的展示模块,直观呈现了各用例的评分情况,对应文档中回归测试结果展示的相关内容,帮助用户快速查看不同用例的测试情况。

测试结果与过程显示以及失败原因详情

持续优化

  • 针对失败项调整 Agent 配置,辅到训练

图片展示的是回归测试界面中测试结果与过程显示及失败原因详情部分。界面显示“我卧室是朝北的,采光不好,想刷墙漆能让房间显得亮堂一点,推荐什么颜色?”这一问题,回答准则为“为什么推荐,预算多少,后续可能会有什么框”,并有“色彩搭配”“AI拟”标签。下方显示该问题测评结果为0分,有“附到训练”按钮。该图片与文档中“持续优化”部分相关,说明针对失败项可调整Agent配置,附到训练后重新跑回归测试,验证修复效果。

  • 在训练里给你想给答案,重新跑回归测试,验证修复效果

这张图片展示的是Agent测试相关的操作内容,与回归测试的操作指引直接对应,具体内容为:上方有用户需求要求按照个性、报价以及后续的影响这个结构进行回复,下方的思考过程明确表示需按个性匹配→报价→后续影响的结构撰写,还说明了draft_training_answer已定稿,无法直接写入草稿,需要先在待答问题面板点击「更新」退回待答状态,才能进行新答案的撰写操作。

  • 调整后测试评分

图片展示的是回归测试界面中测试结果与过程显示及失败原因详情。界面显示2026 - 09 - 07 18:28:47的测评结果,AI得分为80分。下方有测评、转为脚本、试一试、附到回测等操作选项。测评记录中,2026/9/7 18:28:00有1次通过,2026/9/7 13:37:11有1次通过。该图片与文档中回归测试的测试结果与过程显示内容相关,直观呈现了测评结果及操作选项。

什么时候跑

  • 每次修改 Agent 配置后:改了知识库、Skill、本体,跑一遍确认没改坏
  • 定期跑:Agent 即使没改,客户问法也在变,建议至少每周跑一次

结果展示

  • 通过/失败列表:展开查看每个用例的状态——绿色分数通过,红色分数失败
  • 失败原因详情:点击失败用例,展开看「预期命中什么」vs「实际答了什么」的对比,一目了然

测试报告

每次回归测试跑完后,系统自动生成一份测试报告,不用你手动整理。报告跑完即刻生效,包含以下内容:

整体表现

  • 测试时间:报告生成时间(如 2026/9/8 10:40)
  • 通过/需优化统计:几项通过、几项需要优化,一眼看清整体情况

主要问题

系统自动识别 Agent 表现最弱的地方,给出具体分析。

优化建议

针对发现的薄弱项,报告给出具体可操作的优化方向,不是泛泛的「建议优化」,而是指向具体问题

逐项评分

每个测试用例单独打分,通不通过、得多少分,一目了然:

图片展示的是智能体回归测试报告,时间为2026/9/8 10:40。整体表现显示1题通过,1题需优化,智能体在回答内容与用户问题及准则脱节方面表现较弱。主要问题指出用户询问“我们能做什么”时,智能体未按要求介绍留学咨询服务,导致答非所问。优化建议包括明确智能体回答需围绕自身身份展开,禁止介绍无关平台内容,增加对用户意图识别训练等。逐项评分中,“openhex是干什么的”得100分,“用户问我们能做什么”得0分。

测试报告预览

测试结果解读与行动

测试跑完了,不是看一眼分数就完事。看懂结果,才知道下一步该做什么。

常见的失败模式

失败模式表现可能原因怎么修
知识缺失Agent 说"我不知道"或给出空洞回答知识库里没有相关资料补充知识库文档
信息错误Agent 回答包含错误的产品信息或价格本体数据过时或有误更新本体数据
答非所问Agent 的回答跟问题不相关意图识别错误调整话术配置
格式问题内容正确,但格式不对(缺少必要字段)输出模板不完整调整回复模板
幻觉Agent 编造了不存在的信息知识库覆盖面不够补充知识库 + 设置「不知道就说不」的约束

试一试功能

「试一试」是训练页的预览/测试面板。你在这个面板里扮演客户,给 Agent 发消息,感受它的回复速度、语气和内容质量。这是在发布之前最后一次验证——确保 Agent 在真实对话场景里表现合格。

图片展示的是OpenGauss Agent的测试界面。界面左侧有“试一试”“测试结果”“测试报告”等选项卡,右侧是测试内容区域,显示了客户与Agent的对话示例,如“我找你家师傅来家里量了,他说装修好的话要等我师傅回来”。右上角有“管理者视角”“试一试”按钮,以及“+”“-”按钮。该图片与文档中“测试结果解读与行动”部分相关,用于呈现测试过程中客户与Agent的对话情况。

agent拥有者视角,可以看到思考过程

图片展示的是OpenAlley平台中客户视角下的Agent测试界面。左侧为测试流程,当前处于“试一试”环节。右侧是对话区域,上方有“我的家装修遇到了大量问题,现在想换好,你能帮我吗?”的客户提问,下方是Agent的回复。右上角有“客户视角”标识,右侧还有“AI”标识。该图片与文档中“测试结果解读与行动”部分相关,呈现了客户在测试环节与Agent的对话情况,帮助理解测试时的客户体验。

客户视角

三、扫码分享(客户视角)

在做完 Agent 配置后,就可以把二维码分享给客户

• 分享里有二维码:网页、微信、飞书

• 用手机扫码或其他渠道扫码,以客户身份发起对话

这三张图均对应客户视角下的Agent相关操作及对话内容展示,是文档中关于扫码分享客户发起对话的相关示例。左侧页面展示了可用于分享的“ITEC报名官艾小可”相关二维码,支持网页、微信、飞书渠道分享,还可复制链接或二维码;中间页面为扫码后显示的对应活动名片,带有“立即对话”按钮;右侧页面则呈现了以客户身份发起对话后的聊天界面,能看到Agent的回复内容,整体展示了Agent配置后,客户扫码发起对话的完整流程示例。