Skip to content

验证智能体实例

一体化智能体运行与协同平台(AgentWorks)使用已经创建并运行的智能体实例进行测试。生产接入前,请先创建测试实例,并验证模型回复、多轮会话、工具审批、中断和已配置能力。

在 Playground 中验证对话

  1. 打开目标智能体实例。
  2. 选择 Playground
  3. 等待连接状态显示 已连接
  4. 发送一组固定测试问题。
  5. 验证回复内容、追问行为和多轮上下文。
  6. 对工具调用确认中断可以显示,并能完成人工批准或拒绝。

使用固定测试集可以在修改模型、提示词或能力后比较结果。至少覆盖正常输入、缺失信息、越权请求和外部能力失败。

使用 API 调试验证请求

  1. 选择智能体实例的 API 调用
  2. API 调用状态 中开启 API 调用。
  3. 选择 生成临时 Token
  4. 调试 中发送非流式和流式请求。
  5. 保存返回的 session_id,继续发送第二轮请求。

临时调试 Token 只用于控制台调试,并在页面显示的有效期后失效。业务系统上线时选择 创建正式 Token

验证工具审批

先确认目标工具是否提供审批开关。对于沙箱工具,在对应沙箱模板或实例中开启 工具审批配置;智能体模板中的 工具权限 不能让原本直接执行的调用暂停。随后在测试调用的 Trace 中核对实际工具名称和顶层参数。不要用一种接入方式的测试结果代替另一种接入方式的验收。

  1. 对沙箱工具,确认 工具审批配置 已开启。对于没有审批开关的能力,不要假定模板规则会为其开启审批。
  2. 让智能体发起一次低风险测试调用,在 Trace 中记录可调用名称和实际顶层参数。
  3. 通过目标渠道发起匹配模板允许规则的低风险调用,确认自动批准并且只执行预期工具和参数。
  4. 发起匹配模板拒绝规则的调用,确认工具没有执行,也没有产生外部副作用。
  5. 让调用在模板规则中保持未命中,再使用配置了补充规则的渠道用户验证用户级结果。
  6. 发起模板和用户规则都不匹配的确认型调用,确认它进入人工审批。
  7. 对参数表达式测试边界值、空值、相似前缀和异常输入,并核对中断和最终结果。

在 Playground 中按界面显示的中断完成人工确认。使用 Invoke API 或 WebSocket 时,调用方还要分别验证 APPROVEREJECT 响应;使用渠道时,应使用目标渠道和目标用户验证自动处理顺序。字段来源参见找到工具名称和参数名,完整配置方法参见配置工具审批流程

在 Trace 中检查执行过程

打开 Trace,检查一次调用中的模型、工具和耗时信息。重点确认:

  • 使用了预期模型。
  • 工具参数符合预期的审批处理规则。
  • 知识库或 MCP 返回内容被正确使用。
  • 中断发生在高风险操作之前。
  • 错误位置与用户看到的结果一致。

Trace 是运行诊断信息,不是自动评测或质量优化系统。需要质量基准时,团队仍需维护测试集和验收标准。

检查能力运行记录

根据所用能力继续检查:

  • 沙箱:沙箱运行记录
  • 知识库:在 构建历史 中检查 状态,并选择 日志
  • 渠道:检查 会话管理用户绑定
  • API 调用:在 API 调用状态 中确认服务已开启,再检查调用任务状态和流式结束事件。

通过生产验收清单

只有以下条件全部满足后再切换生产流量:

  • 实例持续显示为 运行中
  • 固定测试集通过。
  • 外部能力凭证和地址使用生产配置。
  • 正式 Token 已创建且只交付给调用服务。
  • 监控人员知道如何查看 Trace、状态和运行记录。
  • 团队记录了上一个可用配置和手动回退方法。

参见将智能体投入生产