Skip to content

将智能体投入生产

生产上线的目标不是只让一次调用成功,而是让智能体实例、能力资源、访问凭证、渠道和运行诊断形成可重复的交付路径。

明确交付角色

建议至少明确以下责任:

  • 平台管理员:负责租户能力开关、沙箱规格和环境以及平台级连接配置。
  • 智能体构建者:负责模型、提示词、工具审批配置、能力模板和固定测试集。
  • 智能体实例负责人:负责智能体实例、实例参数、渠道绑定、API 开关和 Token。
  • 运行负责人:负责状态、Trace、指标、运行记录、故障处理和变更窗口。
  • 业务系统负责人:负责会话关联和边界、重试、幂等、Token 保管、数据保留要求和用户体验。

使用一体化智能体运行与协同平台(AgentWorks)投入生产前,通过团队现有流程完成审批,并指定平台管理员、智能体构建者、智能体实例负责人、运行负责人和业务系统负责人。

详细分工见明确生产运行责任。AgentWorks 服务本身按平台方托管边界运行;参见了解平台托管与部署责任

为环境创建独立实例

为开发、预发布和生产分别创建独立智能体实例:

language-text
同一个智能体模板
  +-- <agent-name>-dev
  +-- <agent-name>-staging
  +-- <agent-name>-prod

每个环境使用独立:

  • 实例参数。
  • MCP、知识库、记忆库或沙箱资源,除非明确允许共享。
  • 渠道账号。
  • Agent API Token。
  • 测试和真实数据。

仅靠实例名称不会产生安全隔离,外部凭证和资源也必须分开。

固定生产配置

上线前记录:

  • 智能体模板名称、模型和模型凭证。
  • 系统提示词及关键模型参数。
  • 上下文压缩模型、最大长度、压缩阈值、保留阈值和温度。
  • 工具允许、拒绝和中断规则。
  • 能力模板、实际能力实例和实例参数。
  • 记忆库资源 ID、共享范围、交互模式、预期调用方和纠错责任人。
  • Skill 明确版本。
  • 知识库集合和最近一次成功入库任务。
  • 沙箱规格、环境和网络策略。
  • 渠道绑定模式或 API 调用方。
  • 何时继续或开始新会话,以及需要满足的数据保留和清理要求。

生产技能组固定使用明确版本;生产 MCP 连接保持 跳过 TLS 校验 关闭;生产 Token 指定明确负责人。

通过预发布验收

  1. 从同一智能体模板创建预发布智能体实例。
  2. 使用与生产相同的配置,但使用隔离的能力资源和测试数据。
  3. 运行固定测试集。
  4. 对长会话分别测试关闭压缩和生产压缩参数,比较事实保留、工具连续性、延迟和 Token 用量。
  5. 启用记忆库时,先用专用记忆库和 TOOL 完成写入、新会话检索、纠错和删除;使用自动方式时,再验证自动写入和检索结果。
  6. 测试多轮会话、并发保护,以及到达业务时长或轮数边界后开始新会话。
  7. 测试工具批准、拒绝和输入型中断。
  8. 测试外部服务超时和失败。
  9. 检查 Trace、沙箱记录和知识库日志。
  10. 进行 Token 轮换演练。
  11. 验证调用方能识别 HTTP 200 中的业务错误信封。

分阶段切换流量

使用业务系统或渠道配置分阶段切换流量:

  1. 创建新的生产候选智能体实例。
  2. 生成独立 Token,或创建独立渠道账号。
  3. 让少量受控调用方使用新实例。
  4. 对比 Trace、错误和业务结果。
  5. 完成验证后切换其余调用方。
  6. 保留旧实例和 Token 到观察期结束。

不要直接在唯一生产实例上验证高风险配置变更。

规划动态渠道实例规模

模板绑定加 /init 会按用户创建智能体实例。上线前估算:

  • 预期初始化用户数。
  • 每个实例需要的沙箱、技能组或其他能力资源。
  • 插件引用的能力资源是由各实例分别准备,还是由多个实例共享。
  • 允许的并发调用任务数。
  • 实例和用户绑定的清理责任。
  • 外部 MCP、模型和知识库的容量。
  • 外部工具和业务系统是否需要按渠道用户识别身份并执行授权。

只有完成 /init 的用户才会创建智能体实例;相关能力资源是否同时分别创建,取决于智能体模板中的插件选择。上线前估算容量,并为动态实例、用户绑定及其能力资源建立清理流程。动态创建减少预配置,但不会消除容量和生命周期管理。

专属智能体实例不自动保证数据和权限按用户隔离。生产验收时,确认不同用户的实例没有连接同一个包含私有数据的记忆库,再使用不同测试用户检查记忆写入和检索范围、MCP 或业务系统身份、沙箱资源关系及解绑后的清理流程。

准备回退

为便于手动回退,回退方案应包含:

  • 上一个可用智能体模板配置记录。
  • 旧生产智能体实例。
  • 旧 Token 或渠道路由恢复步骤。
  • 外部工具写操作的核对方法。
  • 调用任务重置和会话重新建立规则。

出现异常时优先把新流量切回旧实例,再调查和修正候选实例。

进入持续运行

上线后定期:

  • 查看智能体实例和配置同步状态。
  • 监控调用量、成功情况和 Token 用量。
  • 抽查 Trace 和高风险工具调用。
  • 检查沙箱运行和知识库入库失败。
  • 抽查长会话的上下文预算,并执行约定的数据保留和清理流程。
  • 轮换模型、MCP、渠道和 Agent API Token。
  • 删除不再使用的 Token、用户绑定、智能体实例和能力实例。

同时按规划安全、可用性与恢复边界确认密钥、沙箱网络、上传文件、连接撤销和外部备份责任。