Skip to content

上线运维实验:用本地演练建立可恢复的 AI 服务

本页解决什么

把 AI 应用的版本、成本、质量和外部依赖故障放进同一个本地演示应用演练。你将练习从监控信号发现问题、按阈值告警、先止损再回滚,并留下可复核的事故复盘;本页不要求真实生产部署。

学习目标

完成后,你能为 AI 调用定义版本与成本记录,识别质量和依赖异常,按预设条件执行本地回滚,并把证据、负责人和预防动作写进复盘。

先修要求

先完成生成式 AI 实验RAG 实验评估与安全实验,并阅读部署、监控与成本评估与风险。只使用合成或公开数据、模拟密钥和本地服务;不连接生产账户、真实客户资料或生产写入接口。

预计时间

120—160 分钟:准备本地基线 25 分钟、四类事故演练各 15—20 分钟、整理证据与复盘 35—55 分钟。

核心知识

统一的本地演练台

准备一个可在本机重复启动的演示应用:固定一份合成请求集、一个可切换的模型或提示配置、调用计数与估算成本、离线评估结果,以及一个可开关的模拟外部检索或工具端点。每次运行记录 run_id、代码版本、模型或提示版本、评估集版本、开始时间和操作者。日志只存最小必要的脱敏摘要,不记录真实提示内容、个人资料或凭据。

每个场景先运行已知稳定的基线并保留结果,再一次只改变一个开关。告警是本地演练的判定规则,不等于生产监控配置;任何不可解释的写入、权限异常或数据暴露迹象都应立即停止演练并人工接管。

四类事故演练

场景监控信号与告警阈值立即动作回滚条件必留证据复盘负责人
模型或提示版本变化同一离线评估集通过率比稳定基线低 5 个百分点以上,或引用缺失数大于 0停止切换扩散,固定当前 run_id,把新版本仅留在本地试验槽恢复到已记录的稳定模型和提示版本后,使用同一离线评估集的通过率不低于稳定基线减 5 个百分点,且引用缺失数为 0,方可解除限制两次配置、版本号、评估集版本、逐例差异和切换时间实验负责人
成本突增单位成功任务成本超过基线 150%,或单次输入/输出超过已登记上限暂停高成本批量任务,限制最大上下文、工具次数和重试次数切回稳定配置后连续 10 次合成任务的单位成功成本不高于基线 110%调用次数、输入输出量、成功数、失败重试数和成本估算方法运维负责人
质量下降固定评估集通过率低于 85%,或关键引用正确率低于 95%停止自动采纳结果,改为只生成待人工复核的草稿稳定版本在相同评估集上恢复到通过率不少于 90%,关键引用正确率 100%评估集版本、评分记录、失败样本摘要、人工复核结论质量复核人
外部依赖失败模拟检索或工具端点连续 3 次失败,或 5 分钟内错误率超过 20%熔断该依赖,返回“服务暂不可用或转人工”,不以模型猜测代替来源端点健康检查连续 10 次成功,且恢复后 3 条合成请求有可定位的结果错误码、健康检查、熔断时间、降级提示和恢复验证集成负责人

阈值是本实验的明确触发器,不代表所有业务的通用上线门槛。实际系统应由业务风险、错误代价、容量和授权范围重新确定。

回滚与人工接管

回滚只恢复已登记的本地配置、合成数据和实验输出,不覆盖不明状态的文件。顺序是:停止新增调用 → 标记受影响 run_id → 导出最小必要日志摘要 → 应用上一稳定配置 → 在固定评估集上复验 → 由负责人记录是否解除限制。若无法确认是否产生副作用、发现权限边界变化或存在数据与权限影响,保持停止状态并交给指定负责人判断,不做猜测性清理。

事故复盘的目标

事故复盘不是追究“模型写错了”,而是确认系统为何没有在错误扩大前停止。复盘要区分触发条件、检测延迟、配置或流程根因、恢复动作和后续预防;每个预防动作都要有负责人和复验日期。使用下载事故复盘模板记录一次演练。

实操任务

  1. 启动同一个本地演示应用,建立稳定基线:运行 10 条合成请求、固定评估集,并记录版本、通过率、单位成功任务成本和依赖健康检查。
  2. 切换模型或提示版本,触发或模拟通过率下降;按表中阈值停止扩散、回滚并比较基线与恢复后结果。
  3. 提高模拟输入长度或重试次数,制造成本突增;按阈值限制上下文、工具和重试,验证成本回到回滚条件内。
  4. 注入三条预期失败的评估样本,造成质量下降;将输出改为人工复核草稿,修复后以同一评估集复验。
  5. 关闭模拟外部依赖,连续触发失败;验证熔断、降级提示和人工接管,恢复依赖后完成 10 次健康检查与 3 条端到端验证。
  6. 选一项场景,填写事故复盘模板,并为每个预防动作指定负责人和复验日期。

必交产物

  • 一份稳定基线与四次场景运行记录,含 run_id、版本、指标、告警触发时间和操作者。
  • 四类场景各一份证据包:版本或配置差异、成本计数、评分记录、健康检查或错误摘要。
  • 一份本地回滚与恢复验证记录,说明触发条件、恢复配置和复验结果。
  • 一份完整的事故复盘,含影响、检测、时间线、根因、恢复、预防、负责人和复验日期。

验收标准

复核人可用同一演示应用和合成输入复现四类事故;每类均能找到监控信号、明确告警阈值、立即动作、回滚条件、证据和复盘负责人。质量或安全边界不满足时,自动结果已停止进入人工接管;恢复后有固定评估集或健康检查的复验证据。将本地演练描述成生产部署、遗漏回滚条件、记录真实数据或凭据,均判为不通过。

常见错误

  • 只记录异常日志,却没有可行动的阈值、负责人和下一步。
  • 同时改模型、提示、评估集和依赖,导致无法定位原因。
  • 看到成本上升就只换更便宜模型,没有按单位成功任务成本检查结果质量。
  • 依赖失败时让模型编造来源或继续执行写操作。
  • 回滚后不复验,或不记录恢复的是哪一个稳定版本。

延伸学习

维知 Wiki · 面向应用工程的 AI 知识与训练系统