Appearance
上线运维实验:用本地演练建立可恢复的 AI 服务
本页解决什么
把 AI 应用的版本、成本、质量和外部依赖故障放进同一个本地演示应用演练。你将练习从监控信号发现问题、按阈值告警、先止损再回滚,并留下可复核的事故复盘;本页不要求真实生产部署。
学习目标
完成后,你能为 AI 调用定义版本与成本记录,识别质量和依赖异常,按预设条件执行本地回滚,并把证据、负责人和预防动作写进复盘。
先修要求
先完成生成式 AI 实验、RAG 实验和评估与安全实验,并阅读部署、监控与成本与评估与风险。只使用合成或公开数据、模拟密钥和本地服务;不连接生产账户、真实客户资料或生产写入接口。
预计时间
120—160 分钟:准备本地基线 25 分钟、四类事故演练各 15—20 分钟、整理证据与复盘 35—55 分钟。
核心知识
统一的本地演练台
准备一个可在本机重复启动的演示应用:固定一份合成请求集、一个可切换的模型或提示配置、调用计数与估算成本、离线评估结果,以及一个可开关的模拟外部检索或工具端点。每次运行记录 run_id、代码版本、模型或提示版本、评估集版本、开始时间和操作者。日志只存最小必要的脱敏摘要,不记录真实提示内容、个人资料或凭据。
每个场景先运行已知稳定的基线并保留结果,再一次只改变一个开关。告警是本地演练的判定规则,不等于生产监控配置;任何不可解释的写入、权限异常或数据暴露迹象都应立即停止演练并人工接管。
四类事故演练
| 场景 | 监控信号与告警阈值 | 立即动作 | 回滚条件 | 必留证据 | 复盘负责人 |
|---|---|---|---|---|---|
| 模型或提示版本变化 | 同一离线评估集通过率比稳定基线低 5 个百分点以上,或引用缺失数大于 0 | 停止切换扩散,固定当前 run_id,把新版本仅留在本地试验槽 | 恢复到已记录的稳定模型和提示版本后,使用同一离线评估集的通过率不低于稳定基线减 5 个百分点,且引用缺失数为 0,方可解除限制 | 两次配置、版本号、评估集版本、逐例差异和切换时间 | 实验负责人 |
| 成本突增 | 单位成功任务成本超过基线 150%,或单次输入/输出超过已登记上限 | 暂停高成本批量任务,限制最大上下文、工具次数和重试次数 | 切回稳定配置后连续 10 次合成任务的单位成功成本不高于基线 110% | 调用次数、输入输出量、成功数、失败重试数和成本估算方法 | 运维负责人 |
| 质量下降 | 固定评估集通过率低于 85%,或关键引用正确率低于 95% | 停止自动采纳结果,改为只生成待人工复核的草稿 | 稳定版本在相同评估集上恢复到通过率不少于 90%,关键引用正确率 100% | 评估集版本、评分记录、失败样本摘要、人工复核结论 | 质量复核人 |
| 外部依赖失败 | 模拟检索或工具端点连续 3 次失败,或 5 分钟内错误率超过 20% | 熔断该依赖,返回“服务暂不可用或转人工”,不以模型猜测代替来源 | 端点健康检查连续 10 次成功,且恢复后 3 条合成请求有可定位的结果 | 错误码、健康检查、熔断时间、降级提示和恢复验证 | 集成负责人 |
阈值是本实验的明确触发器,不代表所有业务的通用上线门槛。实际系统应由业务风险、错误代价、容量和授权范围重新确定。
回滚与人工接管
回滚只恢复已登记的本地配置、合成数据和实验输出,不覆盖不明状态的文件。顺序是:停止新增调用 → 标记受影响 run_id → 导出最小必要日志摘要 → 应用上一稳定配置 → 在固定评估集上复验 → 由负责人记录是否解除限制。若无法确认是否产生副作用、发现权限边界变化或存在数据与权限影响,保持停止状态并交给指定负责人判断,不做猜测性清理。
事故复盘的目标
事故复盘不是追究“模型写错了”,而是确认系统为何没有在错误扩大前停止。复盘要区分触发条件、检测延迟、配置或流程根因、恢复动作和后续预防;每个预防动作都要有负责人和复验日期。使用下载事故复盘模板记录一次演练。
实操任务
- 启动同一个本地演示应用,建立稳定基线:运行 10 条合成请求、固定评估集,并记录版本、通过率、单位成功任务成本和依赖健康检查。
- 切换模型或提示版本,触发或模拟通过率下降;按表中阈值停止扩散、回滚并比较基线与恢复后结果。
- 提高模拟输入长度或重试次数,制造成本突增;按阈值限制上下文、工具和重试,验证成本回到回滚条件内。
- 注入三条预期失败的评估样本,造成质量下降;将输出改为人工复核草稿,修复后以同一评估集复验。
- 关闭模拟外部依赖,连续触发失败;验证熔断、降级提示和人工接管,恢复依赖后完成 10 次健康检查与 3 条端到端验证。
- 选一项场景,填写事故复盘模板,并为每个预防动作指定负责人和复验日期。
必交产物
- 一份稳定基线与四次场景运行记录,含
run_id、版本、指标、告警触发时间和操作者。 - 四类场景各一份证据包:版本或配置差异、成本计数、评分记录、健康检查或错误摘要。
- 一份本地回滚与恢复验证记录,说明触发条件、恢复配置和复验结果。
- 一份完整的事故复盘,含影响、检测、时间线、根因、恢复、预防、负责人和复验日期。
验收标准
复核人可用同一演示应用和合成输入复现四类事故;每类均能找到监控信号、明确告警阈值、立即动作、回滚条件、证据和复盘负责人。质量或安全边界不满足时,自动结果已停止进入人工接管;恢复后有固定评估集或健康检查的复验证据。将本地演练描述成生产部署、遗漏回滚条件、记录真实数据或凭据,均判为不通过。
常见错误
- 只记录异常日志,却没有可行动的阈值、负责人和下一步。
- 同时改模型、提示、评估集和依赖,导致无法定位原因。
- 看到成本上升就只换更便宜模型,没有按单位成功任务成本检查结果质量。
- 依赖失败时让模型编造来源或继续执行写操作。
- 回滚后不复验,或不记录恢复的是哪一个稳定版本。
