Skip to content

部署、监控与成本 ​

环境分层 ​

环境用途数据与权限
本地开发和快速验证模拟或脱敏数据,不连接生产写入
测试集成、回归和多人验收独立配置,可重复初始化
预发布验证生产等价配置和迁移受控访问,尽量接近生产拓扑
生产服务真实用户最小权限、监控、备份和变更审计

不要把“本地能跑”当作可上线。生产还涉及域名、证书、环境变量、数据迁移、容量、告警、回滚和运维责任。

部署清单 ​

  1. 构建过程可在干净环境复现。
  2. 配置与代码分离,敏感值不进入仓库和前端包。
  3. 数据迁移有前置检查、备份和失败停止条件。
  4. 健康检查能反映关键依赖,而不是只返回固定成功。
  5. 旧版本或上一个稳定版本可以快速恢复。
  6. 发布后执行真实关键路径检查。
  7. 记录版本、时间、负责人和验收结果。

监控四个层次 ​

层次关注内容
可用性页面、接口、任务是否成功,外部依赖是否正常
性能延迟、吞吐、队列、资源和页面加载
业务结果完成率、失败类型、人工接管和用户反馈
安全与成本异常访问、权限失败、调用量、资源和预算

告警需要可行动:说明影响、范围和下一步,不要把每条日志都变成报警。对需要人工响应的告警明确负责人、时间要求和升级路径。

AI 成本模型 ​

总成本不只包含模型调用,还包括检索、存储、网络、工具执行、失败重试、人工审核、监控和维护。

text
单次任务成本 = 模型输入 + 模型输出 + 检索与工具 + 重试 + 人工复核
月度成本 = 单次任务成本 × 任务量 + 固定基础设施 + 运维成本

成本控制顺序 ​

  • 先减少无效任务和重复上下文。
  • 对简单步骤使用更轻量的模型或规则。
  • 缓存稳定结果,但明确失效条件。
  • 限制最大输入、输出、工具次数和重试次数。
  • 对高价值或高风险任务保留更强模型和人工复核。
  • 用单位成功任务成本衡量,不只看单次调用价格。

回滚与事故处理 ​

发布前确定触发回滚的指标。事故发生时先止损、隔离影响和恢复服务,再调查根因;不要在生产上连续尝试未经验证的修复。事后记录时间线、影响、根因、修复和预防措施,避免把责任归结为“AI 写错了”。

维知 Wiki · 面向应用工程的 AI 知识与训练系统