Skip to content

部署、监控与成本

环境分层

环境用途数据与权限
本地开发和快速验证模拟或脱敏数据,不连接生产写入
测试集成、回归和多人验收独立配置,可重复初始化
预发布验证生产等价配置和迁移受控访问,尽量接近生产拓扑
生产服务真实用户最小权限、监控、备份和变更审计

不要把“本地能跑”当作可上线。生产还涉及域名、证书、环境变量、数据迁移、容量、告警、回滚和运维责任。

部署清单

  1. 构建过程可在干净环境复现。
  2. 配置与代码分离,敏感值不进入仓库和前端包。
  3. 数据迁移有前置检查、备份和失败停止条件。
  4. 健康检查能反映关键依赖,而不是只返回固定成功。
  5. 旧版本或上一个稳定版本可以快速恢复。
  6. 发布后执行真实关键路径检查。
  7. 记录版本、时间、负责人和验收结果。

监控四个层次

层次关注内容
可用性页面、接口、任务是否成功,外部依赖是否正常
性能延迟、吞吐、队列、资源和页面加载
业务结果完成率、失败类型、人工接管和用户反馈
安全与成本异常访问、权限失败、调用量、资源和预算

告警需要可行动:说明影响、范围和下一步,不要把每条日志都变成报警。对需要人工响应的告警明确负责人、时间要求和升级路径。

AI 成本模型

总成本不只包含模型调用,还包括检索、存储、网络、工具执行、失败重试、人工审核、监控和维护。

text
单次任务成本 = 模型输入 + 模型输出 + 检索与工具 + 重试 + 人工复核
月度成本 = 单次任务成本 × 任务量 + 固定基础设施 + 运维成本

成本控制顺序

  • 先减少无效任务和重复上下文。
  • 对简单步骤使用更轻量的模型或规则。
  • 缓存稳定结果,但明确失效条件。
  • 限制最大输入、输出、工具次数和重试次数。
  • 对高价值或高风险任务保留更强模型和人工复核。
  • 用单位成功任务成本衡量,不只看单次调用价格。

回滚与事故处理

发布前确定触发回滚的指标。事故发生时先止损、隔离影响和恢复服务,再调查根因;不要在生产上连续尝试未经验证的修复。事后记录时间线、影响、根因、修复和预防措施,避免把责任归结为“AI 写错了”。

维知 Wiki · 面向应用工程的 AI 知识与训练系统