Appearance
部署、监控与成本
环境分层
| 环境 | 用途 | 数据与权限 |
|---|---|---|
| 本地 | 开发和快速验证 | 模拟或脱敏数据,不连接生产写入 |
| 测试 | 集成、回归和多人验收 | 独立配置,可重复初始化 |
| 预发布 | 验证生产等价配置和迁移 | 受控访问,尽量接近生产拓扑 |
| 生产 | 服务真实用户 | 最小权限、监控、备份和变更审计 |
不要把“本地能跑”当作可上线。生产还涉及域名、证书、环境变量、数据迁移、容量、告警、回滚和运维责任。
部署清单
- 构建过程可在干净环境复现。
- 配置与代码分离,敏感值不进入仓库和前端包。
- 数据迁移有前置检查、备份和失败停止条件。
- 健康检查能反映关键依赖,而不是只返回固定成功。
- 旧版本或上一个稳定版本可以快速恢复。
- 发布后执行真实关键路径检查。
- 记录版本、时间、负责人和验收结果。
监控四个层次
| 层次 | 关注内容 |
|---|---|
| 可用性 | 页面、接口、任务是否成功,外部依赖是否正常 |
| 性能 | 延迟、吞吐、队列、资源和页面加载 |
| 业务结果 | 完成率、失败类型、人工接管和用户反馈 |
| 安全与成本 | 异常访问、权限失败、调用量、资源和预算 |
告警需要可行动:说明影响、范围和下一步,不要把每条日志都变成报警。对需要人工响应的告警明确负责人、时间要求和升级路径。
AI 成本模型
总成本不只包含模型调用,还包括检索、存储、网络、工具执行、失败重试、人工审核、监控和维护。
text
单次任务成本 = 模型输入 + 模型输出 + 检索与工具 + 重试 + 人工复核
月度成本 = 单次任务成本 × 任务量 + 固定基础设施 + 运维成本成本控制顺序
- 先减少无效任务和重复上下文。
- 对简单步骤使用更轻量的模型或规则。
- 缓存稳定结果,但明确失效条件。
- 限制最大输入、输出、工具次数和重试次数。
- 对高价值或高风险任务保留更强模型和人工复核。
- 用单位成功任务成本衡量,不只看单次调用价格。
回滚与事故处理
发布前确定触发回滚的指标。事故发生时先止损、隔离影响和恢复服务,再调查根因;不要在生产上连续尝试未经验证的修复。事后记录时间线、影响、根因、修复和预防措施,避免把责任归结为“AI 写错了”。
