Appearance
评估与风险
本页解决什么:把 AI 方案从 demo 拉回可验收状态:评估集、指标门槛、失败样本、人工复核、兜底策略、灰度观察和上线风险。

产品视角
AI 产品不能只靠 demo 判断可行。靠谱的 AI 方案必须回答四个问题:评估集是什么、上线门槛是什么、失败时怎么办、上线后如何持续收集失败样本。没有评估集的 AI 项目,本质上无法判断方案是否变好。
技术边界
评估只能证明系统在已覆盖样本上的表现,不能保证所有未来场景都正确。高风险 AI 产品必须承认模型边界:低置信度、无证据、越权、分布外样本、不可逆动作都应该触发拒答、转人工或二次确认。
指标速查
| 指标 | 适合问题 | PM 解读 |
|---|---|---|
| 准确率 Accuracy | 类别均衡、错误代价接近 | 总体做对比例,类别不均衡时容易误导 |
| 精确率 Precision | 告警、推荐、自动处理 | 被模型判为正例的样本有多少是真的 |
| 召回率 Recall | 质检、风控、医疗筛查 | 真实正例有多少被找出来 |
| F1 | 精确率和召回率都重要 | 两者的折中指标,不代表业务价值全部 |
| 混淆矩阵 | 分类任务 | 看清误报、漏报和类别混淆 |
| mAP | 目标检测/分割 | 检测定位和分类综合指标 |
| 人工评审通过率 | LLM、RAG、Agent | 输出是否被专家或运营接受 |
| 延迟/成本 | 在线服务、Agent | 用户体验和商业可持续性 |
风险清单
| 风险 | 典型表现 | 产品处理 |
|---|---|---|
| 幻觉 | LLM 编造事实、引用不存在来源 | RAG 引用、拒答、人工复核 |
| 偏见 | 对某些人群、设备、地区表现差 | 分层评估、数据补齐、规则约束 |
| 数据安全 | 私有数据泄露或越权检索 | 权限过滤、脱敏、审计 |
| 可解释性不足 | 用户不知道为什么被拒绝或告警 | 输出证据、特征贡献、人工申诉 |
| 私有知识缺失 | 模型不知道企业内部制度 | RAG、知识图谱、工具查询 |
| 延迟过高 | Agent 多轮调用导致响应慢 | 缓存、流程裁剪、异步处理 |
| 成本失控 | Token、模型调用、人工复核超预算 | 限额、路由、小模型优先 |
| 自动化误伤 | 模型直接执行高风险动作 | 分级权限、人工确认、兜底策略 |
常见误判
- 只看准确率,不看召回率、精确率和高风险类别。
- 只测标准样本,不测边界样本、失败样本和真实线上样本。
- 把人工评审通过率当作唯一指标,忽略延迟、成本和安全。
- 用 LLM 自评替代业务专家验收,导致事实性和责任边界不清。
验收模板
| 项目 | 最低要求 |
|---|---|
| 评估集 | 覆盖真实场景、边界样本、历史失败样本,标注来源可追溯 |
| 指标门槛 | 按业务风险设定,例如召回率优先或精确率优先 |
| 失败样本 | 每次评审记录输入、输出、期望答案、失败原因 |
| 人工复核 | 高风险、低置信度、越权、无引用输出必须进入人工流程 |
| 兜底策略 | 拒答、转人工、要求补充信息、只给建议不执行动作 |
| 灰度观察 | 小范围上线,观察延迟、成本、投诉、人工改写率 |
沟通问题
- 这个评估集是否来自真实业务,而不是演示样本?
- 指标门槛对应什么业务损失或收益?
- 模型失败时是否会造成不可逆动作?
- 哪些输出必须带引用、证据或人工确认?
- 上线后失败样本由谁收集,多久复盘一次?
验证方式
验证要分为离线和在线。离线阶段用固定评估集比较不同方案;在线阶段观察真实用户反馈、处理效率、人工接管率、成本和延迟。对于 LLM/RAG/Agent,还要人工抽检事实性、引用准确性、指令遵循和安全边界。
最小示例
python
from sklearn.metrics import classification_report, confusion_matrix
y_true = [1, 1, 0, 1, 0, 0, 1, 0]
y_pred = [1, 0, 0, 1, 0, 1, 1, 0]
print(confusion_matrix(y_true, y_pred))
print(classification_report(y_true, y_pred, target_names=["normal", "risk"]))这个示例不是为了追求算法复杂度,而是提醒 PM:评估必须落到错误类型,不能只看一个总分。
下一步
- 要把评估嵌入具体场景:看 方案模式。
- 要控制 Agent 执行动作:看 MCP / Skill 专区。
- 要回到需求源头重新判断:看 需求判断与技术路线。
