Skip to content

评估与风险

本页解决什么:把 AI 方案从 demo 拉回可验收状态:评估集、指标门槛、失败样本、人工复核、兜底策略、灰度观察和上线风险。
AI 产品评估集、指标、失败样本、人工兜底的上线闭环图
AI 产品上线看的是闭环:有评估集、有指标、有失败样本、有人工兜底,才谈得上可控。
企业 AI 输入经过评估分流、安全门和人工复核的控制场景
评估不是一个总分:通过、存疑和失败样本要分流,风险动作必须经过安全门并保留人工接管。
混淆矩阵、精确率、召回率和 F1 的指标关系图
指标不是越高越好,而是要匹配业务代价:质检看漏检,自动处理看误杀,高风险场景看人工复核。
AI 上线前由评估集、指标门槛、失败样本、兜底策略和灰度观察组成的验收看板
上线验收不是一句“效果不错”,而是评估集、指标门槛、失败样本、兜底策略和灰度观察的组合。

产品视角

AI 产品不能只靠 demo 判断可行。靠谱的 AI 方案必须回答四个问题:评估集是什么、上线门槛是什么、失败时怎么办、上线后如何持续收集失败样本。没有评估集的 AI 项目,本质上无法判断方案是否变好。

技术边界

评估只能证明系统在已覆盖样本上的表现,不能保证所有未来场景都正确。高风险 AI 产品必须承认模型边界:低置信度、无证据、越权、分布外样本、不可逆动作都应该触发拒答、转人工或二次确认。

指标速查

指标适合问题PM 解读
准确率 Accuracy类别均衡、错误代价接近总体做对比例,类别不均衡时容易误导
精确率 Precision告警、推荐、自动处理被模型判为正例的样本有多少是真的
召回率 Recall质检、风控、医疗筛查真实正例有多少被找出来
F1精确率和召回率都重要两者的折中指标,不代表业务价值全部
混淆矩阵分类任务看清误报、漏报和类别混淆
mAP目标检测/分割检测定位和分类综合指标
人工评审通过率LLM、RAG、Agent输出是否被专家或运营接受
延迟/成本在线服务、Agent用户体验和商业可持续性

风险清单

风险典型表现产品处理
幻觉LLM 编造事实、引用不存在来源RAG 引用、拒答、人工复核
偏见对某些人群、设备、地区表现差分层评估、数据补齐、规则约束
数据安全私有数据泄露或越权检索权限过滤、脱敏、审计
可解释性不足用户不知道为什么被拒绝或告警输出证据、特征贡献、人工申诉
私有知识缺失模型不知道企业内部制度RAG、知识图谱、工具查询
延迟过高Agent 多轮调用导致响应慢缓存、流程裁剪、异步处理
成本失控Token、模型调用、人工复核超预算限额、路由、小模型优先
自动化误伤模型直接执行高风险动作分级权限、人工确认、兜底策略

常见误判

  • 只看准确率,不看召回率、精确率和高风险类别。
  • 只测标准样本,不测边界样本、失败样本和真实线上样本。
  • 把人工评审通过率当作唯一指标,忽略延迟、成本和安全。
  • 用 LLM 自评替代业务专家验收,导致事实性和责任边界不清。

验收模板

项目最低要求
评估集覆盖真实场景、边界样本、历史失败样本,标注来源可追溯
指标门槛按业务风险设定,例如召回率优先或精确率优先
失败样本每次评审记录输入、输出、期望答案、失败原因
人工复核高风险、低置信度、越权、无引用输出必须进入人工流程
兜底策略拒答、转人工、要求补充信息、只给建议不执行动作
灰度观察小范围上线,观察延迟、成本、投诉、人工改写率

沟通问题

  • 这个评估集是否来自真实业务,而不是演示样本?
  • 指标门槛对应什么业务损失或收益?
  • 模型失败时是否会造成不可逆动作?
  • 哪些输出必须带引用、证据或人工确认?
  • 上线后失败样本由谁收集,多久复盘一次?

验证方式

验证要分为离线和在线。离线阶段用固定评估集比较不同方案;在线阶段观察真实用户反馈、处理效率、人工接管率、成本和延迟。对于 LLM/RAG/Agent,还要人工抽检事实性、引用准确性、指令遵循和安全边界。

最小示例

python
from sklearn.metrics import classification_report, confusion_matrix

y_true = [1, 1, 0, 1, 0, 0, 1, 0]
y_pred = [1, 0, 0, 1, 0, 1, 1, 0]

print(confusion_matrix(y_true, y_pred))
print(classification_report(y_true, y_pred, target_names=["normal", "risk"]))

这个示例不是为了追求算法复杂度,而是提醒 PM:评估必须落到错误类型,不能只看一个总分。

下一步

维知 Wiki · 面向应用工程的 AI 知识与训练系统