Skip to content

RAG 实验:让每个回答回到可核验来源

本页解决什么

建立一个可复现的小型 RAG 实验:从可追溯来源开始,覆盖可回答、有冲突、无答案和过期文档四类问题,检查系统会不会给出能定位原文的引用,或在证据不足时正确拒答。

学习目标

完成后,你能登记来源、构造带预期行为的评估样本,检查检索与回答的引用链,并把冲突、过期和无答案情况转给人工,而不是用流畅文字掩盖证据缺口。

先修要求

先完成应用工程基础生成式 AI 实验。阅读KG、RAG 与 Agent评估与风险。资料只能使用公开、合成或已授权的文档;不得下载受限资料、绕过访问控制,或把敏感材料带入实验。

预计时间

120—180 分钟:来源登记 30 分钟、建库与检索检查 30—60 分钟、制作与评审评估样本 60—90 分钟。

核心知识

先建可追溯的小语料

选择 5—20 份小型文档,每份都在来源登记中记录标题、来源链接、负责人、授权或权威依据、版本、生效日期、失效日期和最后核验日期。给每份文档一个稳定 source_id;切分后每个片段仍要带回 source_id、页码或标题层级、段落或行号等定位信息。回答中的引用必须能让复核人定位原文,而不是只写“知识库显示”。

先用合成制度片段、公开说明或已授权样例做实验。不要把检索命中当作事实裁决:相似度高不等于资料仍有效、拥有足够权限或能够回答问题。RAG 的检索边界可参见KG、RAG 与 Agent,模型适配边界可参见RAG、微调与部署优化

四类评估样本

样本类型期望行为
可回答给出答案和准确来源
有冲突展示冲突来源、版本和日期,不擅自裁决
无答案明确拒答并说明缺少什么证据
过期文档标注过期风险并转人工确认

至少准备 12 个样本,每类不少于 3 个。一个样本必须写清输入、预期行为、预期证据、禁止行为、风险等级和复核结果。无来源答案、不能定位原文的引用,或把无答案问题编成结论,均不得计为通过。

回答契约与人工边界

回答正文与引用要一起评审。对于可回答问题,引用需准确指向支持该结论的原文;对于有冲突问题,保留冲突来源、版本和日期;对于无答案问题,使用拒答说明所缺的资料;对于过期文档,即使文本匹配也要标注过期风险并转人工确认。高风险问题或权限不明时,应停止自动回答。

实操任务

  1. 选取 5—20 份公开、合成或已授权的小型文档,使用下载来源登记模板逐份登记;不得空着授权、版本或核验日期。
  2. 将文档切分并保留 source_id 与可定位字段;随机抽查 3 个片段能否回到原文。
  3. 按四类样本各制作至少 3 个,在下载评估集模板中写下预期行为和禁止行为。
  4. 运行评估集,逐例检查答案、引用和拒答。可回答样本必须有准确来源;有冲突样本不得由模型裁决;无答案样本必须拒答;过期文档样本必须转人工确认。
  5. 下载实验记录模板记录检索配置、失败样本、停用或转人工的条件。

必交产物

  • 一份来源登记 CSV,包含 5—20 份小型文档及其权限、版本、时效和切分策略。
  • 一份至少 12 条的评估集 CSV,四类样本每类不少于 3 条。
  • 一份实验记录,附 4 个代表性输入、回答、引用定位与复核结论,并列出所有不通过样本。

验收标准

复核人能打开每条通过样本的引用并定位原文;每一类样本至少有 3 条;无答案样本没有被编造为结论;冲突样本显示了冲突来源、版本和日期;过期文档被标注并转人工确认。来源不明、引用不可定位、答案无来源或用拒答掩盖本可回答问题,均判为不通过。

常见错误

  • 直接把资料放入向量库,却不登记来源、授权、版本和失效日期。
  • 用“相关文档”代替引用,复核人无法定位原文。
  • 把有冲突资料压成单一答案,未说明冲突和未裁决原因。
  • 把无答案样本当作低分答案,而不是验证拒答是否正确的必要样本。
  • 用过期文档给出确定结论,或把模型流畅度误当作证据充分。

延伸学习

维知 Wiki · 面向应用工程的 AI 知识与训练系统