Appearance
RAG 实验:让每个回答回到可核验来源
本页解决什么
建立一个可复现的小型 RAG 实验:从可追溯来源开始,覆盖可回答、有冲突、无答案和过期文档四类问题,检查系统会不会给出能定位原文的引用,或在证据不足时正确拒答。
学习目标
完成后,你能登记来源、构造带预期行为的评估样本,检查检索与回答的引用链,并把冲突、过期和无答案情况转给人工,而不是用流畅文字掩盖证据缺口。
先修要求
先完成应用工程基础和生成式 AI 实验。阅读KG、RAG 与 Agent及评估与风险。资料只能使用公开、合成或已授权的文档;不得下载受限资料、绕过访问控制,或把敏感材料带入实验。
预计时间
120—180 分钟:来源登记 30 分钟、建库与检索检查 30—60 分钟、制作与评审评估样本 60—90 分钟。
核心知识
先建可追溯的小语料
选择 5—20 份小型文档,每份都在来源登记中记录标题、来源链接、负责人、授权或权威依据、版本、生效日期、失效日期和最后核验日期。给每份文档一个稳定 source_id;切分后每个片段仍要带回 source_id、页码或标题层级、段落或行号等定位信息。回答中的引用必须能让复核人定位原文,而不是只写“知识库显示”。
先用合成制度片段、公开说明或已授权样例做实验。不要把检索命中当作事实裁决:相似度高不等于资料仍有效、拥有足够权限或能够回答问题。RAG 的检索边界可参见KG、RAG 与 Agent,模型适配边界可参见RAG、微调与部署优化。
四类评估样本
| 样本类型 | 期望行为 |
|---|---|
| 可回答 | 给出答案和准确来源 |
| 有冲突 | 展示冲突来源、版本和日期,不擅自裁决 |
| 无答案 | 明确拒答并说明缺少什么证据 |
| 过期文档 | 标注过期风险并转人工确认 |
至少准备 12 个样本,每类不少于 3 个。一个样本必须写清输入、预期行为、预期证据、禁止行为、风险等级和复核结果。无来源答案、不能定位原文的引用,或把无答案问题编成结论,均不得计为通过。
回答契约与人工边界
回答正文与引用要一起评审。对于可回答问题,引用需准确指向支持该结论的原文;对于有冲突问题,保留冲突来源、版本和日期;对于无答案问题,使用拒答说明所缺的资料;对于过期文档,即使文本匹配也要标注过期风险并转人工确认。高风险问题或权限不明时,应停止自动回答。
实操任务
- 选取 5—20 份公开、合成或已授权的小型文档,使用下载来源登记模板逐份登记;不得空着授权、版本或核验日期。
- 将文档切分并保留
source_id与可定位字段;随机抽查 3 个片段能否回到原文。 - 按四类样本各制作至少 3 个,在下载评估集模板中写下预期行为和禁止行为。
- 运行评估集,逐例检查答案、引用和拒答。可回答样本必须有准确来源;有冲突样本不得由模型裁决;无答案样本必须拒答;过期文档样本必须转人工确认。
- 用下载实验记录模板记录检索配置、失败样本、停用或转人工的条件。
必交产物
- 一份来源登记 CSV,包含 5—20 份小型文档及其权限、版本、时效和切分策略。
- 一份至少 12 条的评估集 CSV,四类样本每类不少于 3 条。
- 一份实验记录,附 4 个代表性输入、回答、引用定位与复核结论,并列出所有不通过样本。
验收标准
复核人能打开每条通过样本的引用并定位原文;每一类样本至少有 3 条;无答案样本没有被编造为结论;冲突样本显示了冲突来源、版本和日期;过期文档被标注并转人工确认。来源不明、引用不可定位、答案无来源或用拒答掩盖本可回答问题,均判为不通过。
常见错误
- 直接把资料放入向量库,却不登记来源、授权、版本和失效日期。
- 用“相关文档”代替引用,复核人无法定位原文。
- 把有冲突资料压成单一答案,未说明冲突和未裁决原因。
- 把无答案样本当作低分答案,而不是验证拒答是否正确的必要样本。
- 用过期文档给出确定结论,或把模型流畅度误当作证据充分。
