Skip to content

应用工程基础

本页解决什么

帮助非算法人员把“想用 AI”变成可评估、可交接的应用问题:数据从哪里来、模型在何时使用、错误会造成什么影响,以及何处需要人工接管。这里不做公式推导,也不要求训练模型或编写算法。

学习目标

完成后,你能用工作语言说明数据质量、训练与测试、检索、模型推理和 RAG 的关系,并为一个小需求写出可验收的应用工程说明。

先修要求

无。建议先完成 入学诊断,并准备一个不包含客户隐私的咨询分类或文档问答案例。

预计时间

60—90 分钟:阅读 25 分钟、填写实操任务 25 分钟、与同伴复核 10—40 分钟。

核心知识

从数据到可用结论

数据质量决定系统学到和检索到的内容是否可信。训练集用于让模型学习规律,测试集用于检查它面对未见样本时是否仍有用。若模型只记住训练集中的表述,却无法处理新咨询,就发生了过拟合;这说明它没有足够泛化能力。

评估不能只问“准确不准确”。先定义指标,再定义错误代价:把普通咨询误判为紧急事项,可能增加人工负担;把紧急事项误判为普通咨询,可能延误响应。错误代价越高,越应设置更保守的阈值和人工接管。

先用 PEAS 说清任务环境

AIMA 应用工程框架把 AI 看作在环境中感知并行动的智能体。项目开始时先用 PEAS 写清四项:Performance 性能度量、Environment 环境、Actuators 执行器、Sensors 传感器。它能把“做一个智能客服”改写成可评审的系统合同。

PEAS 项应用工程问题知识助手示例
性能度量 Performance怎样算成功,哪类错误更严重引用准确、该拒答时拒答、响应时间可接受
环境 Environment系统面对哪些人、资料和变化用户、权限、文档库、更新流程、人工队列
执行器 Actuators系统被允许做什么检索、回答、追问、建单、转人工
传感器 Sensors系统能看到什么用户问题、身份、文档版本、检索证据、工具结果

理性不等于全知。输入不完整、工具失败或风险超出边界时,正确行动可能是补问、拒答或转人工,而不是强行生成答案。

从文本到检索与回答

文本清洗是去除无关格式、重复内容和失效资料,并保留来源与权限。文本会被切成 Token;Token 是模型处理文本的片段,不等同于一个汉字或一个词。向量是把文本特征表示成一组数值,用于计算相似度;相似度检索能从允许使用的资料里找出与问题更接近的片段。

NLP 是让计算机处理和生成自然语言的一类技术。Transformer 是现代语言模型常用的结构,它会根据输入上下文生成后续内容;它并不自动知道你的客户资料是否最新、是否有权限,也不能替你判断业务责任。

模型架构需要懂到什么程度

不需要推导公式,但要能说明信息怎样流动:传统机器学习主要组合人工特征;神经网络通过输入层、隐藏层和输出层逐层学习表示;CNN 用卷积提取局部空间模式;RNN/LSTM 在时间步之间传递状态;Transformer 用注意力连接不同位置。完整图解见模型核心架构

架构最少要说清的内容典型应用
传统 ML特征从哪里来,模型输出什么分数表格预测、分类、分群
神经网络输入、隐藏表示、输出和训练反馈复杂分类、回归、表示学习
CNN卷积核如何提取局部空间特征图像分类、检测、分割
RNN/LSTM状态如何在时间步之间传递短时序、传感器和语音序列
TransformerToken/Embedding 如何通过注意力建立关系文本、代码、LLM 和多模态

训练、推理与 RAG 的边界

训练产生模型;推理使用模型。训练改变的是模型从样本中学到的规律,推理是在当前输入下使用已得到的模型生成分类、摘要或回答。RAG 在推理时补充外部证据:先检索经授权的资料,再把相关片段连同问题提供给模型。RAG 可以改善依据的可追溯性,但不能弥补错误、过期或越权的数据。

实操任务

为一个“客户咨询分类”或“文档问答”需求填写以下六项:问题类型、数据来源、输出、错误代价、评估方式和人工接管。不要训练模型,不要编写算法,也不要粘贴真实客户隐私。

项目填写提示
问题类型分类、摘要、检索问答或其他可说明的任务
数据来源已授权的知识库、公开资料或脱敏样例;注明负责人
输出类别、带来源的回答或交给人工的待处理项
错误代价哪种错误更严重,会影响谁,如何限制影响
评估方式选取样例、通过标准、失败样例和复核频率
人工接管触发条件、接管人、处理动作和记录方式

必交产物

一页应用工程说明,包含实操表格的六项内容,以及一条“何时停止自动处理并交给人工”的明确规则。

验收标准

复核人能从说明中看出:数据是否已获授权、输出是否明确、错误代价是否按影响区分、评估能否复现、人工接管是否有责任人与动作。若缺少任一项,返回补充,不进入实现或上线。

常见错误

  • 把训练集当作测试集,导致结果看起来很好却无法说明泛化效果。
  • 只讨论模型名称,不写数据质量、错误代价和人工接管。
  • 认为向量相似就等于事实正确;检索结果仍需看来源、时效和权限。
  • 把 RAG 当作权限绕过工具;未授权资料不能因为“只用于推理”而被加入。

延伸学习

维知 Wiki · 面向应用工程的 AI 知识与训练系统