Appearance
AIMA 应用工程框架:从理性智能体到现代 Agent

为什么用 AIMA 组织应用工程
《人工智能:现代方法(第4版)》全书分 7 个部分、28 章,贯穿它们的主线不是某一种算法,而是理性智能体如何在环境中感知、表示、推理、决策、行动和学习。这条主线非常适合应用工程:它迫使项目先定义成功标准和任务环境,再讨论模型、工具与自动化程度。
本站采用这套稳定骨架,但不照搬教材顺序,也不深入公式推导。经典 AI 负责解释“系统为什么这样设计”,现代 LLM、RAG、MCP、Skill、Harness 和评估工程负责回答“今天如何把它交付出来”。
核心判断:模型只是一种决策组件。应用工程还必须处理任务环境、数据与知识、可用动作、权限、错误代价、评估集、运行监控和人工接管。
应用工程总图
一套可交付的 AI 系统至少包含六层:任务环境定义了成功和约束;感知层接收用户输入、文档、图像与工具返回;状态与知识层保存上下文、证据和权限;推理与规划层选择下一步;行动层调用模型、API 或人工流程;评估与治理层持续检查结果并决定放行、降级或接管。
七部分如何落到工程
| 原书结构 | 章节 | 基本问题 | 应用工程落点 | 本站入口 |
|---|---|---|---|---|
| 第一部分 人工智能基础 | 1—2 | 什么是理性行动,任务环境如何定义 | 业务目标、PEAS、性能度量、自动化边界 | 问题到技术路线 |
| 第二部分 问题求解 | 3—6 | 如何在状态、动作和约束中找到方案 | 工作流、路径、排程、约束、对抗测试 | 搜索、CSP 与博弈 |
| 第三部分 知识、推理和规划 | 7—11 | 如何表示事实、推导结论并组织行动 | 知识库、规则、知识图谱、RAG、任务规划 | 逻辑、知识表示与推理 |
| 第四部分 不确定知识和决策 | 12—18 | 信息不完整时如何判断、取舍和协作 | 置信度、阈值、信息价值、长流程决策、多 Agent 协同 | 概率与不确定性 |
| 第五部分 机器学习 | 19—22 | 系统如何从样本和反馈改进 | 数据集、泛化、模型选择、深度学习、反馈闭环 | 机器学习基础 |
| 第六部分 沟通、感知和行动 | 23—26 | 如何处理语言、视觉和物理世界 | LLM、Embedding、视觉管线、工具执行与控制 | LLM 训练机制 |
| 第七部分 总结 | 27—28 | 系统如何安全地影响人和社会 | 隐私、公平、透明、安全、人工控制、整体架构 | 评估与风险 |
28 章应用映射
| 章节 | 只需掌握的基本原理 | 应用工程翻译 |
|---|---|---|
| 第1章 绪论 | AI 可以按类人或理性、按思考或行动来理解 | 项目必须选定评价口径,不能用“像人”代替业务成功 |
| 第2章 智能体 | 智能体依据感知和性能度量选择行动 | 用 PEAS 定义系统边界、输入、动作和成功标准 |
| 第3章 通过搜索进行问题求解 | 把问题表示为状态、动作、目标和代价 | 把多步任务变成可观察、可回退的工作流 |
| 第4章 复杂环境中的搜索 | 真实环境可能未知、非确定或部分可观测 | 设计分支、重试、补充信息、超时和人工接管 |
| 第5章 对抗搜索和博弈 | 其他参与者会改变策略,局部最优未必稳健 | 加入滥用场景、提示注入、红队测试和竞争响应 |
| 第6章 约束满足问题 | 解必须同时满足变量、取值与约束 | 用于排程、资源分配、合规规则和权限策略 |
| 第7章 逻辑智能体 | 知识库与推断机制共同支持行动 | 区分“存了什么”“如何检索”“能推出什么” |
| 第8章 一阶逻辑 | 对象、属性和关系让知识表达更精确 | 设计数据模式、实体关系、术语表和知识图谱 |
| 第9章 一阶逻辑中的推断 | 前向、反向与规则推断回答不同问题 | 把规则引擎、查询和解释路径放在合适位置 |
| 第10章 知识表示 | 类别、事件、时间、默认规则影响知识质量 | 建立本体、元数据、版本、来源和冲突处理机制 |
| 第11章 自动规划 | 动作前提、效果、层级和资源共同决定计划 | 为 Agent 定义工具契约、依赖、恢复与回滚 |
| 第12章 不确定性的量化 | 概率表达基于证据的信念,而非绝对真值 | 用置信度、阈值、误报漏报和拒答规则管理风险 |
| 第13章 概率推理 | 条件依赖和因果关系可减少复杂度 | 用于诊断、风险分层、根因假设和证据更新 |
| 第14章 时间上的概率推理 | 状态会随时间变化,需要观测与更新 | 设计在线监控、漂移检测、预测和状态追踪 |
| 第15章 概率编程 | 复杂不确定性可以通过结构化模型表达 | 用模拟和概率模型评估组合风险,不把单点预测当事实 |
| 第16章 做简单决策 | 概率说明相信什么,效用说明想要什么 | 用错误代价、信息价值和多目标权衡设置动作门槛 |
| 第17章 做复杂决策 | 连续决策要关注长期结果与策略 | 评估长流程完成率、后续影响和中途恢复能力 |
| 第18章 多智能体决策 | 多个智能体需要协调、分工、协商和裁决 | 明确角色责任、共享状态、冲突规则和唯一裁决者 |
| 第19章 样例学习 | 模型要从样本泛化到未见数据 | 做数据划分、损失定义、基线比较和上线监控 |
| 第20章 概率模型学习 | 噪声、缺失和隐变量影响学习结果 | 记录数据不确定性,避免把估计值包装成确定事实 |
| 第21章 深度学习 | 多层计算图可学习复杂表示 | 按模型核心架构根据数据形态选模型,同时控制数据、成本与可解释性 |
| 第22章 强化学习 | 智能体从奖励反馈中改进策略 | 只在反馈可信、探索安全且可模拟时采用在线优化 |
| 第23章 自然语言处理 | 语言任务包含表示、结构、语义与具体目标 | 先定义分类、抽取、检索或生成任务,再选模型 |
| 第24章 自然语言处理中的深度学习 | Embedding、注意力和迁移学习支撑现代语言模型 | 理解 LLM 的能力来源,也认识上下文和事实边界 |
| 第25章 计算机视觉 | 成像、特征、分类、检测与三维理解各有前提 | 从采集与标定开始,按任务验证而不是只看演示图 |
| 第26章 机器人学 | 感知、定位、规划和控制必须在真实世界闭环 | 工具型 Agent 同样需要观测、动作、状态和安全停止 |
| 第27章 人工智能的哲学、伦理和安全性 | 能做不等于应该做,公平和透明需要明确标准 | 把隐私、偏见、审计、滥用和人工控制写入验收门禁 |
| 第28章 人工智能的未来 | 完整智能来自多种表示、推理、学习与行动的组合 | 采用模块化架构,允许模型与工具替换,保留治理层 |
PEAS 任务建模
PEAS 用 Performance、Environment、Actuators、Sensors 描述任务环境。它不是算法,而是一页可以直接用于需求评审的系统合同。
| 场景 | Performance 性能度量 | Environment 环境 | Actuators 执行器 | Sensors 传感器 |
|---|---|---|---|---|
| 企业知识助手 | 引用准确率、拒答正确率、响应时间 | 文档库、权限、用户问题、更新流程 | 检索、回答、追问、转人工 | 查询、用户身份、文档版本、检索证据 |
| 客服分流 Agent | 紧急事项召回率、误转率、处理时长 | 工单、客服规则、历史记录、人工队列 | 分类、补问、建单、升级 | 用户消息、订单状态、风险词、工具返回 |
| 研发协作 Agent | 任务完成率、测试通过率、越权事件数 | 代码仓库、规格、测试、权限边界 | 搜索、编辑、执行测试、请求确认 | 需求、代码、日志、测试结果、审批状态 |
| 视觉质检系统 | 漏检率、误检率、节拍、复核率 | 产线、相机、光照、产品批次 | 标记缺陷、停线提示、生成报告 | 图像、批次、设备状态、历史缺陷 |
如果性能度量只写“回答更好”或“更智能”,PEAS 仍未完成。至少要说明哪类错误更严重、何时拒答、谁能执行动作、出现什么信号必须交给人工。
叠加现代 LLM、RAG 与 Agent
| AIMA 概念 | 现代应用组件 | 工程要求 |
|---|---|---|
| 感知 Sensors | 用户输入、检索结果、数据库查询、日志、图像 | 记录来源、时效、权限和结构化校验 |
| 信念状态 / 内部状态 | 上下文窗口、工作记忆、任务状态机 | 明确哪些状态可恢复、可持久化、可共享 |
| 知识表示 | 文档语料、Embedding、知识图谱、规则 | 原始真源与派生索引分离,保留引用和版本 |
| 推理与规划 | LLM、规则引擎、搜索、工作流、Planner | 限制步骤、预算、超时和循环,验证计划可执行 |
| 执行器 Actuators | API、MCP、Tool、Skill、脚本、人工工单 | 最小权限、参数校验、幂等、确认和可回滚 |
| 学习 | 提示改进、样本回收、微调、策略优化 | 训练数据可追溯,线上反馈不能未经审核自动回灌 |
| 性能度量 | 评估集、任务完成率、引用准确率、成本与延迟 | 发布前离线门禁,发布后监控和失败样本复盘 |
| 安全控制 | Harness、权限网关、策略、审计、人工接管 | 模型不能绕过系统边界,高风险动作必须由外部控制层约束 |
项目落地模板
一个应用工程项目可以按下面八步推进:
- 定义任务环境:用户是谁,目标是什么,哪些动作禁止自动执行。
- 确定输入与真源:列出数据、文档、工具返回及其权限和时效。
- 建立非 AI 基线:先比较规则、搜索、模板或人工流程是否已经足够。
- 选择最小技术组合:只在需要的地方加入 ML、LLM、RAG、图谱或 Agent。
- 定义动作契约:每个工具写明输入、输出、失败、幂等和回滚方式。
- 建立评估集:覆盖常见、边界、高风险和拒答样本,并写明通过门槛。
- 设置治理门禁:限制权限、成本和运行时间,保留日志、确认与人工接管。
- 监控并复盘:追踪漂移、失败样本、人工接管率和业务结果,决定继续、降级或停止。
一页评审表
| 要回答的问题 | 合格示例 |
|---|---|
| 系统在优化什么 | 引用准确率不低于既定门槛,高风险问题宁可拒答也不编造 |
| 环境中什么不可控 | 用户输入、文档更新、第三方 API、网络和模型输出都可能变化 |
| 系统能做什么 | 检索、草拟、补问和建单;不能自行审批、付款或发送外部消息 |
| 如何知道它失败 | 无来源、低置信、工具异常、状态冲突或超出预算时视为失败 |
| 谁来接管 | 指定岗位收到完整上下文、证据和失败原因后继续处理 |
| 如何验收 | 固定评估集、版本记录、失败分类、人工抽检和灰度指标 |
学习边界
本站对算法只理解输入、输出、假设和代价:知道它解决什么问题、依赖什么条件、会在哪里失败、如何验证即可。搜索、贝叶斯网络、神经网络或强化学习的公式推导不作为应用工程前置要求。
还要注意时间边界:AIMA 第4版提供的是稳定的学科骨架,不能覆盖此后生成式 AI、RAG、工具调用和 Agent Harness 的全部工程实践。因此本站把它作为“系统思维层”,再叠加 AI 开发实践、RAG、微调与部署、Agent 架构模式 和 评估与风险。
