Skip to content

AIMA 应用工程框架:从理性智能体到现代 Agent

由数据、知识、规划、工具、评估、安全和人工监督组成的 AI 应用工程系统
真正的 AI 应用不是单个模型,而是围绕目标,把感知、知识、决策、行动、评估和人工监督连成闭环。

为什么用 AIMA 组织应用工程

《人工智能:现代方法(第4版)》全书分 7 个部分、28 章,贯穿它们的主线不是某一种算法,而是理性智能体如何在环境中感知、表示、推理、决策、行动和学习。这条主线非常适合应用工程:它迫使项目先定义成功标准和任务环境,再讨论模型、工具与自动化程度。

本站采用这套稳定骨架,但不照搬教材顺序,也不深入公式推导。经典 AI 负责解释“系统为什么这样设计”,现代 LLM、RAG、MCP、Skill、Harness 和评估工程负责回答“今天如何把它交付出来”。

核心判断:模型只是一种决策组件。应用工程还必须处理任务环境、数据与知识、可用动作、权限、错误代价、评估集、运行监控和人工接管。

应用工程总图

AI 应用从任务环境、感知、状态与知识、推理与规划、行动到评估和治理的完整闭环
AIMA 的智能体循环与现代应用工程可以直接对齐:输入不只是用户文字,行动也不只是生成回答。

一套可交付的 AI 系统至少包含六层:任务环境定义了成功和约束;感知层接收用户输入、文档、图像与工具返回;状态与知识层保存上下文、证据和权限;推理与规划层选择下一步;行动层调用模型、API 或人工流程;评估与治理层持续检查结果并决定放行、降级或接管。

七部分如何落到工程

原书结构章节基本问题应用工程落点本站入口
第一部分 人工智能基础1—2什么是理性行动,任务环境如何定义业务目标、PEAS、性能度量、自动化边界问题到技术路线
第二部分 问题求解3—6如何在状态、动作和约束中找到方案工作流、路径、排程、约束、对抗测试搜索、CSP 与博弈
第三部分 知识、推理和规划7—11如何表示事实、推导结论并组织行动知识库、规则、知识图谱、RAG、任务规划逻辑、知识表示与推理
第四部分 不确定知识和决策12—18信息不完整时如何判断、取舍和协作置信度、阈值、信息价值、长流程决策、多 Agent 协同概率与不确定性
第五部分 机器学习19—22系统如何从样本和反馈改进数据集、泛化、模型选择、深度学习、反馈闭环机器学习基础
第六部分 沟通、感知和行动23—26如何处理语言、视觉和物理世界LLM、Embedding、视觉管线、工具执行与控制LLM 训练机制
第七部分 总结27—28系统如何安全地影响人和社会隐私、公平、透明、安全、人工控制、整体架构评估与风险

28 章应用映射

章节只需掌握的基本原理应用工程翻译
第1章 绪论AI 可以按类人或理性、按思考或行动来理解项目必须选定评价口径,不能用“像人”代替业务成功
第2章 智能体智能体依据感知和性能度量选择行动用 PEAS 定义系统边界、输入、动作和成功标准
第3章 通过搜索进行问题求解把问题表示为状态、动作、目标和代价把多步任务变成可观察、可回退的工作流
第4章 复杂环境中的搜索真实环境可能未知、非确定或部分可观测设计分支、重试、补充信息、超时和人工接管
第5章 对抗搜索和博弈其他参与者会改变策略,局部最优未必稳健加入滥用场景、提示注入、红队测试和竞争响应
第6章 约束满足问题解必须同时满足变量、取值与约束用于排程、资源分配、合规规则和权限策略
第7章 逻辑智能体知识库与推断机制共同支持行动区分“存了什么”“如何检索”“能推出什么”
第8章 一阶逻辑对象、属性和关系让知识表达更精确设计数据模式、实体关系、术语表和知识图谱
第9章 一阶逻辑中的推断前向、反向与规则推断回答不同问题把规则引擎、查询和解释路径放在合适位置
第10章 知识表示类别、事件、时间、默认规则影响知识质量建立本体、元数据、版本、来源和冲突处理机制
第11章 自动规划动作前提、效果、层级和资源共同决定计划为 Agent 定义工具契约、依赖、恢复与回滚
第12章 不确定性的量化概率表达基于证据的信念,而非绝对真值用置信度、阈值、误报漏报和拒答规则管理风险
第13章 概率推理条件依赖和因果关系可减少复杂度用于诊断、风险分层、根因假设和证据更新
第14章 时间上的概率推理状态会随时间变化,需要观测与更新设计在线监控、漂移检测、预测和状态追踪
第15章 概率编程复杂不确定性可以通过结构化模型表达用模拟和概率模型评估组合风险,不把单点预测当事实
第16章 做简单决策概率说明相信什么,效用说明想要什么用错误代价、信息价值和多目标权衡设置动作门槛
第17章 做复杂决策连续决策要关注长期结果与策略评估长流程完成率、后续影响和中途恢复能力
第18章 多智能体决策多个智能体需要协调、分工、协商和裁决明确角色责任、共享状态、冲突规则和唯一裁决者
第19章 样例学习模型要从样本泛化到未见数据做数据划分、损失定义、基线比较和上线监控
第20章 概率模型学习噪声、缺失和隐变量影响学习结果记录数据不确定性,避免把估计值包装成确定事实
第21章 深度学习多层计算图可学习复杂表示模型核心架构根据数据形态选模型,同时控制数据、成本与可解释性
第22章 强化学习智能体从奖励反馈中改进策略只在反馈可信、探索安全且可模拟时采用在线优化
第23章 自然语言处理语言任务包含表示、结构、语义与具体目标先定义分类、抽取、检索或生成任务,再选模型
第24章 自然语言处理中的深度学习Embedding、注意力和迁移学习支撑现代语言模型理解 LLM 的能力来源,也认识上下文和事实边界
第25章 计算机视觉成像、特征、分类、检测与三维理解各有前提从采集与标定开始,按任务验证而不是只看演示图
第26章 机器人学感知、定位、规划和控制必须在真实世界闭环工具型 Agent 同样需要观测、动作、状态和安全停止
第27章 人工智能的哲学、伦理和安全性能做不等于应该做,公平和透明需要明确标准把隐私、偏见、审计、滥用和人工控制写入验收门禁
第28章 人工智能的未来完整智能来自多种表示、推理、学习与行动的组合采用模块化架构,允许模型与工具替换,保留治理层

PEAS 任务建模

PEAS 用 Performance、Environment、Actuators、Sensors 描述任务环境。它不是算法,而是一页可以直接用于需求评审的系统合同。

场景Performance 性能度量Environment 环境Actuators 执行器Sensors 传感器
企业知识助手引用准确率、拒答正确率、响应时间文档库、权限、用户问题、更新流程检索、回答、追问、转人工查询、用户身份、文档版本、检索证据
客服分流 Agent紧急事项召回率、误转率、处理时长工单、客服规则、历史记录、人工队列分类、补问、建单、升级用户消息、订单状态、风险词、工具返回
研发协作 Agent任务完成率、测试通过率、越权事件数代码仓库、规格、测试、权限边界搜索、编辑、执行测试、请求确认需求、代码、日志、测试结果、审批状态
视觉质检系统漏检率、误检率、节拍、复核率产线、相机、光照、产品批次标记缺陷、停线提示、生成报告图像、批次、设备状态、历史缺陷
如果性能度量只写“回答更好”或“更智能”,PEAS 仍未完成。至少要说明哪类错误更严重、何时拒答、谁能执行动作、出现什么信号必须交给人工。

叠加现代 LLM、RAG 与 Agent

AIMA 概念现代应用组件工程要求
感知 Sensors用户输入、检索结果、数据库查询、日志、图像记录来源、时效、权限和结构化校验
信念状态 / 内部状态上下文窗口、工作记忆、任务状态机明确哪些状态可恢复、可持久化、可共享
知识表示文档语料、Embedding、知识图谱、规则原始真源与派生索引分离,保留引用和版本
推理与规划LLM、规则引擎、搜索、工作流、Planner限制步骤、预算、超时和循环,验证计划可执行
执行器 ActuatorsAPI、MCP、Tool、Skill、脚本、人工工单最小权限、参数校验、幂等、确认和可回滚
学习提示改进、样本回收、微调、策略优化训练数据可追溯,线上反馈不能未经审核自动回灌
性能度量评估集、任务完成率、引用准确率、成本与延迟发布前离线门禁,发布后监控和失败样本复盘
安全控制Harness、权限网关、策略、审计、人工接管模型不能绕过系统边界,高风险动作必须由外部控制层约束

项目落地模板

一个应用工程项目可以按下面八步推进:

  1. 定义任务环境:用户是谁,目标是什么,哪些动作禁止自动执行。
  2. 确定输入与真源:列出数据、文档、工具返回及其权限和时效。
  3. 建立非 AI 基线:先比较规则、搜索、模板或人工流程是否已经足够。
  4. 选择最小技术组合:只在需要的地方加入 ML、LLM、RAG、图谱或 Agent。
  5. 定义动作契约:每个工具写明输入、输出、失败、幂等和回滚方式。
  6. 建立评估集:覆盖常见、边界、高风险和拒答样本,并写明通过门槛。
  7. 设置治理门禁:限制权限、成本和运行时间,保留日志、确认与人工接管。
  8. 监控并复盘:追踪漂移、失败样本、人工接管率和业务结果,决定继续、降级或停止。

一页评审表

要回答的问题合格示例
系统在优化什么引用准确率不低于既定门槛,高风险问题宁可拒答也不编造
环境中什么不可控用户输入、文档更新、第三方 API、网络和模型输出都可能变化
系统能做什么检索、草拟、补问和建单;不能自行审批、付款或发送外部消息
如何知道它失败无来源、低置信、工具异常、状态冲突或超出预算时视为失败
谁来接管指定岗位收到完整上下文、证据和失败原因后继续处理
如何验收固定评估集、版本记录、失败分类、人工抽检和灰度指标

学习边界

本站对算法只理解输入、输出、假设和代价:知道它解决什么问题、依赖什么条件、会在哪里失败、如何验证即可。搜索、贝叶斯网络、神经网络或强化学习的公式推导不作为应用工程前置要求。

还要注意时间边界:AIMA 第4版提供的是稳定的学科骨架,不能覆盖此后生成式 AI、RAG、工具调用和 Agent Harness 的全部工程实践。因此本站把它作为“系统思维层”,再叠加 AI 开发实践RAG、微调与部署Agent 架构模式评估与风险

延伸阅读

维知 Wiki · 面向应用工程的 AI 知识与训练系统