🤖 Stage 04

Agent 设计与
进阶工程化

Agent 是 AI 能力的集大成者。2025-2026 年,随着 MCP 协议成为事实标准、A2A 协议发布,Agent 生态迎来爆发式增长。本阶段深入 ReAct 推理、MCP+A2A 双协议、多 Agent 协作和 LLMOps 工程化实践。


Evolution Timeline
🕰️ AI Agent 工具演变史

从“会聊天”到“能干活”再到“会成长”,AI Agent 经历了五次范式跃迁。理解这条演进路线,才能看清 Harness Engineering 为什么是 2026 年最值得投入的工程能力。

Phase 01 · 2022-2023
💬
Chatbot
单轮问答,模型只负责生成文本,不会调用工具、不会执行操作。
ChatGPT 文心一言 豆包
Phase 02 · 2023-2024
✏️
Copilot
在编辑器/IDE 中实时补全代码或文本,辅助人类完成局部任务,但不独立执行。
GitHub Copilot Cursor
Phase 03 · 2025
🛠️
Coding Agent
能读仓库、改代码、跑测试、生成 diff,独立完成一个完整的工程任务。
Claude Code Codex CLI Aider
Phase 04 · 2025-2026
🦞
Workflow Agent
调用工具、接消息、执行流程,7×24 小时常驻后台,真正接入日常工作流。
OpenClaw 小龙虾 Goose
Phase 05 · 2026
🧠
Personal Agent + Harness
长期记忆 + 自进化 + Harness 驾驭工程,从“能用”走向“可靠、可审计、可持续”。
Hermes Agent Harness Engineering
🔑 核心公式
Agent = Model + Harness
Model = 大模型(大脑):负责推理、生成、决策
Harness = 驾驭层(骨骼+神经):工具调度、上下文管理、持久记忆、权限管控、审计熔断

模型在商品化,Harness 在资产化。谁掌握了 Harness 工程能力,谁就掌握了 Agent 时代的核心竞争力。
📊 2026 年 8 款代表 Harness 对比
工具 定位 阵营
OpenClaw 个人 AI 管家 开源 / 社区
Hermes Agent 自进化智能体 开源 / Nous Research
Claude Code 终端编码标杆 商业 / Anthropic
Codex CLI 终端 / DevOps 开源 / OpenAI
Gemini CLI 免费档强 开源 / Google
Cursor CLI IDE 下沉终端 商业 / Cursor
Cline VS Code 扩展 开源 / 社区
OpenHands 企业级自主 SWE 开源 / 社区
🏗️ Harness 四层架构
记忆层
短期上下文 + 长期事实 + 任务历史,实现跨会话经验复用
🔧
工具调度层
Tool Calling 状态机:拦截→执行→回灌,支持 MCP/A2A 协议
上下文管理层
动态管理 Token 窗口,Observation Compression,Reference Pointer
🛡️
输出稳定层
权限管控、沙箱隔离、熔断审计,确保 Agent 行为可预测可追溯

Fundamentals
🎯 什么是 AI Agent

AI Agent 是一种能够感知环境、进行推理、做出决策并执行行动的智能系统。它不仅仅是简单的问答,而是能够完成复杂任务的"智能体"。

🔄 Agent 的核心循环
Step 01
思考 (Think)
分析当前任务,决定下一步应该做什么
Step 02
行动 (Act)
执行工具调用或其他操作
Step 03
观察 (Observe)
获取工具执行结果或环境反馈
循环
Repeat
根据观察结果继续思考,直到任务完成
⚡ Agent 的关键能力
计划能力
将复杂任务分解为多个步骤的能力
工具调用
根据任务需求选择并调用合适的工具
记忆能力
记住对话历史和中间结果的能力
反思能力
检查执行结果、发现错误并修正的能力

ReAct Framework
🧠 ReAct 推理框架

ReAct (Reason + Action) 是一种让语言模型通过交替进行推理和行动来解决问题的框架。

📖
ReAct 的核心思想
原理:让模型在思考过程中明确输出"Thought"和"Action",形成可追踪的推理链。

格式示例:
Thought: 用户想了解今天的天气,我需要调用天气查询工具。
Action: {"tool": "weather", "params": {"city": "北京"}}
Observation: 北京今天晴,气温 25-32°C
Thought: 已经获取到天气信息,可以总结回答了。
Action: {"tool": "finish", "params": {"answer": "..."}}
🎯
ReAct 的优势
  • 可解释性:推理过程清晰可见,便于调试和理解
  • 灵活性:支持多种工具和复杂任务流程
  • 自我修正:可以根据观察结果调整策略
  • 任务分解:能够将复杂任务分解为多个简单步骤

Architecture Patterns
🏛️ Agent 架构模式对比

不同任务需要不同的 Agent 架构模式。选对模式比选对框架更重要。

📊 四种主流架构模式
1
Function Calling(工具调用)
模型直接输出工具调用请求,最简单直接。适合单步工具调用场景。
低延迟单步
2
ReAct(推理+行动)
交替进行思考和行动,形成可追踪的推理链。适合需要多步推理的复杂任务。
可解释多步
3
Plan-and-Execute(计划执行)
先制定完整计划,再逐步执行。适合需要全局规划的复杂项目。
全局规划长任务
4
LATS(树搜索 Agent)
结合蒙特卡洛树搜索,探索多条推理路径并回溯。适合需要最优解的高难度任务。
最优解回溯
🎯 模式选择决策树
任务复杂度评估
单步工具调用 → Function Calling
例:查询天气、搜索网页、读取文件
多步推理任务 → ReAct
例:数据分析、代码调试、研究调查
需要全局规划 → Plan-and-Execute
例:项目开发、报告撰写、方案设计
需要最优解 → LATS
例:数学证明、策略博弈、复杂优化
💡 实践建议:从 Function Calling 开始,遇到瓶颈再升级到 ReAct,不要一开始就用最复杂的模式。

Memory System
🧠 Agent 记忆体系

记忆是 Agent 持续学习和个性化服务的关键。不同类型的记忆决定了 Agent 的"智力水平"。

短期记忆
当前对话的上下文窗口,随对话结束而消失。
实现方式:对话历史、上下文窗口
容量限制:通常 4K-200K tokens
关键挑战:上下文窗口溢出
对话历史 临时
💾
长期记忆
跨会话持久化存储的用户偏好、知识和经验。
实现方式:向量数据库、KV 存储
存储内容:用户偏好、历史决策
关键挑战:记忆检索准确性
持久化 个性化
📖
情景记忆
对特定事件和经验的记忆,支持"回忆"和"联想"。
实现方式:事件日志 + 语义索引
存储内容:任务经验、错误教训
关键挑战:经验提取与泛化
经验 反思
💡 记忆系统设计原则:短期记忆保证对话流畅,长期记忆实现个性化,情景记忆支撑经验学习。三者配合才能让 Agent 真正"记住"你。Dify v1.15.0 的 Agent Runtime 2.0 已内置多层记忆管理。

MCP Protocol
🔌 MCP 模型上下文协议

MCP 已从 Anthropic 主导的协议发展为 Linux 基金会 AAIF 治理的行业事实标准(9700万+安装、5000+ Server),让 AI 能够以统一方式访问外部工具与服务。这是我们"调整 MCP"的核心操作对象。

⚙️
核心调整点:MCP 配置
MCP 2026-07-28 规范:Streamable HTTP 传输、OAuth 2.1、无状态化演进
模型路由
配置不同模型的调用规则
工具注册
注册自定义工具和插件
权限控制
设置工具调用权限
📝
MCP 实战配置示例(Dify + Hermes)
以 Dify v1.15.0 为例,配置 MCP Server 让 Agent 调用外部工具:
// mcp_config.json — Dify MCP Server 配置
{
  "mcpServers": {
    "filesystem": {
      "command": "npx",
      "args": ["-y", "@modelcontextprotocol/server-filesystem", "/data"],
      "transport": "stdio"           // 本地传输模式
    },
    "database": {
      "command": "npx",
      "args": ["-y", "@modelcontextprotocol/server-postgres"],
      "env": { "DATABASE_URL": "postgresql://user:pass@localhost:5432/mydb" }
    },
    "web-search": {
      "url": "https://mcp.example.com/search",
      "transport": "streamable-http"   // 2026新规范:远程HTTP传输
    }
  }
}
stdio
本地进程通信
性能最好
streamable-http
远程 HTTP 传输
2026新标准
sse (已弃用)
旧版远程传输
迁移到 streamable-http
📊 MCP 协议核心组件
🧩
工具定义 (Tool Definition)
描述工具的名称、功能、参数和返回值格式
JSON Schema
📡
工具调用 (Tool Call)
模型生成的工具调用请求,包含工具名称和参数
结构化输出
📤
工具结果 (Tool Result)
工具执行后返回的结果,传递回模型进行下一步处理
Observation
🌐 MCP 的优势
标准化
统一的工具调用格式,便于跨平台集成
安全性
支持权限控制和调用验证,保障系统安全
扩展性
易于添加新工具,扩展 Agent 能力
跨模型兼容
同一套工具可以被不同模型使用

Agent-to-Agent
🤝 A2A 协议 — Agent 间通信新标准

Google 2025 年 4 月推出 Agent-to-Agent (A2A) 协议,150+ 组织参与,2026 年 5 月发布 v1.0。MCP 管 Agent-to-Tool,A2A 管 Agent-to-Agent,双协议构建完整 Agent 生态。

🌐
A2A 是什么
A2A 是一个开放协议,标准化了不同 Agent 之间的发现、协商和协作机制:
  • Agent Card 发现:通过 /.well-known/agent.json 自动发现可用 Agent
  • 任务委托:Agent 可以将子任务委托给其他专业 Agent
  • 能力协商:Agent 间自动协商通信格式和协议版本
  • 安全隔离:每个 Agent 独立运行,通过协议安全通信
Agent Card 任务委托 开放标准
⚖️
MCP vs A2A:互补而非竞争
维度 MCP A2A
通信对象 Agent → Tool Agent → Agent
类比 USB 接口 HTTP 协议
治理 Linux 基金会 AAIF Google 主导 + 开放社区
生态规模 9700万+安装 150+组织参与

Multi-Agent
👥 多 Agent 协作框架

复杂任务往往需要多个专业 Agent 协同完成。2025-2026 年涌现出多种多 Agent 协作框架和模式。

🎭
CrewAI
基于角色分工的多 Agent 框架,每个 Agent 有明确的角色、目标和工具,模拟团队协作。
角色分工 Python
🕸️
LangGraph
LangChain 团队出品,基于有向图构建 Agent 工作流,支持复杂的状态管理和循环逻辑。
图结构 状态管理
🔄
AutoGen
微软开源的多 Agent 对话框架,支持 Agent 间自动对话、代码执行和人机协作。
微软 对话驱动
💡 架构-任务对齐原则:多 Agent 系统的关键不是选哪个框架,而是让 Agent 架构与任务结构对齐。简单的顺序任务用 Pipeline,需要并行用 Fan-out/Fan-in,复杂决策用 Supervisor 模式。不要为了多 Agent 而多 Agent。

Enterprise AI Platforms
🏢 企业级 AI 平台概览(截至 2026.7.22)

从数字员工到金融合规,企业级 AI 平台正在重塑各行各业的工作流程。

🤖
QoderWake · 阿里
7×24 在岗数字员工
具备独立权限沙盒与审计日志,支持自我复盘与技能进化,承接固定研发与运维流程。百炼平台Token消耗近三个月提升6倍,拉动云AI收入增长。
数字员工 无人值守 技能进化
🏛️
WorkBuddy 企业版 · 腾讯
企业级 AI 资产管理
提供企业级管理后台、统一身份(OneID)与权限管控,支持公有云、VPC 专享及私有化交付。腾讯系四款产品合计流量占桌面端大盘一半以上。
OneID 私有化 权限管控
☁️
阿里云百炼 · 阿里
产业级智能体落地
依托通义千问与阿里云算力,端云协同能力强,支持大规模算力调度与企业级运维体系。私有化市场前三。
端云协同 大规模推理
🐜
蚂蚁数科 Agentar · 蚂蚁集团
金融行业第一 · 13.3% 份额
聚焦强监管行业,主打全链路可信、数据合规、风险可控,具备完善的安全审计与溯源能力。据IDC 2025年报告,金融大模型市场以 13.3% 份额位居第一。
金融第一 合规审计 安全溯源

Vertical AI Agents
🎯 垂直领域专用智能体

从创意设计到知识管理,从 RPA 自动化到行业深耕,垂直智能体正在各细分领域发挥专长。

🎨
腾讯妙境 Miora
全场景创意工作室
不仅有大脑会思考,还有记忆懂用户审美,支持平面、视频与 3D 创意资产生产。从"一句话"直接生成"一套作品"。
创意设计 3D资产 OPC
🧠
ima 知识智能体
月活 1300 万+ · AI知识管理第一
支持创建专属 Agent,通过记忆系统持续理解用户偏好,深度绑定腾讯文档。个人与中小企业知识管理首选。
知识管理 记忆系统
实在 Agent
实在智能 · RPA+AI 赛道头部
不受API限制,能直接操作任何软件界面。在RPA+AI赛道保持高热度,稳居国内政企、制造业智能化赛道头部。
RPA+AI 制造业 跨境电商
💡 选型建议:企业级场景优先关注平台的合规性和私有化能力;垂直场景优先选择专用智能体,它们在特定领域的表现远超通用方案。多 Agent 协作时,可通过 A2A 协议实现跨平台联动。

Practice in Dify
🤖 在 Dify 中创建 Agent

Dify v1.15.0 引入了 Agent Runtime 2.0 和 Skill Editor,让 Agent 构建更强大、更灵活。

⚙️
工具配置
在 Dify 中配置可用的工具,包括内置工具(搜索、知识库查询、代码执行等)和自定义插件。
内置工具 自定义插件
🧠
思考逻辑
配置 Agent 的思考模式,包括是否启用反思、最大迭代次数、总结策略等。
反思机制 迭代控制
📊
执行日志
查看 Agent 的完整执行过程,包括每一步的思考、工具调用和观察结果,便于调试优化。
调试 追踪

LLMOps
🚀 LLMOps 工程化实践

将 AI 应用从原型推向生产环境需要考虑的工程化问题。2026 年 LLMOps 已演进为包含 Agent Runtime、可观测性、安全治理的完整体系。

📦 部署策略

容器化部署:使用 Docker 容器化 AI 应用,便于在不同环境中部署和扩展。


API 网关:通过 API 网关统一管理多个模型服务,实现负载均衡和限流。


Kubernetes 编排:对于大规模部署,使用 Kubernetes 进行容器编排和自动扩缩容。

📈 监控与日志

性能监控:监控 API 响应时间、吞吐量、错误率等关键指标。


成本监控:跟踪 Token 消耗、API 调用次数,控制成本支出。


日志管理:记录所有请求和响应,便于问题排查和审计。

🔒 安全与合规

数据加密:传输和存储数据时进行加密,保护用户隐私。


访问控制:使用 API Key、OAuth 等方式进行身份验证和授权。


内容安全:对输入输出内容进行审核,防止有害内容生成。

🧪 评估与迭代

A/B 测试:对比不同提示词、模型参数的效果,选择最优方案。


评估指标:使用 BLEU、ROUGE、人工评估等方式衡量输出质量。


持续迭代:根据用户反馈和评估结果持续优化模型和系统。


Resources
📚 推荐学习资源