📖 模块1:核心认知篇 — 什么是 AI Agent?
1.1 通俗定义:什么是 AI Agent?
一句话理解
AI Agent(AI 智能体)= 一个能自主完成任务的 AI 程序。它不只是"你问一句、它答一句",而是能自己思考步骤、自己调用工具、自己执行任务,直到目标达成。
类比理解:从「计算器」到「私人助理」
| 类型 | 类比 | 交互方式 | 自主程度 |
| 普通大模型对话(ChatGPT/Claude 聊天) |
像打电话问朋友问题 |
你问一句 → 它答一句 → 你再问 → 它再答 |
⭐ 零自主,完全被动响应 |
| 普通 AI 脚本 |
像按菜谱做菜 |
你写好固定流程 → 它机械执行 |
⭐⭐ 固定流程,无自主判断 |
| AI Agent |
像私人助理 |
你给一个目标 → 它自己想办法、分步骤、用工具、检查结果,直到完成 |
⭐⭐⭐⭐⭐ 高度自主 |
核心区别总结
🔑 三大核心区别
- 自主性:普通对话是被动的(等用户输入),Agent 是主动的(自己规划步骤、自己调用工具、自己检查结果)。
- 工具使用:普通对话只能"说",Agent 能"做"——查文件、跑代码、搜网页、调API。
- 目标导向:普通对话每次一问一答,Agent 是"给我一个目标,我自己想办法完成"。
1.2 核心底层逻辑:AI Agent 的「自主闭环」
大白话拆解:Agent 是怎么"自己做事"的?
想象你让一个助理"帮我调查一下市场上最好的蓝牙耳机":
- 👂 感知(Perception):助理听懂你的需求——"调查蓝牙耳机市场"
- 🧠 思考(Reasoning):助理在脑中拆解——"我需要查评测网站、比价格、看用户评价、整理成报告"
- ✅ 决策(Decision):助理决定——"先打开京东看销量排行,再去知乎看评测,最后汇总"
- 🏃 执行(Action):助理真的去打开网页、复制数据、整理表格
- 👀 观察(Observation):助理检查结果——"知乎的评测不够新,我再搜一下B站"
- 🔄 循环:如果结果不够好,回到第2步,调整策略继续,直到满意
┌─────────────────────────────────────────────────────────┐
│ AI Agent 自主闭环 │
│ │
│ 用户目标: "帮我调查最好的蓝牙耳机" │
│ │ │
│ ▼ │
│ ┌────────┐ ┌────────┐ ┌────────┐ ┌────────┐ │
│ │ 👂 感知 │───▶│ 🧠 思考 │───▶│ ✅ 决策 │───▶│ 🏃 执行 │ │
│ └────────┘ └────────┘ └────────┘ └────────┘ │
│ ▲ │ │
│ │ ┌────────┐ │ │
│ └────────────│ 👀 观察 │◀───────────────────┘ │
│ └────────┘ │
│ │
│ 🔄 循环直到目标达成,或达到最大尝试次数 │
└─────────────────────────────────────────────────────────┘
一个具体例子:Agent 帮你查天气
用户输入:"明天北京天气怎么样?适合户外运动吗?"
感知
Agent 理解:用户想知道 (1) 明天北京天气 (2) 是否适合户外运动。识别出需要调用天气查询工具。
思考
Agent 分析:需要先获取天气数据,再根据温度、降水、风力判断是否适合户外运动。
决策
Agent 决定:调用 get_weather(city="北京", date="明天") 获取天气数据。
执行
Agent 实际调用天气 API,获取到:晴,15-25°C,风力2级。
观察
Agent 检查返回结果:数据完整,可以给出建议。
输出
"明天北京晴天,15-25°C,风力2级,非常适合户外运动!建议做好防晒。"
1.3 基础核心组件(入门必备)
一个 AI Agent 由 5 个核心组件构成。入门阶段只需了解每个组件"是什么、干什么用",不深入实现细节。
| 组件 | 通俗比喻 | 作用 | 入门阶段用到的技术 |
| 🧠 大模型基座 |
Agent 的「大脑」 |
理解输入、推理分析、生成输出 |
Claude API / 开源模型(如 Llama) |
| 📝 记忆模块 |
Agent 的「笔记本」 |
记住对话历史、用户偏好、任务上下文 |
Python 列表/字典、JSON 文件 |
| 🔧 工具调用模块 |
Agent 的「双手」 |
让 Agent 能实际操作:读文件、跑代码、查网页 |
Python 函数、外部 API |
| 📋 规划模块 |
Agent 的「计划能力」 |
把大任务拆成小步骤,决定先做什么后做什么 |
Chain-of-Thought 提示 |
| ⚡ 行动执行模块 |
Agent 的「执行力」 |
真正去执行每一步,处理执行结果 |
Python 执行引擎 |
💡 入门理解要点
这5个组件不是5个独立的"黑盒子",而是紧密协作的一个整体。入门阶段你不需要从零实现每个组件——Claude Code 已经帮你整合好了大部分。你需要做的是理解它们如何协作,然后在实战中逐步深入每个组件。
1.4 Claude Code 做 AI Agent 的核心优势
为什么选 Claude Code?
| 优势 | 详细说明 | 对初学者的好处 |
| 🎯 原生 Agent 支持 |
Claude Code 从底层就是为 Agent 工作流设计的,内置工具调用、多轮对话、任务规划 |
不需要从头搭建 Agent 框架,开箱即用 |
| 🔧 丰富的内置工具 |
文件读写、代码执行、网页搜索、Git 操作等工具直接可用 |
不用自己写工具,专注 Agent 逻辑 |
| 📝 强大的代码能力 |
能写代码、改代码、调试代码,形成"思考→编码→测试→修复"闭环 |
学习过程中 Agent 能帮你写代码 |
| 🔄 多轮自主迭代 |
Agent 可以发现错误、自己修正、重新执行,直到结果正确 |
容错率高,不会一步错就全盘崩溃 |
| 🌐 本地+云端双模式 |
支持本地运行(保护数据隐私)和云端 API(获取更强算力) |
灵活选择,适应不同场景 |
适用场景
- ✅ 最适合:软件开发自动化、代码审查与修复、数据分析与报告生成、文档整理与知识管理、自动化测试
- ⚠️ 适合但需注意:实时性要求极高的应用(如高频交易)、需要大量外部API集成的场景(需要额外开发工具)
- ❌ 不太适合:纯聊天机器人(大材小用)、需要图形界面的桌面应用
📝 知识点总结
| 核心概念 | 一句话总结 |
| AI Agent | 能自主感知、思考、决策、执行的 AI 程序,目标导向而非被动问答 |
| 自主闭环 | 感知→思考→决策→执行→观察→循环,直到目标达成 |
| 5大组件 | 大模型基座(大脑)、记忆模块(笔记本)、工具调用(双手)、规划模块(计划)、行动执行(执行力) |
| Claude Code 优势 | 原生 Agent 支持、丰富内置工具、多轮自主迭代、本地云端双模式 |
❓ 高频问题答疑
Q: AI Agent 和 ChatGPT 的 GPTs 有什么区别?
GPTs 是 ChatGPT 平台上的"定制版对话机器人",本质还是被动问答模式。AI Agent 更强调自主性——它能自己规划步骤、调用工具、循环执行,不需要你一步步引导。可以理解为 GPTs 是"定制客服",Agent 是"自主员工"。
Q: 我不会写复杂代码,能学会 AI Agent 吗?
完全可以!本教程就是从零开始的。第一阶段你只需要基本 Python 知识(变量、函数、if/for),而且 Claude Code 本身能帮你写代码。关键是理解 Agent 的工作原理,代码只是实现手段。
Q: Claude Code 和直接用 Claude API 有什么区别?
Claude Code 是开发工具,内置了 Agent 工作流、工具系统、调试功能,让你在终端里就能开发和管理 Agent。Claude API 是底层接口,你需要自己搭建整个 Agent 框架。对初学者来说,从 Claude Code 开始更友好。
Q: 一个 Agent 能同时处理多个任务吗?
基础 Agent 一次处理一个任务。高阶的多 Agent 协作架构(第四阶段会讲)可以实现任务并行处理。入门阶段先专注单任务 Agent。
✏️ 课后练习
- 概念复述:用自己的话,给一个完全不懂技术的朋友解释什么是 AI Agent(200字以内)。
- 闭环分析:想一个你日常工作中的重复性任务(如整理邮件、汇总数据),画出这个任务的"Agent 闭环图"(感知→思考→决策→执行→观察)。
- 场景思考:列出你生活或工作中 3 个可以用 AI Agent 自动化的场景,思考每个场景需要 Agent 具备哪些能力(记忆?工具?规划?)。
- 环境准备:检查你的电脑是否满足下一模块的环境要求:Python 3.10+、稳定的网络连接、至少 8GB 内存。