📖 模块1:核心认知篇 — 什么是 AI Agent?

1.1 通俗定义:什么是 AI Agent?

一句话理解

AI Agent(AI 智能体)= 一个能自主完成任务的 AI 程序。它不只是"你问一句、它答一句",而是能自己思考步骤、自己调用工具、自己执行任务,直到目标达成。

类比理解:从「计算器」到「私人助理」

类型类比交互方式自主程度
普通大模型对话(ChatGPT/Claude 聊天) 像打电话问朋友问题 你问一句 → 它答一句 → 你再问 → 它再答 ⭐ 零自主,完全被动响应
普通 AI 脚本 像按菜谱做菜 你写好固定流程 → 它机械执行 ⭐⭐ 固定流程,无自主判断
AI Agent 像私人助理 你给一个目标 → 它自己想办法、分步骤、用工具、检查结果,直到完成 ⭐⭐⭐⭐⭐ 高度自主

核心区别总结

🔑 三大核心区别
  1. 自主性:普通对话是被动的(等用户输入),Agent 是主动的(自己规划步骤、自己调用工具、自己检查结果)。
  2. 工具使用:普通对话只能"说",Agent 能"做"——查文件、跑代码、搜网页、调API。
  3. 目标导向:普通对话每次一问一答,Agent 是"给我一个目标,我自己想办法完成"。

1.2 核心底层逻辑:AI Agent 的「自主闭环」

大白话拆解:Agent 是怎么"自己做事"的?

想象你让一个助理"帮我调查一下市场上最好的蓝牙耳机":

  1. 👂 感知(Perception):助理听懂你的需求——"调查蓝牙耳机市场"
  2. 🧠 思考(Reasoning):助理在脑中拆解——"我需要查评测网站、比价格、看用户评价、整理成报告"
  3. ✅ 决策(Decision):助理决定——"先打开京东看销量排行,再去知乎看评测,最后汇总"
  4. 🏃 执行(Action):助理真的去打开网页、复制数据、整理表格
  5. 👀 观察(Observation):助理检查结果——"知乎的评测不够新,我再搜一下B站"
  6. 🔄 循环:如果结果不够好,回到第2步,调整策略继续,直到满意
┌─────────────────────────────────────────────────────────┐ │ AI Agent 自主闭环 │ │ │ │ 用户目标: "帮我调查最好的蓝牙耳机" │ │ │ │ │ ▼ │ │ ┌────────┐ ┌────────┐ ┌────────┐ ┌────────┐ │ │ │ 👂 感知 │───▶│ 🧠 思考 │───▶│ ✅ 决策 │───▶│ 🏃 执行 │ │ │ └────────┘ └────────┘ └────────┘ └────────┘ │ │ ▲ │ │ │ │ ┌────────┐ │ │ │ └────────────│ 👀 观察 │◀───────────────────┘ │ │ └────────┘ │ │ │ │ 🔄 循环直到目标达成,或达到最大尝试次数 │ └─────────────────────────────────────────────────────────┘

一个具体例子:Agent 帮你查天气

用户输入:"明天北京天气怎么样?适合户外运动吗?"

感知

Agent 理解:用户想知道 (1) 明天北京天气 (2) 是否适合户外运动。识别出需要调用天气查询工具。

思考

Agent 分析:需要先获取天气数据,再根据温度、降水、风力判断是否适合户外运动。

决策

Agent 决定:调用 get_weather(city="北京", date="明天") 获取天气数据。

执行

Agent 实际调用天气 API,获取到:晴,15-25°C,风力2级。

观察

Agent 检查返回结果:数据完整,可以给出建议。

输出

"明天北京晴天,15-25°C,风力2级,非常适合户外运动!建议做好防晒。"

1.3 基础核心组件(入门必备)

一个 AI Agent 由 5 个核心组件构成。入门阶段只需了解每个组件"是什么、干什么用",不深入实现细节。

组件通俗比喻作用入门阶段用到的技术
🧠 大模型基座 Agent 的「大脑」 理解输入、推理分析、生成输出 Claude API / 开源模型(如 Llama)
📝 记忆模块 Agent 的「笔记本」 记住对话历史、用户偏好、任务上下文 Python 列表/字典、JSON 文件
🔧 工具调用模块 Agent 的「双手」 让 Agent 能实际操作:读文件、跑代码、查网页 Python 函数、外部 API
📋 规划模块 Agent 的「计划能力」 把大任务拆成小步骤,决定先做什么后做什么 Chain-of-Thought 提示
⚡ 行动执行模块 Agent 的「执行力」 真正去执行每一步,处理执行结果 Python 执行引擎
💡 入门理解要点

这5个组件不是5个独立的"黑盒子",而是紧密协作的一个整体。入门阶段你不需要从零实现每个组件——Claude Code 已经帮你整合好了大部分。你需要做的是理解它们如何协作,然后在实战中逐步深入每个组件。

1.4 Claude Code 做 AI Agent 的核心优势

为什么选 Claude Code?

优势详细说明对初学者的好处
🎯 原生 Agent 支持 Claude Code 从底层就是为 Agent 工作流设计的,内置工具调用、多轮对话、任务规划 不需要从头搭建 Agent 框架,开箱即用
🔧 丰富的内置工具 文件读写、代码执行、网页搜索、Git 操作等工具直接可用 不用自己写工具,专注 Agent 逻辑
📝 强大的代码能力 能写代码、改代码、调试代码,形成"思考→编码→测试→修复"闭环 学习过程中 Agent 能帮你写代码
🔄 多轮自主迭代 Agent 可以发现错误、自己修正、重新执行,直到结果正确 容错率高,不会一步错就全盘崩溃
🌐 本地+云端双模式 支持本地运行(保护数据隐私)和云端 API(获取更强算力) 灵活选择,适应不同场景

适用场景

📝 知识点总结

核心概念一句话总结
AI Agent能自主感知、思考、决策、执行的 AI 程序,目标导向而非被动问答
自主闭环感知→思考→决策→执行→观察→循环,直到目标达成
5大组件大模型基座(大脑)、记忆模块(笔记本)、工具调用(双手)、规划模块(计划)、行动执行(执行力)
Claude Code 优势原生 Agent 支持、丰富内置工具、多轮自主迭代、本地云端双模式

❓ 高频问题答疑

Q: AI Agent 和 ChatGPT 的 GPTs 有什么区别?
GPTs 是 ChatGPT 平台上的"定制版对话机器人",本质还是被动问答模式。AI Agent 更强调自主性——它能自己规划步骤、调用工具、循环执行,不需要你一步步引导。可以理解为 GPTs 是"定制客服",Agent 是"自主员工"。
Q: 我不会写复杂代码,能学会 AI Agent 吗?
完全可以!本教程就是从零开始的。第一阶段你只需要基本 Python 知识(变量、函数、if/for),而且 Claude Code 本身能帮你写代码。关键是理解 Agent 的工作原理,代码只是实现手段。
Q: Claude Code 和直接用 Claude API 有什么区别?
Claude Code 是开发工具,内置了 Agent 工作流、工具系统、调试功能,让你在终端里就能开发和管理 Agent。Claude API 是底层接口,你需要自己搭建整个 Agent 框架。对初学者来说,从 Claude Code 开始更友好。
Q: 一个 Agent 能同时处理多个任务吗?
基础 Agent 一次处理一个任务。高阶的多 Agent 协作架构(第四阶段会讲)可以实现任务并行处理。入门阶段先专注单任务 Agent。

✏️ 课后练习

  1. 概念复述:用自己的话,给一个完全不懂技术的朋友解释什么是 AI Agent(200字以内)。
  2. 闭环分析:想一个你日常工作中的重复性任务(如整理邮件、汇总数据),画出这个任务的"Agent 闭环图"(感知→思考→决策→执行→观察)。
  3. 场景思考:列出你生活或工作中 3 个可以用 AI Agent 自动化的场景,思考每个场景需要 Agent 具备哪些能力(记忆?工具?规划?)。
  4. 环境准备:检查你的电脑是否满足下一模块的环境要求:Python 3.10+、稳定的网络连接、至少 8GB 内存。
← 返回阶段首页 下一个模块:环境搭建 →