4.1 Agent 是什么
场景篇里,你已经能熟练地「问一句、答一句」:让 AI 润色一段、出个大纲、写个公式。但请注意一个细节——每一步都是你在推着它走:你复制粘贴、你打开工具、你把结果搬到下一个环节。这一篇我们进入全新领域:Agent(智能体)——你只下指令,AI 自己拆任务、调工具、干完活,把成品交给你。
本讲你将学到
- Agent 的准确定义:和「聊天机器人」的本质区别是会用工具、自己干活
- Agent 的工作循环:感知 → 规划 → 行动
- 一组好记的类比:Copilot 是副驾驶,Agent 是主驾驶
- 为什么 2026 年是「Agent 之年」:模型能力 + 工具生态两块拼图凑齐了
- 全篇最重要的心法:agent 会翻车(最强模型的任务成功率也只有约三成),所以验收产出是核心技能
前置:2.2 ICIO 四件套(给 agent 下指令本质是写任务书);场景篇不必全通,但建议做过至少一个 playbook。
1. 从「问答」到「委托」
先用一个你熟悉的任务感受差别:期末复习,你想把一门课的课堂录音整理成复习资料。
聊天机器人模式(前四篇的用法):
- 你找一个转写工具,把录音转成文字;
- 复制全文粘给 AI:「帮我总结重点」;
- AI 给出总结,你发现缺少公式部分,再追问一轮;
- 你再把结果复制到笔记软件排版。
每一步都是你在当流水线工人,AI 只是流水线上的一台设备。
Agent 模式(本篇的用法):
「这是我这门课的 4 段课堂录音,转写成文字后,按章节整理出:每章核心概念清单、老师强调过的考点、我该重点复习的三个部分,输出成一份 Markdown 笔记存到桌面。」
Agent 收到指令后会自己:调转写工具处理音频 → 读取转写结果 → 分章节归纳 → 生成文件 → 落盘。你从操作员变成了委托人。
术语卡:Agent(智能体)
Agent = 以大语言模型为大脑,能理解、感知、规划、记忆和使用工具的系统(OpenAI 的口径)。拆开说就是三件事:听得懂任务(理解)、想得出步骤(规划)、动得了手(用工具执行)。前面几篇你用的大多是「对话能力」,本篇解锁的是后两样。
2. Agent 的工作循环:感知 → 规划 → 行动
所有 Agent,无论产品形态多花哨,内核都是同一个循环:
| 环节 | 干什么 | 课堂录音例子 |
|---|---|---|
| 感知(Perceive) | 接收任务与环境信息 | 拿到你的 4 段音频、知道要输出到桌面 |
| 规划(Plan) | 拆解成步骤,决定先后 | 先转写→再分章→再归纳→最后生成文件 |
| 行动(Act) | 调用工具真正执行 | 调转写 API、读文本、写文件 |
关键在循环二字:行动后它会检查结果——转写成功了吗?章节切对了吗?——没达标就修正再来,而不是一口气莽到底。这个「干了→看看→再干」的过程,和人类做事的方式是同构的。
3. Copilot 与 Agent:副驾驶和主驾驶
业界常用一组驾驶类比区分两类 AI 产品:
| Copilot(副驾驶) | Agent(主驾驶) | |
|---|---|---|
| 谁掌握方向盘 | 你:每一步都由你确认、你执行 | AI:你只说目的地,它自己开 |
| 你在做什么 | 写一句、看一眼、贴一下 | 下指令、验收成品 |
| 适合 | 需要精细控制的任务(改论文措辞) | 流程明确的批量任务(整理资料) |
前面几篇教你当好「副驾驶席上的导航员」;本篇教你当好「坐在后排的车主」。车主不用会开车,但必须会验收——这车有没有开到你要的地方,只有你能判断(第 5 节细说)。
4. 为什么是现在:两块拼图凑齐了
「让 AI 替你干活」的想法十年前就有,为什么 2026 年才真正可用?因为两块拼图同时凑齐:
- 模型这块:大模型的能力跨过了「质变点」——能稳定理解复杂指令、长流程拆解不出大错。本站主线小米 MiMo 从 V2 系起就把 Agent/工具调用当作主打方向(还能操作电脑完成 3D 推理、Blender/KiCad 等任务),Kimi K2.5 更是能自主拉起上百个子智能体的集群,智谱、DeepSeek 也都把 Agent 能力列为头等大事——各家都在朝这个方向卷;
- 生态这块:2024 年底出现的 MCP 协议(4.4 讲会讲,先记名字)让 AI 连接外部工具变得像插 USB 一样标准化,工具生态爆发。
结果就是你即将看到的:零代码搭智能体的平台(4.2)、能操作你电脑的桌面 Agent(4.2c)……「多家大厂同时杀入 AI 办公」是 2026 年夏天的真实战况。
5. 预期管理:Agent 会翻车,验收是刚需
泼一盆必要的冷水。滑铁卢大学 TIGER Lab 等机构 2026 年的 ClawBench 测试,让主流 AI agent 完成 14 类真实网站上的日常任务(订票、查资料、填表格……),结果是:最强的模型(Claude Sonnet 4.6)成功率也只有 33.3%——平均每三个任务只能做成一个,其余全在翻车。
翻车的常见姿势
- 编造完成:声称「已成功保存文件」,实际文件不存在或内容是空壳;
- 跳步敷衍:流程走了一半,直接跳到「已完成」;
- 工具幻觉:调用了根本不存在(或没配置)的工具,然后自己脑补了结果。
所以本篇(以及全站)贯穿一条铁律:agent 说「做完了」不算数,你亲手验收才算数。就像你在创造篇预告里会再看到的——「AI 说已完成,你要自己点一点、试一试」。好消息是:验收比干活容易一百倍。文件打开看两眼、链接点进去验一下、数字和原表对一对——这些是任何大学生都具备的能力。
三条红线先记下(后面各讲会反复出现)
- 权限给到最小:agent 要读哪个文件夹就只授权哪个,别把整个硬盘交出去;
- 敏感内容不进 agent:身份证、成绩单、他人隐私,喂给能联网、能执行的工具风险远大于纯对话(详见规范篇 6.2);
- 重要产出必核验:agent 生成的事实、引用、数据,按0.2 讲的反查 SOP 抽查。
跟做练习
实践(约 20 分钟,纯观察,不用装任何东西)
- 找一个你已经接触过的「带 agent 味」的功能:手机语音助手一句话定闹钟、AI 一键生成 PPT、输入法 AI 帮写——都算;
- 用本讲循环框架拆解它:它感知了什么?规划了哪几步?行动时调用了什么工具(联网?读文件?生成文件?);
- 故意给它一个模糊指令(比如「帮我定个闹钟」不说时间),观察它怎么处理缺失信息——是追问你(好 agent),还是自己瞎猜(危险 agent)?
把观察结论写进你的学习笔记——这份「判断力」比任何操作技巧都值钱。
下一步
概念齐了,上手。先去别人家零代码看一眼成品长什么样(注意:那个生态的 AI 脑子是豆包,我们只学平台无关的方法论),再回到主线亲手造你自己的 → 4.2 观摩课:在飞书里看智能体(零代码)
本页核验日期:2026-09-22,2026-09-24 勘误(ClawBench 33.3% 系最强模型 Claude Sonnet 4.6 的任务成功率而非翻车率,原文表述有误,已修正;Agent 定义采用 OpenAI 口径、MiMo V2 系主打 Agent/工具调用均与 docs/01 调研快照一致;「四大厂杀入 AI 办公」为 2026 年夏季公开报道的格局描述)