前置知识预
AI 模型与 Agent:零基础需要知道的概念
入门25-35 分钟第 1 / 11 章
在正式使用 WorkBuddy 之前,花 20 分钟了解 AI 大模型和 Agent 的基本原理。不需要写代码,也不需要技术背景——理解这些概念会让你后续学习事半功倍。
学完本章你能做到
- 理解大语言模型(LLM)的基本工作原理
- 明白 Agent 和普通 AI 对话的本质区别
- 了解工具调用、MCP、Skill 等核心概念
- 知道一次 Agent 任务从头到尾是怎么运行的
开始之前
先理解模型负责什么、Agent 多做了什么,再进入真实任务

先理解
什么是大语言模型(LLM)
大语言模型(Large Language Model,简称 LLM)是一种经过海量文本训练的 AI 系统。你可以把它理解成一个超级强大的"语言函数"——你给它一段文字输入,它根据学到的知识生成一段合理的文字输出。
第一次理解它,只需要记住三件事:
1. 你输入什么:问题、要求和参考资料。
2. 它看到什么:当前问题、前面的对话、系统提供的规则和资料。
3. 它输出什么:根据这些上下文生成的下一段内容。
所以,和 AI 交流不是在按一个"唯一正确答案"按钮。你提供的信息越具体,它越容易生成符合要求的结果;信息缺失时,它也可能误解或补出并不存在的细节。
模型的能力来自三个训练阶段:
1. 预训练:在海量互联网文本上学习语言规律和世界知识,就像一个人读了几百万本书。
2. 后训练:用问答数据、工具调用数据把它训练成一个能听指令的助手,从"博学的人"变成"靠谱的员工"。
3. 偏好优化:通过人类反馈进一步提高回答的准确性和实用性。
训练完成后,模型的工作方式可以用一个公式概括:
输出 = 模型(系统提示词 + 工具列表 + 对话历史 + 其他上下文 + 你的指令)
有两个关键限制需要记住:
• 模型是无状态的:每次对话它不会自动记住上一次的内容,需要系统帮它管理上下文。
• 知识有截止日期:训练之后发生的新事情,模型默认不知道,需要通过搜索或工具来补充。
先理解
什么是 Agent?它和普通 AI 对话有什么不同?
普通 AI 对话(如 ChatGPT、文心一言)的工作模式是:你问一个问题,它给一段回答。第一次交流通常有四步:你说清任务 → AI 结合上下文生成回答 → 你检查回答 → 你继续追问或纠正。这个过程主要发生在对话窗口里,模型本身不会自动去执行真实操作。
Agent(智能体)则完全不同。Agent 不仅能"想",还能"做":
• 普通 AI:你说"帮我查今晚的天气" → 它告诉你方法或猜测一个答案
• Agent:你说"帮我查今晚的天气" → 它调用天气 API 获取实时数据 → 把真实结果告诉你
用一个比喻来说:
• 普通 AI 像一个"只动嘴的顾问"——它可以给你建议和方案,但不会帮你动手。
• Agent 像一个"有手有脚的实习生"——它不仅能理解你的需求,还能调用各种工具帮你完成实际操作。
Agent 的核心循环是:接收指令 → 思考与规划 → 调用工具执行 → 观察执行结果 → 根据结果调整计划 → 再次执行。这个循环会重复进行,直到任务完成、遇到阻塞,或碰到需要你确认的高风险操作。
这里的"思考"可以简单理解为分析目标和选择下一步,并不代表 AI 像人一样拥有意识。真正重要的是:它每执行一步,都应该读取真实结果,再决定下一步,而不是从头到尾只凭猜测。
先理解
工具调用:Agent 如何"动手"
工具调用(Function Call / Tool Call)是 Agent 与外部世界交互的基础能力。
它的工作流程分为五步:
1. 系统提供工具定义:告诉模型有哪些工具可以用,每个工具能做什么、需要什么参数。
2. 模型生成调用请求:模型分析你的需求,决定需要调用哪个工具,并生成结构化的调用参数。
3. 系统验证并执行:Host(WorkBuddy 系统)检查权限、验证参数,然后真正执行这个操作。
4. 返回结果:执行完毕后,把 Tool Result 返回给模型。
5. 模型继续处理:拿到结果后,模型决定是直接回答你,还是继续调用其他工具。
举个例子:你问"帮我看看今晚 A 队的比赛怎么样了"
→ 模型决定调用 get_match_status 工具
→ 系统查询比赛 API 获取实时数据
→ 返回"A 队 2:1 获胜"
→ 模型用自然语言告诉你结果
关键点:模型负责决定"调用什么",系统负责"真正执行"。这种分工让 AI 既智能又安全。
先理解
System Prompt:给 Agent 一个稳定的工作角色
System Prompt(系统提示词)是每次 Agent 启动时最先读到的一段指令,相当于给它一张"入职说明书"。
它定义了几件事:
• 角色与目标:你是谁,你的工作是什么
• 工作原则:做事的基本规矩(比如"先读取现状再修改")
• 安全边界:哪些事绝对不能做
• 交互方式:怎么和用户沟通
• 当前环境:现在在什么工作空间、有什么权限
System Prompt 负责引导行为方向,但它不能替代外部的强制安全边界。就好比公司给新员工一份行为准则手册,但真正涉及敏感操作时,还是需要审批流程和权限系统来把关。
理解这一点很重要:WorkBuddy 之所以能在不同场景下稳定工作,就是因为它有一套精心设计的 System Prompt 来"定义角色",再配合权限校验、审计日志等系统级安全措施来"约束行为"。
先理解
MCP:外部能力的标准化接入协议
MCP(Model Context Protocol,模型上下文协议)是 AI Agent 领域的一个重要标准——它解决的是"外部系统怎么标准化接入 Agent"的问题。
你可以把 MCP 理解成 AI 世界的"USB 接口":
• 没有 USB 之前:每个设备都要专门的连接线,打印机一种、鼠标一种、硬盘又一种。
• 有了 USB 之后:一个接口就能连接各种设备。
MCP 的架构有三个角色:
• Host(主机):承载 Agent 的应用,管理模型、界面和权限。
• Client(客户端):负责发现和连接外部服务。
• Server(服务器):连接具体的业务系统,对外暴露三种能力:
- Resources(只读资源):可以读取的数据
- Tools(可执行动作):可以执行的操作
- Prompts(提示模板):预设的交互模板
在 WorkBuddy 中,MCP 让你可以把腾讯文档、GitHub、知识库等外部系统"插"到 Agent 上,让它能读取和操作这些系统中的数据。
需要注意:MCP 解决的是连接标准化的问题,认证授权、数据安全、网络隔离仍然需要各个系统自己负责。
先理解
Skill 与 Plugin:从单个动作到系统化工作能力
Tool(工具)解决的是"一个动作"的问题——比如"读取一个文件"、"发送一条消息"。但真实工作中的任务往往需要多步骤配合完成。
Skill(技能)解决的是"一类任务怎么做"的问题:
• Tool 像一个螺丝刀:一个入口、一组参数、一次执行。
• Skill 像一条生产线:包含步骤、约束、脚本、失败处理和验收标准。
举个例子:
• Tool:"读取 Excel 文件" → 只负责把数据读出来
• Skill:"分析销售数据并生成月报" → 包含数据读取、清洗、计算、图表生成、报告排版等完整流程
Plugin(插件)则更进一步,解决的是"怎么把一组能力打包分发"的问题。一个 Plugin 可以包含多个 MCP 连接、多个 Skill、配套的规则和模板——就像手机上的 App,安装一个就获得一整套功能。
在 WorkBuddy 中的对应关系:
• 内置 Tool:读文件、执行命令等基础操作,延迟低、权限深
• MCP/连接器:接入腾讯文档、IMA 等外部系统
• Skill:团队沉淀的标准工作流程
• Plugin:连接 + 流程 + 规则 + Hook,一键安装的完整方案
先理解
一次完整的 Agent 任务是怎么运行的
当你在 WorkBuddy 中输入一个任务时,背后会经历这样一个完整的流程:
1. 接收指令:你的任务描述 + 系统提示词 + 可用工具列表 + 对话历史一起送入模型。
2. 思考与决策:模型分析你的需求,决定下一步该做什么。
3. 调用工具:如果需要操作(读文件、搜索、计算等),模型生成工具调用请求。
4. 权限校验:系统检查这个操作是否在允许范围内,高风险操作可能需要你确认。
5. 执行操作:通过内置 Tool、MCP 或其他能力真正执行。
6. 返回结果:执行结果返回给模型,模型决定是继续调用工具还是给出最终回答。
7. 循环迭代:步骤 2-6 可能重复多次,直到模型认为任务完成。
这个循环常被称为 ReAct 模式(Reasoning + Acting):每一步都是"思考—行动—观察—调整"。它不是一次规划后机械执行到底,而是根据每次执行得到的新证据继续行动。
用"整理会议记录"举例:
• 第一次执行:读取会议记录并生成三条待办。
• 第一次观察:发现第二条待办在原文中没有负责人。
• 调整计划:不猜负责人,把这一项标为"待确认"。
• 第二次执行:更新待办清单,再检查数量和原文是否一致。
这就是 Agent 和普通一次性回答最关键的区别:它会用工具获得真实结果,并根据结果进入下一轮。
值得注意的是,随着任务的推进,对话历史会越来越长。这就引入了 Context Engineering(上下文工程)——系统需要智能地管理模型能"看到"什么信息,在有限的窗口内保留最重要的内容。
这就是为什么你在使用 WorkBuddy 时,最好"一次只做一件事"——太复杂的任务会导致上下文膨胀,影响执行质量。
先理解
为什么了解这些概念对你有用?
你不需要成为 AI 专家才能用好 WorkBuddy,但理解上面这些基本概念会帮助你:
1. 写出更好的任务描述:知道模型是"根据输入产生输出",你就会更注重把需求说清楚。
2. 合理拆分任务:知道上下文窗口有限,你就理解了"为什么一次只做一件事"效果更好。
3. 理解执行边界:知道工具调用的机制,你就能判断哪些任务 WorkBuddy 能做、哪些做不了。
4. 高效使用 Skill:知道 Skill 是"标准工作流程",你就会主动去发现和使用适合的 Skill。
5. 善用 MCP 连接器:知道 MCP 是"标准接口",你就能理解为什么连接外部系统后 WorkBuddy 变得更强大。
带着这些认知,我们接下来正式开始学习 WorkBuddy 的使用——从安装第一步开始。
完成第一次 AI 交流,再做概念自测
先用下面这段不含敏感信息的会议速记和 AI 完成一次“提问—回答—检查—追问”,再回答概念题。
- 1发送提示词,观察 AI 是否输出了 3 条待办
- 2检查每条信息能否在原文中找到;不能找到的内容应该标为“待确认”
- 3如果 AI 猜了负责人或日期,继续追问:“请不要猜测,把原文没有的信息改为待确认。”
- 4观察第二次回答如何根据你的反馈调整,这就是最简单的“观察—再执行”
- 5用一句话解释:大语言模型是什么?
- 6普通 AI 对话和 Agent 最大的区别是什么?
- 7指出 Agent 循环中的五个环节,并说出为什么“观察结果”不能省略。
可直接使用的练习模板
请把下面的会议速记整理成 3 条待办。每条包含:任务、负责人、截止时间。原文没有的信息请写“待确认”,不要猜测。
会议速记:
周五前完成课程首页;小林负责检查手机端;下周一复盘数据。验收清单
- 完成了一次提问、检查和追问
- 能说清模型会结合上下文生成回答
- 能说清 Agent 会执行、观察并继续调整
- 知道高风险操作应该停下来等待确认
常见问题
我完全不懂技术,这些概念会不会太难?
不会。这些概念都用类比方式解释,不涉及任何代码或数学公式。理解这些就像了解手机的基本功能——你不需要知道芯片怎么工作,只需要知道"点这里可以拍照、点那里可以发消息"。
我直接跳过这章,直接学 WorkBuddy 操作可以吗?
可以,但建议至少浏览一遍。后续章节会多次提到"上下文""工具调用""Skill"等概念,提前了解会让你学得更轻松,也能更好地理解 WorkBuddy 的各种行为。
Agent 是不是就是更高级的 ChatGPT?
Agent 的核心区别不在于"更高级",而在于"能动手"。ChatGPT 更像一个只能对话的顾问,Agent 则是一个可以使用各种工具完成实际任务的助手。WorkBuddy 就是一个典型的 Agent 产品。
学完后记得保存进度
完成状态只保存在当前浏览器,不会上传你的学习记录。











