WorkBuddy 从 0 到 1
1 / 11
前置知识

AI 模型与 Agent:零基础需要知道的概念

入门25-35 分钟1 / 11

在正式使用 WorkBuddy 之前,花 20 分钟了解 AI 大模型和 Agent 的基本原理。不需要写代码,也不需要技术背景——理解这些概念会让你后续学习事半功倍。

学完本章你能做到

  • 理解大语言模型(LLM)的基本工作原理
  • 明白 Agent 和普通 AI 对话的本质区别
  • 了解工具调用、MCP、Skill 等核心概念
  • 知道一次 Agent 任务从头到尾是怎么运行的

开始之前

先理解模型负责什么、Agent 多做了什么,再进入真实任务

从对话模型到可执行任务的 Agent 教学示意图
先理解,再行动,最后用真实结果验证

先理解

什么是大语言模型(LLM)

大语言模型(Large Language Model,简称 LLM)是一种经过海量文本训练的 AI 系统。你可以把它理解成一个超级强大的"语言函数"——你给它一段文字输入,它根据学到的知识生成一段合理的文字输出。 第一次理解它,只需要记住三件事: 1. 你输入什么:问题、要求和参考资料。 2. 它看到什么:当前问题、前面的对话、系统提供的规则和资料。 3. 它输出什么:根据这些上下文生成的下一段内容。 所以,和 AI 交流不是在按一个"唯一正确答案"按钮。你提供的信息越具体,它越容易生成符合要求的结果;信息缺失时,它也可能误解或补出并不存在的细节。 模型的能力来自三个训练阶段: 1. 预训练:在海量互联网文本上学习语言规律和世界知识,就像一个人读了几百万本书。 2. 后训练:用问答数据、工具调用数据把它训练成一个能听指令的助手,从"博学的人"变成"靠谱的员工"。 3. 偏好优化:通过人类反馈进一步提高回答的准确性和实用性。 训练完成后,模型的工作方式可以用一个公式概括: 输出 = 模型(系统提示词 + 工具列表 + 对话历史 + 其他上下文 + 你的指令) 有两个关键限制需要记住: • 模型是无状态的:每次对话它不会自动记住上一次的内容,需要系统帮它管理上下文。 • 知识有截止日期:训练之后发生的新事情,模型默认不知道,需要通过搜索或工具来补充。
问题、对话历史和参考资料一起进入 AI 模型并生成回答的示意图
AI 模型不是凭空回答:它会结合你的问题、对话历史和参考资料生成下一段内容

先理解

什么是 Agent?它和普通 AI 对话有什么不同?

普通 AI 对话(如 ChatGPT、文心一言)的工作模式是:你问一个问题,它给一段回答。第一次交流通常有四步:你说清任务 → AI 结合上下文生成回答 → 你检查回答 → 你继续追问或纠正。这个过程主要发生在对话窗口里,模型本身不会自动去执行真实操作。 Agent(智能体)则完全不同。Agent 不仅能"想",还能"做": • 普通 AI:你说"帮我查今晚的天气" → 它告诉你方法或猜测一个答案 • Agent:你说"帮我查今晚的天气" → 它调用天气 API 获取实时数据 → 把真实结果告诉你 用一个比喻来说: • 普通 AI 像一个"只动嘴的顾问"——它可以给你建议和方案,但不会帮你动手。 • Agent 像一个"有手有脚的实习生"——它不仅能理解你的需求,还能调用各种工具帮你完成实际操作。 Agent 的核心循环是:接收指令 → 思考与规划 → 调用工具执行 → 观察执行结果 → 根据结果调整计划 → 再次执行。这个循环会重复进行,直到任务完成、遇到阻塞,或碰到需要你确认的高风险操作。 这里的"思考"可以简单理解为分析目标和选择下一步,并不代表 AI 像人一样拥有意识。真正重要的是:它每执行一步,都应该读取真实结果,再决定下一步,而不是从头到尾只凭猜测。
零基础用户与 AI 完成第一次交流的四个步骤
第一次交流:说清任务,等待回答,检查结果,再用追问纠正缺失信息

先理解

工具调用:Agent 如何"动手"

工具调用(Function Call / Tool Call)是 Agent 与外部世界交互的基础能力。 它的工作流程分为五步: 1. 系统提供工具定义:告诉模型有哪些工具可以用,每个工具能做什么、需要什么参数。 2. 模型生成调用请求:模型分析你的需求,决定需要调用哪个工具,并生成结构化的调用参数。 3. 系统验证并执行:Host(WorkBuddy 系统)检查权限、验证参数,然后真正执行这个操作。 4. 返回结果:执行完毕后,把 Tool Result 返回给模型。 5. 模型继续处理:拿到结果后,模型决定是直接回答你,还是继续调用其他工具。 举个例子:你问"帮我看看今晚 A 队的比赛怎么样了" → 模型决定调用 get_match_status 工具 → 系统查询比赛 API 获取实时数据 → 返回"A 队 2:1 获胜" → 模型用自然语言告诉你结果 关键点:模型负责决定"调用什么",系统负责"真正执行"。这种分工让 AI 既智能又安全。
工具调用流程:模型与外部系统之间的结构化协议
工具调用的五步流程:从定义到执行再到返回
工具调用实际案例:查询比赛结果
实际案例:一次完整的工具调用往返过程

先理解

System Prompt:给 Agent 一个稳定的工作角色

System Prompt(系统提示词)是每次 Agent 启动时最先读到的一段指令,相当于给它一张"入职说明书"。 它定义了几件事: • 角色与目标:你是谁,你的工作是什么 • 工作原则:做事的基本规矩(比如"先读取现状再修改") • 安全边界:哪些事绝对不能做 • 交互方式:怎么和用户沟通 • 当前环境:现在在什么工作空间、有什么权限 System Prompt 负责引导行为方向,但它不能替代外部的强制安全边界。就好比公司给新员工一份行为准则手册,但真正涉及敏感操作时,还是需要审批流程和权限系统来把关。 理解这一点很重要:WorkBuddy 之所以能在不同场景下稳定工作,就是因为它有一套精心设计的 System Prompt 来"定义角色",再配合权限校验、审计日志等系统级安全措施来"约束行为"。
System Prompt 结构与安全边界示意图
System Prompt 负责引导行为,外部系统负责强制约束

先理解

MCP:外部能力的标准化接入协议

MCP(Model Context Protocol,模型上下文协议)是 AI Agent 领域的一个重要标准——它解决的是"外部系统怎么标准化接入 Agent"的问题。 你可以把 MCP 理解成 AI 世界的"USB 接口": • 没有 USB 之前:每个设备都要专门的连接线,打印机一种、鼠标一种、硬盘又一种。 • 有了 USB 之后:一个接口就能连接各种设备。 MCP 的架构有三个角色: • Host(主机):承载 Agent 的应用,管理模型、界面和权限。 • Client(客户端):负责发现和连接外部服务。 • Server(服务器):连接具体的业务系统,对外暴露三种能力: - Resources(只读资源):可以读取的数据 - Tools(可执行动作):可以执行的操作 - Prompts(提示模板):预设的交互模板 在 WorkBuddy 中,MCP 让你可以把腾讯文档、GitHub、知识库等外部系统"插"到 Agent 上,让它能读取和操作这些系统中的数据。 需要注意:MCP 解决的是连接标准化的问题,认证授权、数据安全、网络隔离仍然需要各个系统自己负责。
MCP 架构:Host、Client、Server 三层结构
MCP 统一连接协议,让 Agent 可以标准化接入各种外部系统

先理解

Skill 与 Plugin:从单个动作到系统化工作能力

Tool(工具)解决的是"一个动作"的问题——比如"读取一个文件"、"发送一条消息"。但真实工作中的任务往往需要多步骤配合完成。 Skill(技能)解决的是"一类任务怎么做"的问题: • Tool 像一个螺丝刀:一个入口、一组参数、一次执行。 • Skill 像一条生产线:包含步骤、约束、脚本、失败处理和验收标准。 举个例子: • Tool:"读取 Excel 文件" → 只负责把数据读出来 • Skill:"分析销售数据并生成月报" → 包含数据读取、清洗、计算、图表生成、报告排版等完整流程 Plugin(插件)则更进一步,解决的是"怎么把一组能力打包分发"的问题。一个 Plugin 可以包含多个 MCP 连接、多个 Skill、配套的规则和模板——就像手机上的 App,安装一个就获得一整套功能。 在 WorkBuddy 中的对应关系: • 内置 Tool:读文件、执行命令等基础操作,延迟低、权限深 • MCP/连接器:接入腾讯文档、IMA 等外部系统 • Skill:团队沉淀的标准工作流程 • Plugin:连接 + 流程 + 规则 + Hook,一键安装的完整方案
Tool vs Skill:一个动作 vs 一类任务的做法
Tool 定义单个动作,Skill 定义完整的任务执行方案
WorkBuddy 的四种外接能力形态
内置 Tool、MCP、Skill、Plugin 四种能力形态各有优势

先理解

一次完整的 Agent 任务是怎么运行的

当你在 WorkBuddy 中输入一个任务时,背后会经历这样一个完整的流程: 1. 接收指令:你的任务描述 + 系统提示词 + 可用工具列表 + 对话历史一起送入模型。 2. 思考与决策:模型分析你的需求,决定下一步该做什么。 3. 调用工具:如果需要操作(读文件、搜索、计算等),模型生成工具调用请求。 4. 权限校验:系统检查这个操作是否在允许范围内,高风险操作可能需要你确认。 5. 执行操作:通过内置 Tool、MCP 或其他能力真正执行。 6. 返回结果:执行结果返回给模型,模型决定是继续调用工具还是给出最终回答。 7. 循环迭代:步骤 2-6 可能重复多次,直到模型认为任务完成。 这个循环常被称为 ReAct 模式(Reasoning + Acting):每一步都是"思考—行动—观察—调整"。它不是一次规划后机械执行到底,而是根据每次执行得到的新证据继续行动。 用"整理会议记录"举例: • 第一次执行:读取会议记录并生成三条待办。 • 第一次观察:发现第二条待办在原文中没有负责人。 • 调整计划:不猜负责人,把这一项标为"待确认"。 • 第二次执行:更新待办清单,再检查数量和原文是否一致。 这就是 Agent 和普通一次性回答最关键的区别:它会用工具获得真实结果,并根据结果进入下一轮。 值得注意的是,随着任务的推进,对话历史会越来越长。这就引入了 Context Engineering(上下文工程)——系统需要智能地管理模型能"看到"什么信息,在有限的窗口内保留最重要的内容。 这就是为什么你在使用 WorkBuddy 时,最好"一次只做一件事"——太复杂的任务会导致上下文膨胀,影响执行质量。
Agent 接收指令、思考规划、执行、观察和调整的循环
Agent 不是只回答一次,而是在执行、观察和调整之间循环,直到达到目标
Agent 整理会议记录时发现缺失信息并调整结果的案例
具体案例:先读文件、生成待办、发现缺信息,再标记待确认并继续检查
完整的 Agent 任务执行全景视图
一次完整的 Agent 任务:从检查环境到加载 Skill 到分配执行
对话历史随轮次增长的上下文挑战
每多一轮对话,上下文窗口就消耗更多——这就是为什么要"小步快跑"

先理解

为什么了解这些概念对你有用?

你不需要成为 AI 专家才能用好 WorkBuddy,但理解上面这些基本概念会帮助你: 1. 写出更好的任务描述:知道模型是"根据输入产生输出",你就会更注重把需求说清楚。 2. 合理拆分任务:知道上下文窗口有限,你就理解了"为什么一次只做一件事"效果更好。 3. 理解执行边界:知道工具调用的机制,你就能判断哪些任务 WorkBuddy 能做、哪些做不了。 4. 高效使用 Skill:知道 Skill 是"标准工作流程",你就会主动去发现和使用适合的 Skill。 5. 善用 MCP 连接器:知道 MCP 是"标准接口",你就能理解为什么连接外部系统后 WorkBuddy 变得更强大。 带着这些认知,我们接下来正式开始学习 WorkBuddy 的使用——从安装第一步开始。

完成第一次 AI 交流,再做概念自测

先用下面这段不含敏感信息的会议速记和 AI 完成一次“提问—回答—检查—追问”,再回答概念题。

  1. 1发送提示词,观察 AI 是否输出了 3 条待办
  2. 2检查每条信息能否在原文中找到;不能找到的内容应该标为“待确认”
  3. 3如果 AI 猜了负责人或日期,继续追问:“请不要猜测,把原文没有的信息改为待确认。”
  4. 4观察第二次回答如何根据你的反馈调整,这就是最简单的“观察—再执行”
  5. 5用一句话解释:大语言模型是什么?
  6. 6普通 AI 对话和 Agent 最大的区别是什么?
  7. 7指出 Agent 循环中的五个环节,并说出为什么“观察结果”不能省略。
可直接使用的练习模板
请把下面的会议速记整理成 3 条待办。每条包含:任务、负责人、截止时间。原文没有的信息请写“待确认”,不要猜测。

会议速记:
周五前完成课程首页;小林负责检查手机端;下周一复盘数据。

验收清单

  • 完成了一次提问、检查和追问
  • 能说清模型会结合上下文生成回答
  • 能说清 Agent 会执行、观察并继续调整
  • 知道高风险操作应该停下来等待确认

常见问题

我完全不懂技术,这些概念会不会太难?

不会。这些概念都用类比方式解释,不涉及任何代码或数学公式。理解这些就像了解手机的基本功能——你不需要知道芯片怎么工作,只需要知道"点这里可以拍照、点那里可以发消息"。

我直接跳过这章,直接学 WorkBuddy 操作可以吗?

可以,但建议至少浏览一遍。后续章节会多次提到"上下文""工具调用""Skill"等概念,提前了解会让你学得更轻松,也能更好地理解 WorkBuddy 的各种行为。

Agent 是不是就是更高级的 ChatGPT?

Agent 的核心区别不在于"更高级",而在于"能动手"。ChatGPT 更像一个只能对话的顾问,Agent 则是一个可以使用各种工具完成实际任务的助手。WorkBuddy 就是一个典型的 Agent 产品。

学完后记得保存进度

完成状态只保存在当前浏览器,不会上传你的学习记录。