从“点外卖”说起
你饿了,对一个很能干的助理说一句:“随便点份不辣的午饭,预算 40。”
他自己打开外卖 App、筛选、下单、付钱,最后告诉你“30 分钟后送到”。你只说了目标,没说每一步怎么做。
那它和 ChatGPT 有什么区别?
普通的大模型(LLM)像一个只会动嘴的天才:你问它“怎么点外卖”,它能说得头头是道,但它不会真的去下单。
Agent = 大模型(脑子)+ 一双手(工具)+ 一个循环(能多走几步)。它不只是回答你,它能真的去做。
LLM: 原始 LLM 默认就是问一句答一句、自己不会去执行动作
Agent:你给目标 → 想 → 动手用工具 → 看结果 → 再想 → ……→ 交付拆开看,就三个零件
别把 Agent 想得太玄,它就三块:
脑子 = 大模型,负责想;手 = 工具(一个个函数),负责做;循环 = 让它能根据结果再想再做,直到完成。
自测 · 学完检查一下
想真正动手做题、记进度、攒连胜?到互动课里练。
你对一个智能助理说:“帮我把这周所有未回复的客户邮件都处理好。”下面哪种交代方式,才是在“按 Agent 的方式”用它?
答案:只说这一句目标,不规定它先开哪个邮箱、用什么话术、先回谁
对 Agent 是“交目标、放手让它拆步骤”。后三个都把决策权收回到你手里——第二、四项是你在逐步遥控,第三项是你把步骤写死,它就退化成被你牵着走的工具,没在自己“想步骤”。注意:适当给**约束/边界/护栏**(比如预算、口吻、别动哪些邮件)并不会让它不再是 Agent;区别在于它是否仍**自主决定具体怎么做**。
同样面对“这条退款该不该批”的问题,一个普通大模型(LLM)和一个 Agent,最本质的差别会体现在哪?
答案:Agent 会真的去调订单系统查这笔交易、再据实给出处理,LLM 只能凭你给的文字讲一套该怎么判的道理
本质差别是“会不会真的去取数据、动手执行”,不是聪明/篇幅/联网。Agent 可能用的还是同一个模型当脑子,所以“模型更大才更准”是错的;联网与否是工具的事、跟是不是 Agent 无关;篇幅长短更是无关项。
一个翻译插件,每次只把你选中的网页文字翻一遍就结束,从不根据结果再做下一步。按“脑子+手+循环”来看,它最缺的是 Agent 三零件里的 ___。
答案:循环
它有脑子(模型)、也动了手(改了网页文字),但“翻一遍就结束、不看结果再决定下一步”正是缺了循环——只能一锤子买卖。注意:缺的不是“手”,因为它确实执行了动作。
判断:有个值班脚本,每晚定时跑一次,固定执行“备份数据库 → 清日志 → 发一封完成邮件”,从不看上一步结果、也不会换做法。因为它真的动手干了活,所以它算一个 Agent。
答案:错
“动手”只是必要条件之一。这个脚本步骤写死、不看结果、不会自己决定下一步,缺了“想”和“循环”,本质是定时任务/普通脚本,不是 Agent。能否动手 ≠ 是不是 Agent。
下面四段对“查竞品最新报价”的描述,哪一段才真正是一个 Agent 在工作?
答案:它先打开竞品页面抓到价格,发现页面改版没抓到,于是换了搜索再试,最后把核实到的报价发给你
正确项里它真的去取数据、还根据“没抓到”的结果换了做法再试——脑子+手+循环齐全。写流程文档、整理你已给的文字、给口头提醒,都只在动嘴或加工现成信息,没真去把活干成。
下面这段对智能音箱的指令里,方括号标出了四个部分,只有一个符合“对 Agent 应该交代的东西”,其余都是在替它规定步骤。请填出那一个部分的编号: “[①明早 7 点前让我家暖和到 22 度],[②先开客厅空调],[③再把卧室地暖调到三档],[④十分钟后去关加湿器]。”
答案:①
①是“目标”(要达成的状态),该交给 Agent 的正是它;②③④都是你替它写死的具体操作步骤,本不该由你来定——给目标、不给步骤,步骤是它自己想的。