很多人第一次接触 AI Agent 时,会从一个问题开始:
我已经会调用大语言模型了,下一步怎样让它真正完成任务?
答案通常不是再换一个模型,而是学习如何给模型接入工具、组织上下文、保存记忆、拆分角色,并把整个系统部署、观测和保护起来。
来自微软在 GitHub 上开源的新手学习 AI Agent 学习课程:Microsoft AI Agents for Beginners,正是围绕这个问题设计的一套开源课程。项目的定位很明确:用 18 个主题课程,带读者从 Agent 基础一路走到工具调用、RAG、多智能体、生产部署、本地 Agent 和安全审计。
截至本文撰写时,仓库采用 MIT License,提供 Python 示例、课程 README、视频和额外学习资料,并支持包括简体中文在内的大量语言翻译。课程主线使用 Microsoft Agent Framework 与 Microsoft Foundry Agent Service,同时部分示例支持其他 OpenAI-compatible 模型服务。
你将学到什么
读完并动手完成这套课程后,你不只是“知道 Agent 是什么”,而是可以建立一套比较完整的工程视角:
- 理解 Agent 与普通 LLM 应用的区别;
- 认识常见的 Agent 设计模式;
- 让 Agent 调用外部工具并处理工具结果;
- 使用 Agentic RAG 访问外部知识;
- 设计规划、反思、多智能体协作和记忆机制;
- 理解 MCP、A2A、NLWeb 等 Agent 协议;
- 评估 Agent 的质量、成本、延迟和可观测性;
- 使用 Microsoft Agent Framework 构建更完整的应用;
- 了解浏览器操作、本地模型、云端部署和安全审计。
换句话说,这套课程覆盖的不只是“如何写一个聊天机器人”,而是一个 Agent 系统从概念、实现到运行的完整生命周期。
先理解:Agent 到底多了什么
普通的 LLM 应用通常是:
用户问题 → 模型 → 文本答案Agent 则更像一个可以循环工作的任务系统:
用户目标 ↓理解任务与当前状态 ↓制定下一步行动 ↓调用工具或访问外部信息 ↓读取结果并继续判断 ↓输出结果,或进入下一轮行动Agent 并不是“模型变聪明了”这么简单。它通常增加了几类能力:
行动能力
:通过工具调用 API、搜索资料、读写文件或执行操作;
状态能力
:记住当前任务、历史交互和中间结果;
规划能力
:把复杂目标拆成多个步骤;
协作能力
:让多个不同角色的 Agent 共同完成任务;
反馈能力
:根据工具结果或评估结果调整下一步行动。
这也是为什么学习 Agent 不能只停留在 Prompt 层面。Prompt 是入口,但不是完整系统。
一张图看懂课程路线
这 18 节课程大致可以分成五个阶段:
| 阶段 | 课程范围 | 主要问题 |
|---|---|---|
| 基础认知 | 01—03 | Agent 是什么,框架和设计模式如何工作? |
| 核心能力 | 04—09 | 如何调用工具、检索知识、规划、协作和反思? |
| 工程化 | 10—14 | 如何评估、通信、管理上下文和记忆? |
| 应用与部署 | 15—17 | 如何操作浏览器、部署云端 Agent、运行本地 Agent? |
| 安全与可信 | 18 | 如何验证 Agent 做过什么,并发现记录是否被篡改? |
下面逐节介绍。
第一阶段:从概念到设计模式
00|Course Setup:先把环境准备好
这不是正式的 Agent 理论课,但很重要。
课程示例主要使用 Python,代码集中在每个课程目录的code_samples中。官方 README 建议先 Fork 仓库,再配置 Microsoft Foundry 和相关服务。部分示例也支持 OpenAI-compatible provider,因此不一定所有实验都只能使用同一个模型供应商,但具体能力取决于各课的配置说明。
这一节主要解决三个问题:
- 如何获取代码并安装依赖;
- 如何配置环境变量和模型服务;
- 如何运行课程中的 Python 示例。
建议不要跳过环境配置。Agent 教程最常见的挫败感,不是概念太难,而是 API Key、模型名、依赖版本和权限没有配置正确。
01|Introduction to AI Agents and Agent Use Cases
第一课回答最基本的问题:Agent 和普通的生成式 AI 应用有什么区别?
课程会从 Agent 的定义、典型应用场景和基本组成讲起。重点不是给出一个唯一标准,而是帮助你建立判断:一个系统什么时候只是“调用模型”,什么时候已经具备了感知、决策和行动的闭环。
适合在这一节形成三个认识:
- Agent 的核心不在于“像人一样聊天”,而在于完成目标;
- 模型是推理核心,但工具、状态和执行循环同样重要;
- Agent 的能力和风险,来自模型与外部系统的组合。
02|Explore AI Agent Frameworks
当你理解 Agent 的基本组成后,第二课进一步介绍 Agent 框架。
框架通常会替你处理消息管理、工具注册、调用循环、状态维护和错误处理。使用框架的好处是开发速度更快,但代价是你可能看不清系统内部发生了什么。
学习这一课时,建议不要只记住框架名称,而要比较:
- 框架如何表示 Agent;
- 工具如何注册和调用;
- 多轮状态保存在哪里;
- 是否支持工作流、记忆和评估;
- 发生错误时如何调试。
框架是轮子,不是原理本身。先理解抽象,再选择工具,会比直接跟着示例复制更稳。
03|AI Agentic Design Principles
第三课进入设计模式。
设计模式可以理解为一组反复出现的解决方案。例如,一个 Agent 如何在“思考”和“行动”之间循环,如何将任务交给工具,如何在执行失败后重试,如何把大任务拆成更小的子任务。
这一课的重要价值在于:它把 Agent 从一个模糊概念,变成可以讨论和比较的结构。
你会开始关注:
- Agent 的循环什么时候结束;
- 模型的每一步决策依据什么上下文;
- 工具返回异常时系统如何处理;
- 怎样限制 Agent 的行动范围和成本。
第二阶段:让 Agent 能够行动和解决问题
04|Tool Use Design Pattern
工具调用是 Agent 与普通聊天应用之间最直观的分界线之一。
模型本身不能直接查询天气、修改数据库或发送邮件。它只能根据工具描述生成一个结构化调用请求,再由外部程序真正执行工具,并把结果返回给模型。
因此,一个完整的工具调用链通常是:
用户目标 → 模型选择工具 → 生成参数 → 程序执行 → 返回结果 → 模型继续处理这一课需要重点理解参数 schema、工具权限、调用失败和结果验证。工具越强,Agent 的行动范围越大,系统越需要边界。
05|Agentic RAG
RAG,即 Retrieval-Augmented Generation,中文通常译为“检索增强生成”。它先从外部知识库检索相关内容,再把内容交给模型生成回答。
Agentic RAG 的区别在于:检索不再是一个固定步骤,而可以由 Agent 根据任务动态决定。例如,它可以判断是否需要搜索、搜索什么、是否需要再次检索,以及多个检索结果如何组合。
这一课的学习重点包括:
- 为什么模型需要外部知识;
- 检索器、知识库和生成模型如何配合;
- 什么时候一次检索不够;
- 如何减少无关内容和错误引用;
- 怎样评估答案的相关性与事实性。
RAG 不是“接一个向量数据库”就结束了。真正困难的是检索策略和上下文组织。
06|Building Trustworthy AI Agents
当 Agent 可以调用工具后,可信问题会立即出现:它是否会误用工具?是否会泄露数据?是否能解释自己做过什么?
这一课把注意力从“能不能运行”转向“能不能放心运行”。可信 Agent 通常需要考虑:
- 权限和身份;
- 输入验证与输出验证;
- 人类确认节点;
- 敏感数据保护;
- 错误处理和可追踪日志。
需要特别注意:安全不是 Agent 最后才增加的一个模块,而应该参与架构设计。
07|Planning Design
面对复杂任务,直接让模型一步完成,往往会导致目标遗漏、步骤混乱或无法恢复。
Planning 模式让 Agent 先制定计划,再逐步执行。计划可以是简单的任务列表,也可以包含依赖关系、工具选择和验收标准。
这节内容需要思考两个平衡:
- 计划太简单,无法处理复杂任务;
- 计划太详细,容易过时,也会增加 token 成本。
实用的计划系统通常允许在执行过程中重新规划,而不是把最初计划当成不可改变的脚本。
08|Multi-agent Design Patterns
多智能体系统不是“多开几个聊天窗口”。它要求你明确每个 Agent 的职责、输入、输出和协作方式。
常见模式包括:
- 一个主 Agent 负责分派任务;
- 不同 Agent 分别负责检索、规划、执行或审查;
- 多个 Agent 并行处理,再由汇总 Agent 整合;
- 一个 Agent 生成结果,另一个 Agent 进行检查。
多智能体的收益是专业化和并行化,但代价是通信复杂度、延迟和成本都会上升。不是所有任务都值得拆成多个 Agent。
09|Metacognition in AI Agents
Metacognition 可以理解为“对自身思考过程的反思”。在 Agent 系统中,它通常表现为:检查当前答案、评估执行过程、发现错误并调整策略。
这一课涉及透明性、推理质量、适应能力和环境感知等问题。工程上不应简单要求模型暴露完整的内部思维过程,而更适合设计可验证的中间产物,例如计划、工具调用记录、检查结果和最终依据。
反思的目标不是让 Agent 写更长的解释,而是让系统有机会发现错误。
第三阶段:从 Demo 走向工程系统
10|AI Agents in Production:Observability & Evaluation
一个 Demo 能跑,并不意味着它可以上线。
生产环境需要回答:
- Agent 的成功率是多少?
- 哪一步最容易失败?
- 一次任务消耗了多少 token 和时间?
- 用户反馈变差时,如何定位原因?
- 新版本是否真的优于旧版本?
这一课介绍 traces、spans、评估指标、成本控制和性能优化。可以把它看成 Agent 的“体检系统”:没有观测和评估,你只能凭感觉判断系统好不好。
11|Using Agentic Protocols:MCP、A2A 和 NLWeb
协议解决的是“不同系统如何沟通”。课程介绍三类 Agent 相关协议:
MCP
:让模型或 Agent 以统一方式连接工具、资源和提示;
A2A
:让不同 Agent 之间协作;
NLWeb
:探索使用自然语言访问网页内容和能力的方式。
协议的价值在于减少集成成本。一个工具如果只能被某个特定框架调用,复用范围有限;如果遵循通用协议,它就更容易接入不同 Agent。
但协议不能自动解决权限、质量和安全问题。标准化连接之后,访问控制反而更重要。
12|Context Engineering for AI Agents
Prompt Engineering 关注“如何写好一段提示词”;Context Engineering 关注“如何为当前任务组织完整上下文”。后者的范围更大,包括:
- 当前任务与目标;
- 历史对话;
- 工具说明;
- 检索内容;
- 用户偏好;
- 当前状态和中间结果。
一个 Agent 即使模型能力很强,如果上下文混乱,也可能无法完成任务。上下文工程的核心是筛选、排序、压缩和更新信息,而不是把所有内容都塞给模型。
13|Memory for AI Agents
记忆是 Agent 从“一次性执行器”变成“长期协作者”的关键能力之一。
课程会讨论不同类型的记忆,例如工作记忆、短期状态和长期记忆。不同记忆承担不同任务:工作记忆帮助完成当前步骤,长期记忆帮助系统保留跨会话信息。
设计记忆时需要回答:
- 什么信息值得保存?
- 保存多久?
- 谁可以读取?
- 如何修改和删除?
- 过期信息如何处理?
记忆越多不一定越好。错误或过时的记忆,可能比没有记忆更危险。
14|Exploring Microsoft Agent Framework
这一课回到 Microsoft Agent Framework,帮助读者把前面的概念落到一个具体框架中。
学习重点包括 Agent 的核心对象、工作流、工具、Middleware 和 Memory 等能力。建议在完成前面的设计模式后再学习这一课,这样你看到的不只是 API,而是 API 背后的系统设计。
可采用这样的学习顺序:
- 先运行最小 Agent;
- 加入一个工具;
- 增加工作流或状态;
- 加入记忆和中间件;
- 对执行过程进行观测和评估。
第四阶段:应用、部署和本地运行
15|Building Computer Use Agents
Computer Use Agent,简称 CUA,可以通过视觉和操作能力使用浏览器或电脑界面。
它适合处理没有稳定 API、页面动态变化或需要模拟用户操作的场景。课程结合 Browser-Use、Playwright、CDP、视觉模型和结构化输出,讨论如何从网页中提取信息,以及如何选择 Agent-first、actor-first 或混合式自动化方案。
浏览器 Agent 的难点不在“点击按钮”,而在页面变化、权限、验证码、误操作和结果验证。涉及真实账号、订单或重要数据时,必须保留人工确认和最小权限。
16|Deploying Scalable Agents with Microsoft Foundry
从原型到生产,模型调用只是其中一部分。部署后的 Agent 还需要考虑版本、并发、缓存、路由、观测、成本和生命周期管理。
这一课讨论:
- 客户端托管与服务端托管;
- Hosted Agents 和工作流编排;
- Agent 的创建、版本、部署、评估和退役;
- OpenTelemetry 与 Foundry tracing;
- 模型路由、缓存、并发和无状态设计。
一个重要判断是:生产 Agent 的复杂度,往往更多来自模型之外的工程系统。
17|Creating Local AI Agents Using Microsoft Foundry Local and Qwen
并非所有 Agent 都适合把数据发送到云端。本地 Agent 关注隐私、成本和离线能力。
课程介绍 Small Language Models、Microsoft Foundry Local 和支持 function calling 的 Qwen 模型。通过 OpenAI-compatible API,本地模型也可以接入工具调用流程。
本地模型通常在能力、速度、硬件占用和部署成本之间做取舍。它适合隐私敏感、离线运行或需要大量迭代的场景,但不应默认认为本地模型在所有任务上都能替代云端大模型。
第五阶段:让 Agent 的行为可验证
18|Securing AI Agents with Cryptographic Receipts
最后一课很有特点:它不再只讨论“Agent 如何完成任务”,而是讨论如何证明 Agent 做过什么。
课程介绍 cryptographic receipt,即加密收据。它可以为 Agent 的工具调用生成带签名的记录,并在离线环境中验证记录是否被篡改。多个收据还可以串联起来:如果有人删除或调整其中一条记录,链条就会断裂。
需要明确的是,加密收据可以证明记录在生成后是否被修改,但它不能自动证明 Agent 的决策是正确的,也不能替代完整的安全审计。
这正好说明一个现实问题:可信 Agent 不只是“有日志”,还要让日志可验证、可追溯、可解释。
如何开始学习
第一步:先跑通环境
建议使用 sparse checkout,排除体积较大的翻译目录:
git clone --filter=blob:none --sparse https://github.com/microsoft/ai-agents-for-beginners.gitcd ai-agents-for-beginnersgit sparse-checkout set --no-cone '/*' '!translations' '!translated_images'然后进入00-course-setup,按照课程说明配置 Python 环境、环境变量和模型服务。
第二步:按顺序完成 01—05
前五课建立 Agent 的基本心智模型。不要只看 README,至少运行一个可以调用工具或检索内容的示例。
第三步:选择一个方向深入
- 想做工作流:重点看 Planning、Tool Use 和 Agent Framework;
- 想做知识库问答:重点看 Agentic RAG、Context Engineering 和 Memory;
- 想做自动化:重点看 Browser Use、Protocols 和 Deployment;
- 想做企业应用:重点看 Trustworthy Agents、Observability、Evaluation 和 Security;
- 想做隐私场景:重点看 Local AI Agents。
第四步:做一个小项目
不要一开始就做“万能 Agent”。可以选择一个边界清楚的项目,例如:
- 能检索个人 Markdown 笔记并给出带引用的回答;
- 能读取一个网页并提取结构化信息;
- 能把用户目标拆成计划,再调用两个工具完成任务;
- 能由一个执行 Agent 和一个审查 Agent 协作完成报告。
项目完成后,再加入评估、日志、记忆和权限控制。
这套课程适合谁
它适合已经会一点 Python,并且知道如何通过 API 调用大语言模型的人。对于完全没有编程经验的读者,建议先学习基础 Python、HTTP 请求、JSON、环境变量和异步编程。
它不太适合只想找一个现成聊天机器人模板的人。因为课程真正关注的是构建能力:理解 Agent 如何工作,如何组合组件,如何处理失败,以及如何把系统运行起来。
常见问题
一定要使用 Microsoft Foundry 吗?
官方课程示例主要围绕 Microsoft Agent Framework 和 Microsoft Foundry Agent Service 展开,因此完整复现时通常需要相应 Azure 账号和配置。部分示例支持其他 OpenAI-compatible provider,但替换模型后,工具调用、结构化输出和上下文长度仍需自行验证。
18 节课需要全部按顺序学习吗?
建议前 1—5 节按顺序学习,因为它们建立基本概念。之后可以根据目标选择路线,但生产、部署和安全内容最好在掌握基础 Agent 循环之后再看。
这是一套框架教程,还是 Agent 原理教程?
两者都有。它通过 Microsoft 技术栈提供可运行示例,同时覆盖设计模式、协议、上下文、记忆、评估和安全。因此学习时不要只把它当作某个 SDK 的 API 文档。
学完后能直接做出生产级 Agent 吗?
不能简单这样承诺。课程覆盖了生产所需的重要概念,但真正上线还需要结合数据权限、业务流程、模型选择、监控、成本、合规和安全要求进行工程验证。
小结
AI Agents for Beginners 的价值,不只是课程数量多,而是它把 Agent 学习拆成了一条相对完整的路径:
理解 Agent → 掌握工具与设计模式 → 加入 RAG、规划、记忆和协作 → 学习协议、评估与上下文工程 → 进入浏览器、本地模型和云端部署 → 最后处理安全与可验证性如果你刚开始学习 Agent,建议不要把目标定成“看完 18 节课”。更有效的目标是:每学完一个阶段,就做一个小实验;每个实验都记录输入、工具调用、结果、失败原因和下一步改进。
Agent 的学习重点,最终不是记住多少框架名称,而是形成一种系统思维:模型负责推理,工具负责行动,上下文负责组织,记忆负责延续,评估负责校准,安全负责边界。
当你能够把这几部分组合起来,才算真正从“会调用模型”走到了“会构建 Agent”。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~