拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

收藏 | 从工具调用到大模型通用Agent:掌握Coding Agent的动态创造能力

收藏 | 从工具调用到大模型通用Agent:掌握Coding Agent的动态创造能力 本文深入探讨了AI Agent的演进从简单的工具调用Tool Calling到生产级工具系统Tool Engineering再到引入Coding能力的Coding Agent。文章核心在于说明Coding Agent如何通过动态生成代码来处理开放性任务超越了传统工具的局限。同时详细阐述了Coding Agent的工作空间Workspace、执行闭环的重要性、Harness的安全约束机制、错误恢复策略以及与Context Engineering的优化方法。文章强调Coding Agent并非万能应与治理良好的工具系统结合最终形成完整的Agent Runtime体系实现从调用外部能力到动态创造能力的跨越。一、Coding Agent 不只是「会写代码的 Agent」假设用户提出一个任务分析这个目录里的 CSV统计错误类型并生成一份 PDF 报告。Agent 要走完探索文件 → 读取 CSV → 分析数据 → 生成图表 → 生成报告 → 输出 PDF。如果所有能力都依赖预定义 Tool那你可能需要list_files()、read_csv()、analyze_csv()、generate_chart()、generate_pdf()……问题是开放任务根本没法提前枚举。下一次用户要「把三个 JSON 合并后分析」再下一次要「解析日志统计异常」再下一次要把结果做成 PPT。每出现一种新任务就加一个 Tool最终就是上一篇说过的 Tool Explosion。Coding 提供了另一条路径理解任务 → 生成代码 → 执行代码 → 获得结果。所以 Coding Agent 的价值并不只是「代码生成」而是通过代码动态组合和创造能力。二、Coding 是一种元能力普通 Tool 是现成能力搜网页、读文件、发邮件、查数据库。而 Coding 是一种「创造新的执行方式」的能力——书里给它起了个名字元能力meta-capability一种能创造其他能力的能力。比如 Agent 没有analyze_csv()这个工具它仍然可以现场生成一段 Python跑出分析结果。这相当于临时创造了一个analyze_csv()——只是这个能力不需要注册成永久 Tool。两条路径的区别可以这样理解三、为什么文件系统会变得重要一旦 Agent 开始 Coding它就需要一个工作空间。书里给的结构很典型workspace/下面有任务说明、输入数据、生成的脚本、输出产物和执行日志。这个 Workspace 不只是存文件。它同时承载五样东西Memory长期信息、Context当前任务资料、Code动态生成的程序、Artifact最终产物、State中间结果。书里甚至提到用MEMORY.md和按日期归档的 Markdown 日志做长期记忆用 Git 做版本控制。这一点我有体感我平时用 Claude Code 和 WorkBuddy 干活项目目录就是 Agent 的工作空间——它读我的文件、写它的脚本、留它的笔记下一次会话还能接着上次的上下文继续。对开放任务型 Agent 来说文件系统很可能就是 Agent Runtime 的工作空间。这也是 Coding Agent 和普通 Chat Agent 的一个重要区别。四、真正难的不是「写代码」而是执行闭环如果 Coding Agent 只是「生成代码然后结束」它并没有真正解决软件工程问题。真实的 Coding Agent 更接近理解任务 → 探索项目 → 制定方案 → 修改代码 → 运行测试 → 发现问题 → 修复 → 再次测试 → 验证 → 完成。这正好回扣上一篇的核心原则Execution Success ≠ Task Success。代码成功运行只说明执行成功不说明任务完成——真正的完成标准应该来自 Test、Lint、Type Check、CI、业务规则和 Verifier。所以 Agent 的终止条件不应该是模型自己说「我已经完成了」而应该是执行 → 验证 → 通过则结束不通过则修复或重新规划。五、Harness决定 Agent 能不能把事情做对如果 Tool 是 Agent 的「手脚」那 Harness 更像是 Agent 的「工作环境和规则」。一个成熟的 Coding Agent Harness 至少需要五样东西Constraint约束、Permission权限、Sandbox沙箱、Verification验证、Recovery恢复。Harness 的价值在于一句话不是让 Agent 什么都能做而是在明确边界内让 Agent 尽可能自主地完成任务。六、错误恢复不能只是「出错就重试」这是 Agent Runtime 很容易踩的坑Tool 报错 → 重试 → 又报错 → 再重试……问题在于不同错误的恢复策略完全不同。超时、限流、连接错误通常可以重试最好加退避但权限拒绝、参数非法、工具不存在简单重试毫无意义得换策略。所以 Runtime 应该先做错误分类可重试的走 Retry / Backoff不可重试的走 Change Strategy。同时必须限制重试次数、迭代轮数、预算和递归深度。否则恢复本身可能形成死循环出错 → 恢复 → 再出错 → 再恢复……最终烧光预算这就是 Agent 的 Dead Spiral。书里给了一个真实例子Claude Code 的上下文压缩就有熔断机制连续触发 3 次就停下来而不是无限压下去。成熟 Runtime 必须有 Circuit Breaker而不是无限重试。七、Coding Agent 为什么特别适合 Verification因为软件工程天然拥有大量验证基础设施测试、Lint、类型检查、CI、Git、Code Review。这让 Coding Agent 很容易形成「生成 → 执行 → 观察 → 验证 → 修正」的循环。比如修一个 Bug改代码 → 跑测试 → 失败 → 分析报错 → 再改 → 再跑 → 通过。这已经非常接近一个标准的 Agent Loop。所以 Coding Agent 的优势并不只是代码生成能力强更重要的是软件工程本身提供了一套天然的反馈信号。别的领域的 Agent 想要这种反馈还得自己造 Verifier写代码的 Agent基础设施是现成的。八、Context 不是越多越好代码库越大Context Engineering 越重要。最简单的方式是把整个 Repo 塞给模型但这样既昂贵又低效。更合理的流程是探索 → 定位 → 局部读取 → 理解 → 修改。比如用read_file(path, start_line100, end_line150)读片段而不是一次吞整个文件。搜索工具也应该分层Glob → 文件在哪里 Grep → 哪里出现了这个内容 Semantic Search → 哪些代码和这个概念相关 Symbol Search → 函数在哪里定义、谁调用了它从粗到细、从语义到语法。这非常接近人类程序员读陌生代码库的过程先建立地图再定位目标最后深入实现。我平时在 Claude Code 里翻不熟悉的仓库实际就是这个顺序——先 glob 文件名再 grep 关键词最后精读那几百行。九、代码编辑也应该尽量结构化Agent 修改代码时一个常见错误是让模型直接输出一大段修改后的整个文件——又贵又不稳定。更可靠的方式是结构化编辑给出旧字符串和新字符串Runtime 先验证旧串存在且唯一再执行替换旧串不存在或出现多次就拒绝修改。这个方案有个名字叫 Old String → New String。书里点明Claude Code、Codex 和今天的 Cursor 采用的都是它。我自己每天在用的 Edit 工具就是这个机制——old_string 匹配不到就报错匹配到多处会要求扩上下文误编辑基本被卡死在入口。背后是一个重要原则自然语言负责理解结构化操作负责执行。模型负责说清「改哪里、改成什么」真正的修改走经过校验的结构化调用。十、Coding Agent 的安全边界必须在模型之外Coding Agent 和普通 Chat Agent 最大的区别是它拥有真正的执行能力读、写、执行、联网、改系统。它面对的风险面也大得多——文件系统、网络、凭证、进程、对外通信。尤其是 Prompt InjectionAgent 读了恶意网页被诱导去读敏感数据、往外发送——这条链路完全成立。所以还是上一篇那句话LLM 不是 Security Boundary。靠 System Prompt 写一句「不要删除生产数据库」防不住被注入后的 Agent。真正的安全边界应该在模型之外工具调用先过 Policy Engine再过 Permission Check再进 Sandbox最后才执行。删除数据、改权限、转账、发布内容、动生产环境这类高风险操作最终都得由确定性的规则和服务端守门。十一、为什么不能靠 Shell 黑名单解决安全问题有人会想检查命令里有没有rm有就拒绝不就行了书里给了一个一秒击穿的例子1 $(echo rm) -rf /字符串里根本没有rm执行时才拼出来。Shell 是组合语言变量、管道、子 Shell、命令替换、参数组合每一条都能绕过字符串匹配。所以安全检查不应该停留在「有没有出现某个词」而应该尽可能接近解析原始命令 → 语义分析 → 副作用分析 → 策略判定 → 放行或拒绝。核心问题不是「有没有出现 rm」而是这条命令最终会产生什么副作用。十二、Coding 让 Agent 获得了「动态创造能力」到这里可以重新理解 Coding Agent 了传统 Tool 只能使用已存在的能力Coding 可以现场造 Parser、Adapter、Validator、Workflow、数据处理程序。但这不意味着所有任务都应该 Coding。支付、发邮件、查 CRM、改订单、访问生产数据库——这些更适合用经过治理的 Tool因为 Tool 自带权限、Schema、审计、限流、身份和业务规则。动态生成的代码更适合数据处理、复杂计算、临时脚本、格式转换这类「脏活」。所以更合理的架构是两条腿固定能力走 Governed Tools动态能力走 Sandboxed Code。十三、从 Tool Calling 到 General Agent把两篇文章串起来演进路线非常清晰第一阶段 Function Calling解决「模型如何调用外部能力」第二阶段 Tool Engineering解决「大量 Tool 如何治理、发现、安全执行」第三阶段 Coding Agent解决「现有 Tool 不够时如何动态创造能力」第四阶段收敛成完整的 Agent Runtime——Context 和 Planning 汇成决策决策分流给现成工具或代码执行各自经过运行时统一进沙箱、出结果、做验证通过就完成失败就恢复。这时候的 Agent 已经不是 LLM Function Calling而是 LLM Context Tools Code Runtime Permission Sandbox Verification Recovery。十四、最后Coding Agent 真正改变了什么Coding Agent 最重要的变化不是「模型会写代码了」而是Agent 开始拥有动态创造能力的可能。在这条链路里各组件各司其职Tool 负责使用已有能力Coding 负责创造临时能力Harness 负责约束行动Sandbox 负责限制能做什么Verifier 负责判断是否真做完了Recovery 负责失败之后怎么办。所以真正值得关注的不是「Coding Agent 能不能写出代码」而是Agent 能不能在受约束的执行环境里动态创造能力并通过执行、验证和恢复不断逼近任务目标这就是从 Tool Calling → Coding Agent → General Agent 最值得理解的演进路线。下一篇我们继续沿着这条线往前走。如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2026 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要《AI大模型入门进阶学习资源包》下方扫码获取~① 全套AI大模型应用开发视频教程包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点② 大模型系统化学习路线作为学习AI大模型技术的新手方向至关重要。 正确的学习路线可以为你节省时间少走弯路方向不对努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划带你从零基础入门到精通③ 大模型学习书籍文档学习AI大模型离不开书籍文档我精选了一系列大模型技术的书籍和学习文档电子版它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。④ AI大模型最新行业报告2025最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。⑤ 大模型项目实战配套源码学以致用在项目实战中检验和巩固你所学到的知识同时为你找工作就业和职业发展打下坚实的基础。⑥ 大模型大厂面试真题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我精心整理了一份大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。以上资料如何领取为什么大家都在学大模型最近科技巨头英特尔宣布裁员2万人传统岗位不断缩减但AI相关技术岗疯狂扩招有3-5年经验大厂薪资就能给到50K*20薪不出1年“有AI项目经验”将成为投递简历的门槛。风口之下与其像“温水煮青蛙”一样坐等被行业淘汰不如先人一步掌握AI大模型原理应用技术项目实操经验“顺风”翻盘这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。以上全套大模型资料如何领取
返回列表