十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

mcp-servers之Fetch服务器:网页内容抓取与Markdown转换的高效用法

mcp-servers之Fetch服务器:网页内容抓取与Markdown转换的高效用法 mcp-servers之Fetch服务器网页内容抓取与Markdown转换的高效用法【免费下载链接】mcp-serversModel Context Protocol Servers项目地址: https://gitcode.com/gh_mirrors/mc/mcp-servers想让AI大模型直接上网冲浪读取网页内容mcp-servers项目中的Fetch服务器正是为此而生。它是一款基于Model Context ProtocolMCP的网页内容抓取服务器能够自动把HTML网页精简转换为干净的Markdown文本让Claude等大模型轻松读懂任意网址堪称给大模型装上联网眼睛的最快方式。本文将从零开始带你掌握Fetch服务器的安装、配置与高效抓取技巧。Fetch服务器能做什么三大核心能力一览作为mcp-servers官方服务器家族的一员Fetch服务器把网页内容抓取这件事做到了极致全部逻辑浓缩在 server.py 这一个文件中核心能力说明适用场景️ 网页内容抓取通过fetch工具访问任意URL自动跟随重定向让大模型读取新闻、文档、接口说明等网页 Markdown转换先提取网页正文再自动转换为干净的Markdown去除导航栏、广告等噪音只留有价值内容 分块阅读借助start_index参数分段读取长网页大模型逐段消化超长文章直到找到目标信息背后原理从HTML到Markdown的两次转换Fetch服务器实现Markdown转换主要依靠两个关键依赖见 pyproject.tomlreadabilipy仿照浏览器阅读模式从杂乱HTML中提取正文主体markdownify将提取出的HTML正文转换为规范的Markdown格式ATX标题风格。这意味着即便网页堆满了导航栏、弹窗和广告最终大模型拿到的也是干净清爽的纯文本既省Token又精准。最快安装方法uvx一行命令搞定Fetch服务器基于Python开发推荐使用uv生态无需额外配置依赖即可运行uvx mcp-server-fetch如果更习惯传统pip方式也可以直接安装pip install mcp-server-fetch python -m mcp_server_fetch 小提示如果你额外安装了Node.jsFetch服务器会自动换用更稳健的HTML解析引擎抓取效果更佳。Docker方式运行免环境配置不想折腾Python环境直接用官方镜像mcp/fetch一条命令启动docker run -i --rm mcp/fetch镜像构建方式可以参考 Dockerfile基于Python 3.12精简镜像开箱即用。与Claude无缝集成快速配置方法Fetch服务器最大的价值在于接入Claude等MCP客户端。只需在Claude配置文件中添加如下内容mcpServers: { fetch: { command: uvx, args: [mcp-server-fetch] } }三种安装方式uvx、Docker、pip对应的配置写法在 README.md 中都有完整示例。配置完成后Claude就自动获得了访问网页的能力你可以直接说帮我抓取某某网页的内容它会自动完成网页内容抓取与Markdown转换全程无需人工干预。掌握fetch工具核心参数详解Fetch服务器对外只暴露一个fetch工具参数设计却非常讲究参数类型必填默认值作用urlstring✅无要抓取的网页地址max_lengthinteger❌5000单次返回的最大字符数1~1000000start_indexinteger❌0从第几个字符开始返回内容rawboolean❌false设为true时返回原始HTML不做Markdown转换其中max_length与start_index是分块阅读的黄金搭档下面重点介绍。高效抓取长网页分页阅读技巧面对超长网页Fetch服务器会默认截断返回内容默认5000字符并在结果末尾给出提示Content truncated. Call the fetch tool with a start_index of 5000 to get more content.这正是它的分块阅读设计大模型收到提示后会自动以start_index5000再次调用fetch工具继续读取下一页如此循环无论网页多长都能完整读完。这种设计既避免单次返回内容超出上下文窗口也让抓取过程更省Token。自定义抓取规则robots.txt与User-AgentFetch服务器默认遵守目标网站的robots.txt爬虫协议模型发起的自主抓取会先校验robots.txt网站禁止则拒绝访问。如需忽略该限制可在配置的args中加入参数args: [mcp-server-fetch, --ignore-robots-txt]此外默认的User-AgentModelContextProtocol/1.0 (Autonomous; ...)在部分网站可能被拦截此时可自定义身份标识args: [mcp-server-fetch, --user-agentMyAgent/1.0]这两个启动参数的定义与解析逻辑可以在入口文件main.py 中直观看到。常见问题排查与调试如果集成后抓取异常可使用MCP官方调试工具Inspector定位问题npx modelcontextprotocol/inspector uvx mcp-server-fetch常见问题速查返回Failed to fetch目标网站可能拒绝了请求尝试自定义User-Agent返回的是原始HTML说明页面非标准HTML或raw参数被误设为true提示被robots.txt拦截若确需抓取可添加--ignore-robots-txt参数。总结mcp-servers项目中的Fetch服务器用极简设计解决了大模型如何读取网页这一核心痛点网页内容抓取、HTML转Markdown、分块阅读三大能力环环相扣安装只需一行命令接入Claude也仅需一段配置。无论你是想让AI助手帮忙查阅网页资料还是想基于MCP构建自己的联网智能体Fetch服务器都是值得优先入手的第一课。【免费下载链接】mcp-serversModel Context Protocol Servers项目地址: https://gitcode.com/gh_mirrors/mc/mcp-servers创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表