十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

BrowserPilot数据抓取实战:纯英语指令批量下载Instagram图片与NYT头条新闻

BrowserPilot数据抓取实战:纯英语指令批量下载Instagram图片与NYT头条新闻 BrowserPilot数据抓取实战纯英语指令批量下载Instagram图片与NYT头条新闻【免费下载链接】browserpilotNatural language browser automation项目地址: https://gitcode.com/gh_mirrors/br/browserpilotBrowserPilot是一款开源的自然语言浏览器自动化工具你不需要写一行爬虫脚本只要写下几行纯英语指令它就能自动驱动 Chrome 浏览器完成数据抓取与信息收集。本文将用官方示例库中的两个真实场景——批量下载 Instagram 图片和采集纽约时报NYT头条新闻带你三步完成从环境搭建到跑通第一个浏览器自动化任务的全过程。 什么是 BrowserPilot为什么能用英语写爬虫传统网页抓取要写大量 Selenium 代码页面结构一变就全部失效。BrowserPilot 的思路完全不同用纯英语描述操作如 click on it、save each image to a file内置的指令编译器browserpilot/agents/compilers/instruction_compiler.py让大模型把英语翻译成 Selenium 代码核心代理browserpilot/agents/gpt_selenium_agent.py在真实浏览器中逐步执行失败还能自动重试它支持的操作与英语指令一一对应查找元素、点击、输入、等待、滚动、把结果保存成文件甚至还能直接问 AI 页面内容。对新手来说这是目前最接近说话就能抓数据的开源浏览器自动化工具。 三步快速上手运行你的第一个浏览器自动化任务安装依赖在终端执行pip install browserpilot也可以克隆仓库查看完整源码git clone https://gitcode.com/gh_mirrors/br/browserpilot准备 chromedriver下载最新稳定版并放到工作目录允许 Python 访问它配置密钥设置环境变量OPENAI_API_KEYBrowserPilot 依赖大模型编译指令然后用官方 CLI 入口examples.py直接运行指令文件python examples.py selenium prompts/examples/instagram.yaml浏览器会自动打开、逐行执行你的英语指令全程无需任何抓取代码。 实战一纯英语指令批量下载 Instagram 图片官方示例库内置了现成的Instagram 图片批量下载脚本prompts/examples/instagram.yaml。全部指令只有简短十几行英语- Go to instagram.com - Type capybaras_for_life and press enter - Find all the images on the page. - Save each image to a file named capybara_{index}.jpg where index is increasing.核心是最后一句把每张图片存成带自增编号的文件。你只要把搜索关键词换成任意公开账号就能批量下载该账号页面的图片一行代码都不用改。 实战二批量采集 NYT 头条新闻让 AI 自动挑政治新闻第二个示例prompts/examples/nytimes_headline_list.yaml展示了数据抓取 AI 分析的组合拳打开nytimes.com收集页面上所有头条链接的文字把所有标题拼成一段逗号分隔的文本自动拼上提示词 find all of the headlines about politics让 AI 筛选出政治新闻关键只有一行英语指令Ask the AI aboutpromptand print the results——分类工作全部交给 AI。这种抓取 摘要的组合特别适合做每日新闻简报或竞品动态监控。 进阶技巧让抓取脚本可复用、更省钱函数化指令用BEGIN_FUNCTION/END_FUNCTION把一组操作封装成函数之后用RUN_FUNCTION一行复用可参考prompts/examples/buffalo_wikipedia.yaml中的搜索函数写法缓存编译结果运行时传入instruction_output_file参数会把大模型编译好的代码存成 YAML下次直接复用省 API 费用智能记忆开启memory_folder参数后Agent 会记住本次浏览过的所有页面还能用一句 Query memory 跨页查询汇总实现见browserpilot/agents/memories/__init__.py⚠️ 新手必看使用前的两点提醒指令要写得像代码一样精确BrowserPilot 更接近用 Copilot 写代码。把输入框写成textarea、把按钮写成 button which says Log in比模糊描述更稳定关键词重要时拆成独立一行更可靠安全须知BrowserPilot 会通过exec执行 AI 生成的代码官方文档明确提示这并非安全惯例。请只运行自己信任的指令文件并遵守目标网站的使用条款从手写脆弱的爬虫代码到用英语说一句浏览器自己去干——把prompts/examples/里的示例复制一份你的第一个数据抓取任务现在就能跑起来。【免费下载链接】browserpilotNatural language browser automation项目地址: https://gitcode.com/gh_mirrors/br/browserpilot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表