MiniMax Agent 支持自动生成爬虫脚本:前提是先开通“代码生成”权限,并提供目标网页的 cURL 命令与结构化数据提取需求(包括页面类型、字段定位方式、输出格式)。完成这些信息输入后,再检查选择器是否有效、请求头是否完整,即可运行生成的脚本。

借助 MiniMax Agent 自动生成网页爬虫脚本,可以省去手动编写 Python 爬虫代码、处理反爬限制以及分析 HTML 页面结构的复杂流程。只需输入目标网页和数据抓取需求,通常就能直接获得可运行的脚本文件。
确认MiniMax Agent访问权限与环境
先登录 MiniMax 官网控制台,进入 Agent Playground 页面,确认当前账号已经开通“代码生成”能力权限;如果没有开通,该工具通常无法输出完整且可执行的爬虫脚本。
打开浏览器开发者工具(F12)→ 切换到 Network 选项卡 → 刷新目标网页 → 找到主 HTML 请求(通常为 Name 列中路径结尾无扩展名,或以 .html 结尾的条目)→ 右键复制 cURL(bash)命令。
将复制好的 cURL 命令粘贴到 MiniMax Agent 对话框的第一句,后面紧接你的数据提取要求,例如:“提取所有商品标题、价格、评分,输出为CSV”。【如果不提供cURL或网页URL,Agent大概率只能返回通用模板,而不是可直接运行的真实爬虫脚本】
构造精准指令让Agent输出可用爬虫
方法一:结构化三段式指令
① 目标页说明:明确网页类型(如电商列表页、新闻详情页、表格数据页)以及分页特征(是否存在“下一页”按钮、URL 是否包含 page= 参数、是否采用滚动加载);
② 字段定义:为每个字段写清楚 HTML 定位方式,例如“价格:class=‘price-now’下的span标签文本”或“作者:div.meta span.author-name”;
③ 输出要求:明确保存格式(CSV/JSON)、编码方式(UTF-8)、是否包含表头、是否自动创建目录,例如“保存为./data/products.csv,中文字段名,首行写列名”。
方法二:示例引导法
可以先给 Agent 一个简洁但完整的标准示例,比如:“https://example.com/list 页面,提取h3.title文本→存入title字段,div.price数字→存入price字段,输出CSV”,然后再补充你实际需要抓取的网址和字段规则。这样通常能提升 Selector 识别的准确率,让生成的爬虫脚本更接近可直接使用的状态。
校验与修正Agent生成的脚本
运行之前,先检查脚本开头是否包含 requests、BeautifulSoup 或 lxml 等必要导入;如果缺失,执行时基本会直接报错。若 Agent 使用了 selenium,却没有提示安装 webdriver,也需要你手动补齐相关环境。
还要重点核实 CSS 选择器或 XPath 是否真的能命中目标元素:把 Agent 生成的 select('div.item h4') 复制到浏览器 Console 中,再执行 document.querySelectorAll('div.item h4').length。若返回结果为 0,就说明这个 Selector 已经失效,必须重新调整。
如果脚本中包含 time.sleep() 或 headers 伪装设置,建议保留;如果完全没有配置 headers,【直接运行大概率会被403拦截,务必手动补充'User-Agent'字段】。
最后将脚本保存为 crawl.py → 在终端执行 python crawl.py → 观察终端输出,确认是否成功打印出预期字段值,而不是空列表或 AttributeError 等报错信息。
