从几个关键点切入:DuMate 这款数据提取工具,能够自动将网页或 PDF 中的零散信息抓取出来,直接生成结构规整的 Excel 表格。它支持关键词定位、动态内容加载、多源合并,甚至还能处理 OCR 图片识别。最终输出的文件会自动添加时间戳,空值则默认填充为“-”。

设想一下,你正在手动整理网页上的产品参数、竞品对比数据或用户评论反馈——这些信息往往分散在页面各处,稍不留神就容易复制错行、遗漏关键列。而 DuMate 能直接读取网页内容,自动识别表格结构,提取关键字段,并整齐对齐生成一份可直接编辑的 .xlsx 文件。整个过程无需频繁切换浏览器与 Excel,也无需担心 JavaScript 动态渲染导致数据缺失。
直接让 DuMate 抓取网页并生成表格
操作流程非常直观:打开目标网页(例如某款手机的电商详情页,或第三方评测页面),点击 DuMate 悬浮窗,然后输入指令——“提取当前网页中所有包含‘型号’‘价格’‘屏幕尺寸’‘电池容量’字段的表格数据,合并为一张 Excel,列名按原文保留,空值填‘-’”。
接着,DuMate 会自动唤醒网页交互子智能体,加载完整页面——包括需要滚动到底部才能触发的异步内容。然后它会逐块识别那些包含目标关键词的 HTML 表格或文本区块。这一步必须确保网页已完全加载,否则动态加载的参数表可能被跳过。
生成的 Excel 会默认保存在你设定的“工作区文件夹”里,文件名会自动带上时间戳,例如【手机参数_20260723_2215】.xlsx。
处理多页/分栏网页的进阶操作
方法一:拖入多个网页链接批量处理。将三个竞品页面的 URL 复制到记事本,全选后拖进 DuMate 窗口,然后输入“对比这三页中的‘CPU’‘内存’‘主摄像素’三项参数,横向合并为单张表格,每页数据占一列,首行标注来源网址”。
方法二:结合本地 PDF 补充字段。如果某项参数只在 PDF 版说明书里出现(比如功耗曲线图旁的文字说明),可以同时拖入该 PDF,然后输入“将网页提取的表格与 PDF 第 8 页提到的‘待机时长’字段合并,新增一列‘最新待机时长’,未提及的填‘见 PDF 第 8 页图注’”。注意:PDF 必须是文字可复制版本,扫描件需先用 DuMate 内置 OCR 预处理。
清洗杂乱网页文本为结构化表格
第一步:定位原始文本区域。在网页上用鼠标框选一段包含商品名称、规格、用户评分、评论摘要的混排内容(注意避开导航栏或广告位),然后右键选择“复制为纯文本”。
第二步:交给 DuMate 结构化。把复制的文本粘贴进 DuMate 输入框,输入“从这段文本中提取 5 个商品信息,每条包含【商品名】【核心参数】【用户平均分】【典型好评关键词】4 个字段,输出为 Excel,评分统一保留 1 位小数”。
第三步:校验字段完整性。生成的表格打开后,检查“典型好评关键词”列是否出现整段评论被误塞入单格的情况。如果存在,说明原文未用明确分隔符(如换行或冒号),此时需要返回上一步,在指令末尾追加“用‘|’分隔每条关键词,最多取 3 个”。
