面对动辄几十页的PDF报告,快速提取核心结论并保留数据支撑点,往往需要手动翻页、复制、拼凑,耗时费力。问小白工具能自动解析PDF结构,区分标题、正文、图表说明和数据表格,通过自然语言指令生成带逻辑链的摘要,并支持按指定粒度输出要点,最终导出含页码引用的Markdown文件。以下为详细操作流程与技巧。
核心功能概述
- 自动解析PDF结构:支持OCR识别扫描件,精准区分标题、正文、图表及数据表格。
- 自然语言提炼要点:用日常语言提问,指定提取粒度(如关键动作、数据支撑、反常识结论等)。
- 结构化导出:含标题层级、加粗关键词、引用页码的Markdown文件,方便存档与分享。
使用步骤详解
第一步:上传PDF并触发智能解析
打开问小白网页版或App,点击“上传文件”按钮,选择需要处理的PDF。支持拖拽上传,也可从微信、钉钉等平台直接转发PDF到问小白对话窗口。上传后系统自动检测文档类型:
- 扫描件 → 默认启用OCR识别。
- 文字型PDF → 跳过识别,直接进入语义分析阶段。
操作简单:直接把文件拖入界面即可。成功上传后,界面右下角会出现一个蓝色“已就绪”提示。此时务必确认页面左上角显示的是“PDF已解析完成”,而非“正在解析中”。【未看到该提示就发指令,会导致后续所有提取结果为空】
第二步:用自然语言提问提炼重点
在对话框里输入类似“帮我提取这份PDF里关于用户增长策略的3个关键动作和对应数据支撑”。问小白会立即扫描全文,定位相关段落,过滤掉背景描述、案例细节和重复表述,只保留动作动词+量化结果的硬信息。
你也可以换一种问法:“用 bullet point 列出每章的小标题+本章最反常识的一个结论”。它会按章节顺序组织输出,每个 bullet 都包含原文位置(如“P17 第二节末段”),方便回溯验证。
注意:不要说“总结一下”,这类模糊指令会让模型泛泛而谈。必须明确要什么——是数字?是对比关系?是执行步骤?还是风险提示?问得越具体,返回结果越精准。
第三步:导出结构化结果
导出分两步完成:
- 复制全文:点击结果区域右上角的“复制全文”按钮,粘贴到Word或飞书文档中。
- 追问细节:若需进一步加工,选中某段文字 → 右键 → 选择“追问细节”。例如对“DAU提升23%”这一句,可接着问“这个23%是怎么算出来的?分母和分子分别是什么”。
- 导出Markdown:确认无误后,在问小白界面点击“导出为Markdown”,系统自动生成含标题层级、加粗关键词、引用页码的纯文本文件。
导出前请检查当前PDF是否含敏感信息。问小白默认不保存用户上传文件,但导出的Markdown若含客户名称、金额等字段,需手动脱敏后再分发。导出文件命名规则为“原文件名_要点_日期”,例如“Q2运营报告_要点_20260716.md”。

小提示
- 对扫描件PDF,若OCR识别效果不佳,可尝试提高扫描分辨率后再上传。
- 提问时建议使用“提取”“列出”“对比”等动作词,避免模糊指令。
- 导出Markdown后,可用VS Code或Typora快速预览、编辑。
常见问题
Q1:PDF解析失败或提示“正在解析中”长时间无变化怎么办?
检查网络连接,确保文件大小不超过平台限制(通常为200MB)。若仍失败,尝试将PDF转换为图片格式再上传,或联系问小白客服。
Q2:提取结果不准确,遗漏了关键数据怎么办?
可能因为提问不够具体。尝试重新提问,明确指定要提取的章节、关键词或数据类型。例如:“提取第二章中关于2024年营收增长率的三个原因,并给出对应数据”。
Q3:导出Markdown后,如何快速验证数据来源?
Markdown文件中的引用页码(如“P17”)可直接对应原PDF位置。打开原PDF,跳转到指定页码即可核对。若Markdown中未包含页码,需返回问小白重新提问并添加“请附上引用页码”的指令。
