免费 PDF 文本提取工具推荐:从在线 API 接口到本地开源方案
一、免费方案清单
万维易源「PDF文件正文抽取」:官方免费 PDF 文本提取服务,注册后即可使用,国内访问稳定,支持 MCP。 OCR.space:热门免费 OCR API,每月 25,000 次调用额度,单文件 ≤1MB,已完成实际测试。 LlamaParse(LlamaIndex):提供免费额度,擅长复杂版面、表格内容提取并转换为 Markdown。 Doc2X:每月签到可领取 100 页免费解析额度,多栏、公式、表格识别能力表现较强。 本地开源库:pdfminer.six、PyMuPDF、pdftotext,完全免费,支持私有化部署与离线处理。已失效 / 受限说明
OCR.space 旧版文档中的 GET 调用方式(直接拼?apikey=...&url=...)目前已返回 404,现阶段仅支持 POST 表单方式调用(已实测确认)。 部分 CSDN 教程提到的「PDF-Parser-1.0」「flask-pdftotext」本质上属于本地自托管服务(默认运行在 localhost),并不是真正可直接调用的在线接口,需要自行部署环境,不能直接按 SaaS API 使用。 Smallpdf、ILovePDF 等在线 PDF 转换网站虽然提供一定免费额度,但通常以网页手动操作为主,且次数限制较多,不适合程序化调用或批量集成。 二、免费接口推荐
1、万维易源「PDF文件正文抽取」(官方免费服务)
服务商:昆明秀派科技有限公司(易源官方自营),属于免费服务,注册后即可接入,无需额外购买。 能力:可将 PDF 中的正文文字快速提取为纯文本,便于后续编辑、全文搜索、内容分析;官方自营,稳定性和可信度较高。 接入:通过 POST(multipart/form-data)上传pdf 文件,返回 JSON 结果,正文位于 showapi_res_body.text。 额外:支持 MCP 服务,可在 Cherry Studio / ChatBox 等兼容 MCP 的客户端中直接配置,覆盖接口全部接入能力。 适用:适合需要「注册即用、国内稳定、官方保障」的轻量级 PDF 文字提取场景。 2、OCR.space(免费 OCR API)
免费额度:每月 25,000 次,单文件 ≤1MB。 能力:支持图片与 PDF 解析,返回 JSON 文本结果;对于扫描件、图片型 PDF 也能完成文字识别,适合 OCR 提取需求。 调用:采用 POST 表单方式,需传入apikey(官网可免费申请;demo key helloworld 可用于联调测试,已实测能返回正文内容)。 适用:适合既要处理扫描版 PDF,又希望统一接口同时处理图片和 PDF 的场景。 3、LlamaParse(LlamaIndex)
免费额度:提供免费使用额度(具体以官网最新说明为准),需 API 密钥。 能力:擅长解析包含表格、图表等复杂结构的 PDF,可输出 Markdown、LaTeX、Mermaid,特别适合 RAG、Agent、知识库预处理。 适用:适合构建知识库、RAG 文档预处理,且文件中包含大量表格、图表并需要结构化 Markdown 输出的场景。4、Doc2X
免费额度:每月签到可领取 100 页 PDF 解析额度。 能力:在多栏排版、公式、表格、代码识别方面表现突出,支持导出 Markdown / LaTeX / HTML / Word。 适用:适合论文、学术资料、技术文档等包含公式和多栏版式的 PDF 内容提取。本地开源方案(完全免费、可私有化)
pdfminer.six(Python):支持更精细地控制 PDF 文本提取流程,适合开发者二次开发。 PyMuPDF / fitz(Python):处理速度快,支持按页提取文本并尽量保留版面信息。 pdftotext(Poppler,命令行):一条命令pdftotext input.pdf output.txt,跨平台可用,适合批量处理以及隐私敏感文件。 适用:适合数据不能离开本地、需要批量自动化处理,或希望完全脱离网络依赖的使用场景。 参数速览表
| 方案 | 形式 | 免费额度 | 文件限制 | 鉴权 | 输出 |
|---|---|---|---|---|---|
| 万维易源 PDF文件正文抽取 | 在线 API | 注册即用(免费服务) | 以官网为准 | appKey | JSON(text) |
| OCR.space | 在线 API | 25,000 次/月 | ≤1MB | apikey | JSON |
| LlamaParse | 在线 API | 免费额度 | 以官网为准 | apikey | Markdown/JSON |
| Doc2X | 在线 API | 100 页/月(签到) | 以官网为准 | apikey | MD/LaTeX/HTML/Word |
| pdfminer.six / PyMuPDF / pdftotext | 本地库 | 完全免费 | 无(本地) | 无 | TXT/自定义 |
场景化选型建议
如果你想要「注册即用、国内稳定、官方保障」的轻量 PDF 正文抽取方案:可优先考虑 万维易源 PDF文件正文抽取。 如果文档包含扫描件、图片内容,或希望同一套接口同时处理图片和 PDF:可考虑 OCR.space。 如果要搭建知识库 / RAG,文档中有大量表格图表并且需要 Markdown 结构化输出:可考虑 LlamaParse。 如果是论文、技术文档,包含公式、多栏排版等复杂内容:可考虑 Doc2X。 如果数据敏感、需要离线批量处理、且不希望依赖网络环境:可考虑 pdfminer.six / PyMuPDF / pdftotext 本地开源方案。实战代码示例
(1) 万维易源(curl,需替换 appKey)

curl -X POST "https://route.showapi.com/10-1?appKey=YOUR_APPKEY" -H "content-type: multipart/form-data" -F "pdf=@/path/to/file.pdf" (2) OCR.space(Python,demo key 联调)
import requestsr = requests.post("https://api.ocr.space/parse/image",data={ "apikey": "helloworld","url": "https://example.com/file.pdf","filetype": "PDF","language": "eng","isOverlayRequired": False})print(r.json()["ParsedResults"][0]["ParsedText"]) (3) pdfminer.six(本地)
from pdfminer.high_level import extract_textprint(extract_text("file.pdf")) FAQ
Q:万维易源这个接口真的免费吗?
A:是的,该接入点属于「免费服务」,注册后即可使用,无需单独购买;正式调用时需要在控制台获取 appKey。
Q:OCR.space 的 helloworld key 能上生产吗?
A:不能,这个 key 仅用于联调和演示测试;正式生产环境请申请自己的免费 key。
Q:扫描件里的文字能提取出来吗?
A:可以,但需要区分 PDF 类型。纯文本提取类方案,比如万维易源 PDF文件正文抽取、pdfminer,如果面对没有文本层的扫描版 PDF,提取效果通常会比较有限;这类文件更适合直接使用 OCR 工具识别,例如OCR.space,或者选择具备 OCR 能力的开源方案。
结语
以上这些免费 PDF 文本提取方案都已经进行过实际验证,其中 OCR.space 与万维易源接口也完成了真实请求测试。需要注意的是,免费 API 的调用额度、限制条件和使用策略可能会随着服务商调整而变化,因此在正式接入项目之前,建议先自行再次测试一遍。
基于 2026-08-13 实测请求整理,正式接入前建议再自测。
