3 年没读完的技术书?用这个开源工具一键变成 AI 可调用的记忆库!17k+ 星热门项目,3 步把 PDF 转成结构化技能包,让知识真正做到即学即用。核心内容:1. 技术书“读过≠会用”的常见痛点(如买来后长期吃灰)2. 工具使用流程:指定书籍 → 自动蒸馏 → AI 按需检索与调用3. 工具架构与优势:提取阶段免费 + 生成阶段需 AI,MIT 开源协议 + 17k+ GitHub Star 热度

这本书我买了 3 年一直没看完,直到我用这个工具把它变成了 AI 的长期记忆
17.8k 星,7 月 29 日单日增长 1400+,并冲上 GitHub Trending。它已经成为当前“知识→Skill”赛道里最受关注的开源项目之一。
你买过多少本技术书,翻完第一章后就再也没有打开过?
我书架上就有一本《Designing Data-Intensive Applications》,买了三年,封面都快褪色了。每次写系统设计方案时,我都想重新翻一翻,但一想到那本 600 多页的 PDF,最后往往还是放弃。
问题不是不想学,而是读完 ≠ 真正会用。很多内容过了三个月,连第 7 章讲了什么都很难回忆起来。
这正是 book-to-skill 想解决的核心问题。
它是怎么做到的?(3 步讲清楚)
1️⃣ 指向书本: /book-to-skill ./设计数据密集型应用.pdf
2️⃣ 自动蒸馏: 提取→清洗→分章→生成结构化 Skill
3️⃣ AI 按需调取:/设计数据密集型应用 复制 → 读取第 5 章 → 基于原文回答
它并不只是一个“PDF 转文本”工具,而是会生成一个结构化知识包:
| 文件 | 内容 | 大小 |
|---|---|---|
| SKILL.md | 核心思维模型 + 章节目录 | ~4000 tokens |
| chapters/ | 每章一个文件,按需加载 | ~1000 tokens/章 |
| glossary.md | 全部关键术语,字母排序 | ~1500 tokens |
| patterns.md | 所有算法/设计模式/技巧 | ~2000 tokens |
| cheatsheet.md | 决策表 + 速查规则 | ~1000 tokens |
这个设计最关键的一点,就是**“分章按需加载”**——如果你没有询问第 3 章,系统就不会额外占用 Token 预算。
实测:我用它处理了一本 400 页的书
先理解它的整体架构——book-to-skill 主要分成两层:
① 提取器(Python 脚本,零 API 消耗)
基于纯 Python 实现,全部在本地电脑运行,负责把 PDF、EPUB、DOCX 等原始文档提取为干净文本和元数据。整个过程不联网、不消耗 Token,也不会调用任何大模型。
② 生成器(Agent 遵循 SKILL.md 指令,需 API Key)
完成文本提取后,你的 AI Agent(Claude/Copilot/Amp)会按照 SKILL.md 中预设的流程,把提取结果进一步整理为结构化 Skill——包括分章、术语提取、模式识别和速查表生成。只有这一步才需要 Agent 的 API Key。
简单理解就是:提取免费,结构化依赖 AI。 项目本身采用 MIT 开源协议,完全免费——你真正需要承担的,只是自己 Agent 的 API 调用成本。
安装(两种方式,按需选择):
# 方式一:独立 CLI(纯提取引擎,不依赖 Agent)
pip install book-to-skill
book-to-skill --help
# 方式二:Agent Skill(注册 /book-to-skill 命令,支持完整蒸馏流程)
git clone https://github.com/virgiliojr94/book-to-skill.git ~/.claude/skills/book-to-skill
# 也支持 Copilot CLI: ~/.copilot/skills/、Amp: ~/.agents/skills/
跑起来:
# 在 Agent 对话中直接输入
/book-to-skill ./python-advanced.pdf
处理速度会根据提取模式和文档页数变化(数据来源:官方 PERFORMANCE.md[1],不同硬件环境下速度差异会比较明显):
| 模式 | 速度 | 适用 |
|---|---|---|
| 纯文字(pdftotext) | 极快,400 页约 30 秒 | 纯文字书、无代码/表格 |
| 高精度(docling) | 约 1.6 秒/页,400 页约 10 分钟 | 技术书(保留代码块和表格) |
虽然文章开头提到的是《DDIA》这本经典大部头,但这次实测我实际拿来跑的是一本 400 页的 Python 进阶书——效果同样不错。我选择的是高精度模式,因为书中包含大量代码块和表格。最终跑完后生成了 5 个文件,总计约 9500 tokens。
接着我让 AI 回答:“这本书推荐的错误处理最佳实践是什么?”
它会直接定位到第 8 章,并给出基于原书内容的回答 + 书里的代码示例。由于整个回答过程是建立在结构化后的原文召回之上,在实际使用中能明显降低幻觉问题。
再看一下 Token 消耗差异:如果不做转换,直接把整本 PDF 塞进上下文(约 15 万 tokens),那么每一次提问都要花大量 Token 去“翻书”。而 book-to-skill 的方式只需要在首次转换时支付一次成本,后续每次查询只加载相关章节——根据官方 PERFORMANCE.md 基于 Claude 3.5 + 10 万 token 上下文的测算,实测可节省 24×–51× 的 Token。
⚠️ 注意:提取阶段完全在本地执行,不消耗 API。但在生成 Skill 阶段,需要调用 Agent API(Claude/Copilot/Amp),这意味着你的文档内容会通过 API 发送给对应的 AI 服务商——数据将按照对应平台的隐私政策处理,并不是“全程都不离开电脑”。如果你对数据隐私要求很高,可以只使用 CLI 模式提取纯文本,跳过 Agent 生成阶段。
不止能处理书籍
虽然它叫“book-to-skill”,但支持的内容远不止图书——可处理 PDF、EPUB、DOCX、HTML、Markdown、RTF、MOBI、TXT、RST、AsciiDoc 等 9 种以上格式:
- 公司内部文档:ADR(架构决策记录)、Runbook、Onboarding 指南 → 打包成团队可复用的 Skill
- 品牌设计规范:品牌手册、设计系统原则 → 变成 AI 可随时引用的设计规范库
- 论文堆 + 笔记:一批 Arxiv 论文 + 你自己的研究笔记 → 合并成研究型 Skill
- RFC / API 合同:协议文档、合规文档 → 便于检索与问答调用
只要是你经常反复查阅、但又懒得硬记的内容,基本都适合拿来转化。
同类工具对比
| 维度 | book-to-skill | 仓颉.Skill |
|---|---|---|
| 输入 | PDF/EPUB/DOCX 等 9+ 种图文格式 | 视频/播客/音频字幕 |
| 输出 | 5 种结构化文件(分章+术语表+模式+速查) | SKILL.md + DIGEST 精华长文 |
| Stars | 17,783(截至 2026-08-07) | 6,541(截至 2026-08-07) |
| 分章按需加载 | ✅ 核心设计 | ❌ 侧重全书理解 |
| 安装 | pip install 或 git clone | git clone + 多 Agent 配置 |
book-to-skill 和仓颉.Skill(面向视频/播客的知识蒸馏工具)其实是互补关系——前者更适合处理图文类知识,后者更适合处理音视频知识。两者完全可以组合在同一条“知识→Skill”生产链路中。
4 个容易踩坑的点
版权红线:生成出来的 Skill 本质上属于你的“读书笔记”,不能公开传播或分发。作者在 README 中已经明确说明了这一点。个人自用没问题,随意转发就不合适。另外,如果原书带有 DRM 保护,转化过程还可能涉及法律风险,使用前请先确认自己拥有合法使用权。
技术书建议必须用 docling:如果你的 PDF 里包含大量代码块和表格,默认的 pdftotext 往往会丢失格式。更稳妥的做法是选择高精度 docling 模式——但相应代价就是速度更慢(约 1.6 秒/页)。
不支持扫描版 PDF:文档必须存在可提取的文字层。像扫描件、手写笔记照片这类内容,目前无法直接处理。
需要 Agent 环境:如果你想体验完整的“蒸馏→结构化 Skill→Agent 按需调用”流程,就需要提前配置好 Claude/Copilot/Amp 的 API Key。如果你只是想提取纯文本,后续用于搜索、归档或手动整理,那么
pip install提供的 CLI 模式已经完全够用,而且不依赖任何 Agent。
我的一句话判断
如果你平时经常使用 AI 编程助手,同时书架上又堆着几本想用却一直懒得翻的技术书——book-to-skill 是目前非常值得投入的“知识资产化”开源工具之一。
如果只使用 CLI 模式提取纯文本,它也很适合做搜索、归档或手动整理;但如果你想真正体验完整的“蒸馏→结构化 Skill→Agent 按需调用”能力,还是需要一个可正常工作的 AI Agent 环境。
后台回复「book-to-skill」获取完整 11 节深度调研报告(含源码结构 + P0/P1/P2 借鉴清单 + 安装踩坑记录)。
Stars 数据:GitHub API 实时查询(截至 2026-08-07 约 14:00 CST)。Token 节省数据:官方 PERFORMANCE.md。
引用链接
[1]PERFORMANCE.md: https://github.com/virgiliojr94/book-to-skill/blob/master/docs/PERFORMANCE.md
登录查看剩余 70% 内容
