新闻详情

新闻详情

首页 / 资讯中心 / 详情

book-to-skill 实战指南:把技术书变成按需加载的 Agent Skill

发布时间:2026/10/2 8:13:34来源:尧图网络
book-to-skill 实战指南:把技术书变成按需加载的 Agent Skill
book-to-skill 实战指南把技术书变成按需加载的 Agent Skill【免费下载链接】book-to-skillTurn any technical book PDF into a Claude Code skill — ready to study, reference, and use while you work.项目地址: https://gitcode.com/GitHub_Trending/bo/book-to-skillbook-to-skill 是一个把 PDF、EPUB 等书籍与文档目录转换为标准 Agent Skill 的转换器转换时一次性付清结构化成本之后回答一个定向问题只需约 5,000 token比把整本书塞进上下文节省 24×–51× token。先甩结论24×–51× token 节省一本书成本约 1 美元不用它时的典型痛点直接搜 PDF → 得到页码列表不是答案让 Agent 直接答 → 要么幻觉要么承认书里没读过边读边记笔记 → 攒出 200 行文件之后再没打开过。根因在于发现循环税Discovery Loop TaxPDF 阅读型 Agent 不是在读而是在导航——每轮对话都要重新拉目录、回溯、重处理全部内容。book-to-skill 把这份成本在转换时一次付清查询成本只与答案成正比。以下数据全部实测tiktokencl100k_base 计数回答一个定向问题进入上下文的 token 数书章节大小整本塞入上下文发现循环book-to-skill节省倍数Think Python 2小119,26412,152~5,00024× / 2.4×Working Backwards中175,25333,444~5,00035× / 6.7×AI Engineering大256,28777,866~5,00051× / 15.6×两个口径要分开读对比整本塞入的 24–51× 是最强主张因为该成本在每一轮对话重复发生对比发现循环的 2.4–15.6× 是一次性成本且随章节大小缩放。任意一行都可用仓库内命令复现python3 tools/discovery_tax.py --full-text /tmp/book_skill_work/full_text.txt --target-chapter 5三种方式安装装完跑一条命令体检先分清两条路径不要混淆作为 Agent skill 安装拿到/book-to-skill斜杠命令和完整转换流程→git clone进宿主 skills 目录作为独立 CLI 安装只要文本提取引擎用于脚本或抓取可选解析器→pip install不会注册斜杠命令。跨宿主一键安装解析仓库、识别根级SKILL.md装进你选择的每个宿主npx skills add virgiliojr94/book-to-skill手动按宿主 cloneskill 遵循开放 Agent Skills 标准一份安装多宿主共用# Claude Code git clone https://gitcode.com/GitHub_Trending/bo/book-to-skill ~/.claude/skills/book-to-skill # 跨 Agent 路径Copilot CLI / Amp / Codex 均原生发现 git clone https://gitcode.com/GitHub_Trending/bo/book-to-skill ~/.agents/skills/book-to-skill # Hermes AgentHERMES_HOME 默认 ~/.hermes按 profile 感知 git clone https://gitcode.com/GitHub_Trending/bo/book-to-skill \ ${HERMES_HOME:-$HOME/.hermes}/skills/productivity/book-to-skill独立 CLI 不在 PyPI 上直接从仓库装pip install book-to-skill[pdf,epub,docx] githttps://gitcode.com/GitHub_Trending/bo/book-to-skill.git book-to-skill --check # 报告已安装哪些提取器体检一条命令逐格式打印 ✓/✗ 与缺失项的精确安装命令不需要提供文件python3 scripts/extract.py --check该报告由book_to_skill/dependencies.py的run_dependency_check()生成甚至能识别 pipx 隔离安装可执行文件在 PATH 但模块不可导入时提示改用对应虚拟环境的 Python。首次转换从 PDF 到结构化 skill 的完整链路在任意 Agent 会话中输入/book-to-skill ~/books/my-book.pdf # 多来源合并为一个统一 skill路径 可选 slug /book-to-skill ~/papers/paper1.pdf ~/notes/export.txt unified-research # 目录 / glob 同样支持 /book-to-skill ~/books/*.epub my-library完整流水线Steps 0–11 全量走查见docs/how-it-works.md一个文件 / 一个目录 / 一个 glob │ ▼ Step 1.5 问技术书代码/表格还是文字书 ├── technical → Docling保留表格代码约 1.5s/页 └── text → pdftotext → pypdf → pdfminer瞬时 │ ▼ scripts/extract.py paths… --mode technical|text ├── tempdir/book_skill_work-pid/full_text.txt 合并文本带来源边界 └── tempdir/book_skill_work-pid/metadata.json 页数/token/逐来源明细 │ ▼ Agent 按 SKILL.md 规格生成 → 写入 ~/.agents/skills/slug/按宿主 ▼ 结束前扫描tools/scan_generated_skill.py→ 清理工作目录 → 报告关键分支有四个对应 SKILL.md 定义的四类运行模式模式触发条件动作完整转换默认给路径无特殊说明执行 Steps 0–9产出完整 skill仅分析说 analyze / just extract只出结构化提取报告不生成文件基于既有分析生成已有分析笔记跳过 Steps 0–3直接 Steps 4–9更新 / 折叠新来源 指向已有 skill 目录新内容合并进既有章节与索引生成前还有一道闸门Step 2.5读取本次运行的metadata.json展示来源数、页数/词数/token 汇总与成本预估等你确认后才开始生成。产物结构5 类文件章节按需加载转换完成后~/.agents/skills/slug/下的文件清单与规模文件用途规模SKILL.md核心心智模型 章节/主题索引~4,000 tokenchapters/ch01-*.md…每章一个文件按需加载每章 800–3,000 tokenglossary.md全部术语按字母序 章节引用≤1,500 tokenpatterns.md技术、算法与设计模式≤2,000 tokencheatsheet.md决策规则、阈值、权衡矩阵≤1,200 token章节文件在你问到相关主题前不占用 skill 预算——常驻的只有主SKILL.md加一次加载的一章这就是前文≈5,000 token的来源。生成后的调用方式/designing-data-intensive-apps # 加载核心心智模型 /designing-data-intensive-apps replication # 定位并解释某主题 /designing-data-intensive-apps ch05 # 深入第 5 章每章预算由BOOK_TYPEtext/technical×DEPTHreference/study两维决定DEPTH不单独提问从用途问答推导只选引用章节→ reference选了应用框架/用作者心智模型思考→ study。DEPTHreferenceDEPTHstudyBOOK_TYPEtext800–1,200 token1,000–1,800 tokenBOOK_TYPEtechnical1,200–1,800 token2,000–3,000 tokenstudy 深度必须靠内容挣来而非灌水章节要复现一个书中 Worked Example、把每个框架的 How 展开为显式步骤。cheatsheet.md的生成规范最讲究——它是推理辅助而非关键词表优先级依次为决策规则当 X 做 Y 因为 Z、决策树、权衡矩阵、阈值默认值、识别信号刻意避免术语→定义裸行那是 glossary 的活。依赖矩阵按格式选工具缺失有回退提取器按格式依次尝试工具、取第一个可用的什么都没装时会告诉你该跑哪条命令。纯文本、Markdown、reStructuredText、AsciiDoc 零依赖。场景首选工具安装命令回退PDF 文字书pdftotextpopplersudo apt install poppler-utilspypdf→pdfminer.six均 pipPDF 技术书doclingpip3 install docling—EPUBebooklibbeautifulsoup4pip3 install ebooklib beautifulsoup4标准库zipfile始终可用DOCXpython-docxpip3 install python-docx标准库 ZIP/XMLHTMLbeautifulsoup4pip3 install beautifulsoup4标准库html.parserRTFstriprtfpip3 install striprtf正则清理MOBI / AZW / AZW3Calibreebook-convert从 Calibre 官网下载无回退硬性缺失两点值得提前知道其一[html]extra 比其他重——它会拉入trafilatura及其 17 个包的完整 HTML 处理栈换来真正的正文/样板检测不装时bs4回退仍可用只是没有样板移除。其二MOBI 系列是唯一无回退格式book_to_skill/dependencies.py中该组标记required: TrueCalibre 缺失即提取失败。依赖的交互式安装由 Step 2 传入的--install-missing ask控制检测到缺失包时询问是否安装非交互会话默认走回退环境变量BOOK_SKILL_INSTALL_MISSING可预设该行为。三个实现细节决定它不翻车每次运行独立工作目录。config.py中默认工作目录是tempdir/book_skill_work-pid/可被BOOK_SKILL_WORKDIR完全覆盖。目录名带 PID 不是洁癖旧版共享固定目录时后完成的运行会静默覆盖先完成的full_text.txtAgent 甚至可能拿另一本书的metadata.json去生成 skill。运行结束会打印Workdir -/Text -/Meta -三条路径务必以输出为准不要假设固定位置。CJK 文本单独估算。WORDS_PER_TOKEN 0.75只适用于空格分隔的拉丁文本中日韩文几乎没有空格按词切分会把整本书压成几个词。因此CJK_CHARS_PER_TOKEN 1.5按码点直接计数并覆盖增补平面U20000–U3FFFF与康熙部首范围——中文电子书常用部首字形渲染正文漏计这块整个成本预估就错了。大书用 REPL 式访问。超过约 50,000 token 的书不整文件读入改用命令切片原因200 页书约 75K token逐章重读 28 遍要烧约 200 万输入 tokenwc -w $FULL_TEXT_PATH # 先量规模 grep -n -E ^\s*(Chapter|CHAPTER)\s[0-9] $FULL_TEXT_PATH # 找章节偏移 sed -n start,endp $FULL_TEXT_PATH # 只拉所需片段 grep -c -i westrum\|dora $FULL_TEXT_PATH # 验证框架确实被提及边界与限制这些情况它会翻车或需要你兜底扫描版 PDF 必须先 OCR。只有页面图片、没有文本层的 PDF任何工具都无从提取。提取器会检查开头几页并立即中止给出说明而不是跑完整本书后产出空 skill。自己先跑 OCR 再转换ocrmypdf input.pdf output.pdf章节自动检测依赖 Chapter N 式章首。Pro Git 用小节标题而非 Chapter N不自动分段——提取和转换仍能工作只是需要手动指向小节反向的坑同样存在Moby-Dick 正文用裸标题但罗马数字目录被检出 133 章。自动分段不是万能的生成后先看 Chapter Index 是否符合预期。第三方版权书的 skill 必须保持私有。章节文件是合成摘要而非原文但衍生自源材料。转换完成后 skill 可发布为独立仓库供任意宿主一条命令安装但可见性是独立、封闭式提问gh repo create默认--private只有回答恰好是裸词public且通过版权门才建公开仓库——这本书是公共领域描述的是书不是仓库仍然得到私有仓库。生成质量有 8 条硬规则兜底SKILL.md 末尾提取结构而非摘要、保留作者精确命名5 个为什么 ≠ 多问几次为什么、密度优先于完整、实践者口吻、SKILL.md 重要内容前置压缩截断从文件末尾开始、章节按需加载、绝不复制原文、主题索引是 Agent 导航的唯一路径。发布前还有一道强制安全扫描python3 tools/scan_generated_skill.py ~/.agents/skills/skill_name # 扫描失败即停交人工审阅不得静默改写后加载或发布许可一句话转换器本体代码 skill 定义为 MIT不覆盖你用它所处理的任何书籍或文档。核心价值一句话把反复导航 PDF的持续成本压缩成转换一次、按需加载的一次性成本——一本书约 1 美元全程本地处理产物是你的结构化笔记。下一步完整流水线 Steps 0–11 与提取模式docs/how-it-works.md全部实测基准与复现方法docs/performance.md各宿主安装路径与独立 CLI 细节docs/install.md【免费下载链接】book-to-skillTurn any technical book PDF into a Claude Code skill — ready to study, reference, and use while you work.项目地址: https://gitcode.com/GitHub_Trending/bo/book-to-skill创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Spring Boot社区健康管理系统开发实战:从数据库设计到远程调试 2026/10/2 8:57:17

Spring Boot社区健康管理系统开发实战:从数据库设计到远程调试

最近帮学弟学妹看毕业设计,被问得最多的就是基于Spring Boot的社区健康管理系统。这类题目看起来是标准的管理系统CRUD,但真要把源码包、文档梳理清楚,再配合远程调试把项目在自己电脑上跑起来,隐藏的小坑多得超乎想象。这篇我就把…

阅读更多 →
GEO优化实战:让AI搜索引擎主动引用你的网站内容 2026/10/2 8:57:17

GEO优化实战:让AI搜索引擎主动引用你的网站内容

1. 2026年最值得警惕的“隐形危机”:搜索引擎排名靠前,AI答案里却没有你先说一个我最近真实遇到的事。我一个做工业检测设备的客户,官网在Google的“工业检测设备”这个核心词上排到首页前三,自然流量数据好看得不行。但从2025年年…

阅读更多 →
深度强化学习求解机组组合:MDP建模与开源实现 2026/10/2 8:57:17

深度强化学习求解机组组合:MDP建模与开源实现

简介:这份开源项目面向电力系统调度、能源管理与强化学习方向的研究生、算法工程师及科研人员,聚焦机组组合这一经典优化难题。机组组合需在满足负荷需求与设备约束的前提下安排各类型机组的启停与出力计划,以最小化运行成本,而深…

阅读更多 →
IDM报无法登录FTP服务器?一篇讲透排查与修复方法 2026/10/2 8:57:17

IDM报无法登录FTP服务器?一篇讲透排查与修复方法

用IDM(Internet Download Manager)去FTP服务器拉文件,弹出一个“无法登录到FTP服务器”的提示,这个问题我遇到过的次数,比我自己以为的要多得多。很多人的第一反应是重新输入一遍账号密码,或者干脆换个IDM版…

阅读更多 →
O(logn)的本质是问题空间收缩,不是速度标签 2026/10/2 8:57:16

O(logn)的本质是问题空间收缩,不是速度标签

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
LeetCode 215:快速选择与堆求解第K大元素,打通TopN思路 2026/10/2 8:57:10

LeetCode 215:快速选择与堆求解第K大元素,打通TopN思路

刷了这么多年的题,Hot100 里能同时横跨“排序、堆、分治、快选”四个知识点的题其实不多,215题“数组中的第 K 个最大元素”算是最典型的一道。不管你是准备国内大厂面试,还是在系统设计里处理 TopN 问题,这道题的几种解法几乎就是…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉