ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

novel-downloader 使用指南:批量下载 100+ 网站的小说,离线随时读

novel-downloader 使用指南:批量下载 100+ 网站的小说,离线随时读 novel-downloader 使用指南批量下载 100 网站的小说离线随时读【免费下载链接】novel-downloader一个可扩展的通用型小说下载器。项目地址: https://gitcode.com/gh_mirrors/no/novel-downloadernovel-downloader 是一款跑在浏览器脚本管理器里的小说下载器打开支持网站的书籍目录页点一下右上角出现的下载图标它就开始逐章抓取最后把整本书整理成 TXT 和 EPUB 两个文件存进你的电脑。下面跟着一本书走完全程——从网页上的目录到你阅读设备里的文件。两分钟装好 novel-downloader它不是需要单独安装的程序而是一个小说爬虫脚本油猴用户脚本靠脚本管理器驱动。所以第一步是给浏览器装脚本管理器——一个负责运行这类自定义脚本的插件Chrome 上常用 Tampermonkey开源的有 ViolentmonkeyFirefox 用 Greasemonkey三选一即可。装好后新建一个脚本、粘贴官方脚本内容并保存就算装上了。如果你习惯从源码编译一份自己的克隆仓库后构建git clone https://gitcode.com/gh_mirrors/no/novel-downloader cd novel-downloader yarn install yarn builddist 目录里会出一个 bundle.user.js导入脚本管理器就能用。从目录页右上角的下载图标开始打开支持网站的目录页脚本先判断这个页面它认不认识。认识右上角就浮出一个下载图标点它批量下载小说就跑起来了。接下来是等。右下角有进度条按 F12 能在控制台看到每一章的抓取日志开始下载保存文件一条条滚过去。章节里的图片也会一并下载、嵌回原来的位置。有个小细节下载过程中脚本会放一段无声音频防止浏览器把后台标签页休眠掉听到提示音别慌。100 网站每个都有自己的说明书起点、晋江、刺猬猫、カクヨム、小説家になろう还有满大街的笔趣阁系列页面结构各不相同。novel-downloader 的办法是每个站一份独立的解析规则统一放在 网站解析规则目录 下按单页、双页、特殊处理等类型分文件夹存放。下载时脚本拿当前网址匹配到对应规则再按规则写好的选择器找书名、章节列表和正文容器。某个站改版了只需要动那一个规则文件核心抓取流程集中在 核心业务逻辑规则只管东西在哪不管怎么抓。文字藏在图片里三层解码有一类站防抓取防得很极端正文逐字替换成小图片肉眼正常复制出来全是碎片。脚本对这种局面准备了一套由快到慢的兜底 文件名映射不少站给字符图的文件名就是对应的字先看文件名能对上就零成本解决哈希匹配文件名对不上就把图片下载下来算指纹哈希值拿去匹配表里查PaddleOCR 识别前两步都落空的图片交给 OCR 模型真正读一遍首次使用会自动下载模型文件。绝大多数章节走前两层就解决了只有真正的新面孔才落到 OCR 上。晋江的字体加密怎么还原成正常中文晋江文学城、番茄这类站还有一招页面加载的是伪装的自定义字体字形和真汉字对不上屏幕看着正常源码里却是别的字符。脚本会跟着页面把字体文件下载下来解析字形、建立伪字符 → 真汉字的映射表再把正文逐个替换回去——这就是晋江字体解密的原理落地的文档就是正常中文。如果下载后仍见零星怪符号多半是遇到了匹配表里还没有的新字体打开调试模式日志会提示字体链接按提示反馈即可。下载落成 TXT 和 EPUB离线随时读完成后两个文件自动落到下载目录。TXT 用任何文本编辑器都能打开适合丢进手机自带阅读器EPUB 是带目录、分卷、排版的电子书格式把多平台小说转成 EPUB 之后Kindle、Calibre 直接导入地铁里信号断了也能接着上次的位置翻。分卷小说会保留卷的层级结构卷首分隔页、目录跳转都在。不喜欢默认排版的话脚本预留了自定义筛选函数和保存参数只下载前 100 章、按关键词筛章节、改章节标题格式都行相关实现在 保存与格式模块。卡住或乱码按顺序查这四件事先说前提付费章节需要先登录网站账号并确认已购买没登录或没买的部分下载时会被直接跳过这是设计行为不是故障。站点是否真的在支持列表——不在列表的站右上角不会出现图标这是最常见的没反应按 F5 刷新一次——长佩、pixiv 这类单页应用有时重载之后图标才出现设置里开调试模式再下一次看生成 zip 里的 debug.log能区分是抓取、解码还是格式的问题反爬严的站长佩限制每分钟几章就把并行线程调小、间隔调大慢但稳。想加新站写一个规则文件这就是模块化架构的好处支持一个新网站不用碰下载引擎在 src/rules/ 对应类型的目录里新建一个规则文件继承基础规则类写清书名在哪、章节列表在哪、正文容器在哪再把网址匹配模式登记进脚本重新构建就完事。仓库里现有的 100 多个站都是一个文件一个文件加出来的。想加站、报问题或者发现哪个站又改版了欢迎到项目仓库的 issue 区留言也可以直接提交你的规则文件。请只下载你已购买或有权阅读的内容。【免费下载链接】novel-downloader一个可扩展的通用型小说下载器。项目地址: https://gitcode.com/gh_mirrors/no/novel-downloader创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表