3步让任何网站离线可看:kage从安装到clone再到serve的完整教程
3步让任何网站离线可看kage从安装到clone再到serve的完整教程【免费下载链接】kageShadow any website for offline viewing, with the JavaScript stripped out项目地址: https://gitcode.com/gh_mirrors/kage6/kagekage 是一款免费的开源网站镜像工具离线浏览神器它驱动真实的无头 Chrome 渲染页面、剥离全部 JavaScript并把 CSS、图片、字体下载到本地磁盘让你离线看任何网站——无网络、无追踪、无广告脚本。这篇教程带新手走完 3 步闭环安装 → clone → serve10 分钟拥有一个可以断网打开的整站镜像。为什么浏览器另存为不够用现代网页不是文档而是程序服务器发来的 HTML 常常是个空壳你看到的内容全靠 JavaScript 在浏览器里现场拼装。所以另存为得到的副本往往是空白页还残留着会偷偷打电话回家的追踪脚本。kage 走另一条路用真实浏览器把页面渲染到最终形态截取快照然后撕掉所有脚本再把样式和图片本地化。落在磁盘上的就是一堆干净的.html文件长得和线上网站一模一样却一行代码都不运行。第 1 步安装 kage单个二进制跨平台kage 是单文件二进制安装方式很多新手推荐直接从源码构建方式一克隆仓库 make 构建推荐git clone https://gitcode.com/gh_mirrors/kage6/kage cd kage make build # 生成 bin/kage构建说明见 Makefile。装好后运行kage --version验证一下。方式二包管理器一键安装macOSHomebrew 一行安装WindowsScoopDebian / Ubuntu / Fedora官方 apt / dnf 仓库不想装浏览器官方容器镜像已内置 Chromium一条docker run就能克隆各平台详细命令见官方文档安装指南。⚠️ 一个小前提kage 靠驱动真实浏览器渲染页面宿主机需要安装 Chrome 或 Chromium会自动查找系统安装找不到时首次使用会自行下载一份。第 2 步kage clone —— 克隆任何网站一条命令开克隆kage clone paulgraham.com镜像默认落在$HOME/data/kage/paulgraham.com/终端会实时显示页面数、资源数和错误数结束时告诉你镜像位置。clone 内部做的三件事 ️渲染无头 Chrome 加载页面等网络安静必要时滚动触发懒加载截取人眼看到的最终 DOM剥离删掉所有script、onclick等事件属性和javascript:链接见 sanitize/sanitize.go本地化下载样式表、图片、字体把链接全部改写成本地相对路径爬虫核心逻辑在 clone/cloner.go常用参数只爬你想爬的部分大站点一定要圈定范围防止跑飞参数作用--max-pages 50最多渲染 50 页--max-depth 2链接最多追 2 层--scope-prefix /doc只爬这个路径及其子页面--scroll自动滚动每页触发懒加载图片-f/--force删掉旧镜像从头再来# 先快速尝个鲜前 50 页、2 层深度 kage clone example.com --max-pages 50 --max-depth 2 # 只克隆文档区 kage clone go.dev --scope-prefix /doc完整范围控制说明见 圈定爬虫范围指南。中断了也不怕断点续爬 ✅按 Ctrl-C 会干净地保存进度状态存在镜像的_kage/state.json再跑一次同样的命令就会自动跳过已完成的页面继续爬失败的页面也会自动重试。细节见 断点续爬指南。kage 还是个礼貌爬虫默认遵守robots.txt并用sitemap.xml给自己播种默认只停留在种子域名内。第 3 步kage serve —— 把离线镜像看回来镜像就是一个文件夹但很多站点用了根相对链接/style.css直接双击打开会找不到资源。kage serve起一个本地静态服务器让一切和真实主机上一模一样地解析kage serve $HOME/data/kage/paulgraham.com # 浏览器打开 http://127.0.0.1:8800实现非常简单直接见 cli/serve.go。默认监听127.0.0.1:8800用--addr可换端口比如kage serve xxx --addr 127.0.0.1:9000。打开后随便点每个链接都指向已保存的页面每张图片都解析到本地副本——全程零网络请求。进阶彩蛋把整个镜像压成一个文件 文件夹方便浏览、不便传播。kage pack可以把镜像压缩成单一产物kage pack paulgraham.com # - paulgraham.com.zim一个标准 ZIM 离线档案 kage open paulgraham.com.zim # 随时离线读回来ZIM 格式开放的离线档案标准任何 ZIM 阅读器如 Kiwix 生态都能打开十年后照样能读--format binary生成一个本身就是网站的可执行文件发给别人无需装任何东西--app包成双击即开的桌面 App自动提取网站 favicon 当图标图中效果来自webview构建标签网站不再开在浏览器标签页而是以自己的原生窗口呈现完全一副本地应用的样子见 viewer/webview.go。打包完整玩法见 打包指南。新手常见问题 FAQQ克隆下来的网站还会运行 JavaScript 吗不会。所有script、内联事件和javascript:链接在落盘前已被剥离保存的页面不发起任何网络请求。Q镜像默认存在哪里$HOME/data/kage/域名/用-o可改输出根目录。Q爬大站点太慢默认 4 个页面并发渲染browser/pool.go 维护的浏览器池可加--workers 8提升并发。Q想刷新已克隆的站点kage clone paulgraham.com --refresh就地点重新渲染抓到更新的内容。总结记住这 3 条命令就行kage clone paulgraham.com # 1. 克隆 kage serve $HOME/data/kage/paulgraham.com # 2. 本地预览 kage pack paulgraham.com # 3.可选压成一个文件kage 的核心循环就这三步克隆 → 预览 → 打包。完整的命令与参数速查见 CLI 参考项目介绍见 README.md新手路线可对照 快速上手指南。现在挑一个你舍不得断网打开的网站把它变成真正属于你自己的副本吧 【免费下载链接】kageShadow any website for offline viewing, with the JavaScript stripped out项目地址: https://gitcode.com/gh_mirrors/kage6/kage创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考