拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Crawl4LLM 前置准备:ClueWeb22 数据集申请完整教程

Crawl4LLM 前置准备ClueWeb22 数据集申请完整教程【免费下载链接】Crawl4LLMOfficial repository for Craw4LLM: Efficient Web Crawling for LLM Pretraining项目地址: https://gitcode.com/gh_mirrors/cr/Crawl4LLM想跑通 Crawl4LLM一个面向 LLM 预训练数据采集的高效网络爬虫开源项目对应论文《Crawl4LLM: Efficient Web Crawling for LLM Pretraining》你首先要跨过一道门槛ClueWeb22 数据集申请。ClueWeb22 是 Crawl4LLM 爬虫的语料底座也是新手最容易卡住的环节。这篇 ClueWeb22 数据集申请完整教程会带你从申请入口、下载安装到数据验证一步不落全部搞定让爬虫顺利跑起来。✅Crawl4LLM 是什么为什么必须用 ClueWeb22 数据Crawl4LLM 的核心思路是与其随机抓取网页不如先用长度、fastText 质量分、入链数等指标对文档打分再按分数贪婪地扩展种子文档从而用更少的抓取量获得更高质量的大模型预训练语料。要实现这个流程爬虫需要一个海量、真实、带链接关系的网页库作为原料池——这就是 ClueWeb22 的角色。项目在 README.md 的 Prerequisite前置准备一节里把申请 ClueWeb22 数据集排在了第一步可见其重要性。ClueWeb22 数据集简介大模型预训练的数据金矿ClueWeb22 由卡内基梅隆大学 Lemur Project 发布是继 ClueWeb09 / ClueWeb12 之后的新一代大规模网络语料库包含约100 亿个网页、数十 TB 数据按语言划分为多个 segment。Crawl4LLM 主要使用英文 A 段文档 ID 以clueweb22-en开头每个文档除了原始 HTML还附带清洗后的Clean-Text以及入链、出链等注释信息。看懂文档 ID 是使用数据的基础比如clueweb22-en0041-36-03476ID 片段含义说明en语言English 英文段en00segment数据分段en0041目录数据所在目录36批次压缩包编号03476文档号文件内偏移索引这套 ID 解析逻辑封装在 corpus_interface.py 的ClueWeb22Api类中你不需要自己实现。ClueWeb22 数据集申请前需要准备什么申请前先备齐以下材料能大幅提高通过效率邮箱建议使用学校或机构邮箱个人邮箱也可尝试机构信息大学、研究机构或公司名称以及负责人信息用途说明简要描述研究用途如用于 LLM 预训练语料研究大容量 SSDREADME 中特别强调ClueWeb22 数据必须放在 SSD 上才能高效运行爬虫充足磁盘空间建议预留数百 GB 到数 TB[!TIP] 如果磁盘紧张可以只下载英文 A 段。Crawl4LLM 的种子文件 seed.txt 中全部是clueweb22-en开头的文档 ID其他语言段暂时用不到。ClueWeb22 数据集申请完整流程保姆级步骤申请本身并不复杂核心是填表 → 等审核 → 下载具体步骤如下第一步进入官方申请页面在浏览器打开 Lemur Project 的 ClueWeb22 官方页面lemurproject.org 下的 ClueWeb22 专区找到 Data Access / Request 入口。第二步填写申请表如实填写姓名、所属机构、邮箱地址、所在国家/地区以及数据用途。学术研究用途通常会被优先批准。第三步同意数据使用协议ClueWeb22 面向科研开放你需要同意其使用条款一般要求仅限非商业研究用途且不得对外重新分发数据。第四步等待审核邮件提交后一般需要数天到一两周的审核期请留意邮箱包括垃圾箱。批准邮件中会附带数据下载方式与使用说明。第五步按指引下载数据根据邮件提供的下载方式获取数据包解压后整理到统一根目录下文会说明目录结构。ClueWeb22 数据下载与目录结构下载完成后建议将数据按如下结构组织这是 Crawl4LLM 读取数据的标准方式clueweb22_root/ ├── html/ 原始网页文件 ├── txt/ Clean-Text 清洗后文本 ├── inlink/ 入链锚文本信息 └── outlink/ 出链信息ClueWeb22Api正是按语言 → segment → 目录的层级拼接文件路径的具体实现见 corpus_interface.py 的get_base_filename_by_id。目录结构放错位置爬虫会报文件找不到的错误。验证 ClueWeb22 数据集可用性数据就位后先用项目自带的浏览工具验证一下避免跑到一半才发现路径问题。执行python access_data.py clueweb22_root clueweb22-en0041-36-03476如果一切正常终端会打印出该文档的文本内容及其出链列表相关逻辑见 access_data.py 和 corpus_interface.py 的UnifiedGetter。这一步能同时验证txt/与outlink/两个关键目录。安装 Crawl4LLM 环境并启动爬虫数据验证通过后就可以搭建环境了① 克隆仓库git clone https://gitcode.com/gh_mirrors/cr/Crawl4LLM② 创建虚拟环境并安装依赖python -m venv venv source venv/bin/activate pip install numpy tqdm fasttext pyyaml wandb③ 下载 DCLM fastText 分类器放入fasttext_scorers/目录用于文档质量打分。④ 编写配置并启动爬虫在configs/下创建 YAML 配置文件填入cw22_root_path指向 ClueWeb22 根目录、seed_docs_file: seed.txt等参数然后运行python crawl.py crawl --config configs/你的配置.yaml关于各配置项如num_workers、selection_method的详细说明可以参考 README.md。抓取完成后可用 fetch_docs.py 将文档 ID 批量转换为文本语料用于后续预训练。常见问题FAQ问题解答申请多久能通过一般数天到两周高峰期可能更久建议尽早提交邮箱收不到审核邮件检查垃圾箱或联系 Lemur Project 团队跟进磁盘不够怎么办先下载英文 A 段也可按 segment 分批次下载爬虫报文件不存在检查目录是否严格符合语言/segment/目录层级一定要 SSD 吗是的README 明确要求机械硬盘会导致爬虫效率极低搞定 ClueWeb22 数据集申请与下载你就完成了 Crawl4LLM 最艰难的前置准备。接下来配置好环境、写好 YAML 配置一个专属于你的高质量预训练语料爬虫就能正式开跑了【免费下载链接】Crawl4LLMOfficial repository for Craw4LLM: Efficient Web Crawling for LLM Pretraining项目地址: https://gitcode.com/gh_mirrors/cr/Crawl4LLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门