如何快速上手ChineseErrorCorrector?从零基础到第一次中文文本纠错的5分钟完整教程
如何快速上手ChineseErrorCorrector从零基础到第一次中文文本纠错的5分钟完整教程【免费下载链接】ChineseErrorCorrector一个面向中文文本纠错任务的综合平台集学术研究、模型训练、模型评测和推理部署于一体文本纠错新Sota。 2026 ACL Main Oral 项目地址: https://gitcode.com/gh_mirrors/ch/ChineseErrorCorrectorChineseErrorCorrector 是一个面向中文文本纠错任务的综合平台集学术研究、模型评测、推理部署与数据增强于一体覆盖**拼写纠错CSC与语法纠错CGEC**两大核心方向旗舰模型已登上 ACL 2026 Main Oral。下面用约 5 分钟带你从零基础完成第一次中文文本纠错。一、先认识这个项目它到底能做什么用一张表快速建立全局认知能力一句话说明适合谁 推理部署一行代码调用 4B 纠错大模型自动返回纠错结果 错误类型 修改原因想立刻见效的你 数据增强14 种语法错误一键造错2024 CCL 冠军方案想造训练数据的人 模型评测Common Errant 评测工具覆盖 80 种语言想对比模型的人 模型训练开源 34 万 COT 数据 200 万监督数据支持继续微调进阶研究者 新手请直奔「推理部署」跑通第一次纠错后其余能力可后续按需解锁。二、一键安装步骤3 步搞定环境打开终端依次执行国内用户可在pip后追加阿里云镜像源加速# 1) 创建并激活 conda 环境 conda create -n zh_correct -y python3.10 conda activate zh_correct # 2) 安装项目依赖 pip install -r requirements.txt依赖清单见 requirements.txt已预装vllm、transformers、openai等关键组件。若你想先体验「数据增强」只需额外执行pip install ChineseErrorCorrector即可。三、最快方式vLLM 服务 main.py 跑通第一次中文文本纠错这是项目推荐的工程化主链路用 vLLM 把 4B 大模型起成 OpenAI 兼容服务再用仓库里的main.py批量纠错。第 1 步启动模型服务需 NVIDIA GPU# 先拉取代码 git clone https://gitcode.com/gh_mirrors/ch/ChineseErrorCorrector cd ChineseErrorCorrector # 启动 4B 旗舰模型服务 CUDA_VISIBLE_DEVICES0 vllm serve twnlp/ChineseErrorCorrector4-4B \ --port 8000 --max-model-len 2048第 2 步执行纠错python main.py第 3 步看懂你的第一次纠错结果[{source: 对待每一项工作都要一丝不够。, target: 对待每一项工作都要一丝不苟。, errors: [(够, 苟, 12)], error_type: 错别字, error_reason: 原句中的够应为苟属于同音字误用……}, {source: 大约半个小时左右, target: 大约半个小时, errors: [(左右, , 6)], ...}]每条结果都包含原句source、纠错句target、逐字改动errors、错误类型error_type和修改原因error_reason。推理主入口是ChineseErrorCorrector/main.py它通过 OpenAI 兼容接口调用大模型见ChineseErrorCorrector/llm/infer/openai_infer.py。 想换模型或接口地址改ChineseErrorCorrector/config.py里的OPENAI_MODEL等字段或用环境变量CEC_OPENAI_BASE_URL / CEC_OPENAI_API_KEY / CEC_OPENAI_MODEL覆盖即可。四、没有 GPU试试 transformers 本地单机纠错若只想在单机调试可用transformers直接加载模型核心代码如下pip install -U transformers torchfrom transformers import AutoModelForCausalLM, AutoTokenizer import torch model_name twnlp/ChineseErrorCorrector4-4B tokenizer AutoTokenizer.from_pretrained(model_name, trust_remote_codeTrue) model AutoModelForCausalLM.from_pretrained( model_name, torch_dtypetorch.bfloat16, device_mapauto, trust_remote_codeTrue ) instruction (假如你是一名专业的纠错专家请分析输入句子的语法错误类型和修改原因 并只输出纠正后的语句错误类型如下错别字、词语搭配错误、词性错误、 语序错误、成分残缺、成分赘余、关联词使用错误、指代不明、语义逻辑不通、无误。) messages [{role: system, content: instruction}, {role: user, content: 对待每一项工作都要一丝不够。}] text tokenizer.apply_chat_template(messages, tokenizeFalse, add_generation_promptTrue) inputs tokenizer([text], return_tensorspt).to(model.device) out model.generate(**inputs, max_new_tokens512, do_sampleFalse, repetition_penalty1.1) print(tokenizer.decode(out[0][len(inputs.input_ids[0]):], skip_special_tokensTrue))五、进阶玩法14 种错误一键数据增强 跑通纠错后你会发现平台另一大亮点——2024 CCL 冠军的一键语法错误增强工具。它能把一句正确的话随机“造”成含特定错误的句子用来合成训练语料它共支持14 种错误类型覆盖缺字漏字、错别字、成分残缺、语序不当、搭配不当等对照表如下是训练自己纠错模型的得力助手使用方式极简核心类为ChineseErrorCorrector/utils/dat.py中的GrammarErrorDatfrom ChineseErrorCorrector.utils.dat import GrammarErrorDat dat GrammarErrorDat() print(dat.lack_word(小明住在北京)) # 缺字漏字 print(dat.error_word(小明住在北京)) # 错别字 print(dat.lack_punctuation(小明住在北京)) # 缺少标点完整 14 种 API 说明见 ChineseErrorCorrector/README_DAT.md。六、新手最常卡住的 3 个点现象原因解决办法启动 vLLM 报错显存不足 / 未装 CUDA 版 torch降低--gpu-memory-utilization或改用 transformers 方式main.py连不上服务服务未起或端口不对确认 8000 端口在监听或改config.py的OPENAI_BASE_URL结果缺error_type用了 v3 模型名字带4-4B才返回错误类型与原因 想省算力可在config.py把USE_DETECTOR设为True启用 ELECTRA 字级门控仅对疑似有错的句子调用 4B 大模型见 README_ELECTRA.md。七、结语你的纠错之路才刚开始恭喜你已完成从零基础到第一次中文文本纠错的完整闭环装环境 → 起服务 → 跑出带错误类型的纠错结果 → 了解数据增强。接下来可以继续探索 查阅 README_paper.md 里的中文纠错论文清单做学术调研 用ChineseErrorCorrector/scores/下的 Common Errant 评测工具对比不同模型效果 用开源数据 LLaMA-Factory 微调训练属于你自己领域的纠错模型ChineseErrorCorrector 作为一站式中文文本纠错平台正持续刷新纠错 SOTA祝你在中文纠错之路上越走越远 ✨【免费下载链接】ChineseErrorCorrector一个面向中文文本纠错任务的综合平台集学术研究、模型训练、模型评测和推理部署于一体文本纠错新Sota。 2026 ACL Main Oral 项目地址: https://gitcode.com/gh_mirrors/ch/ChineseErrorCorrector创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考