拓冰建站拓冰建站
首页 / 资讯中心 / 正文

12M条指令数据的背后:构建聚宝盆(Cornucopia)中文金融领域数据集的完整方法

12M条指令数据的背后构建聚宝盆(Cornucopia)中文金融领域数据集的完整方法【免费下载链接】Cornucopia-LLaMA-Fin-Chinese聚宝盆(Cornucopia): 中文金融系列开源可商用大模型并提供一套高效轻量化的垂直领域LLM训练框架(Pretraining、SFT、RLHF、Quantize等)项目地址: https://gitcode.com/gh_mirrors/co/Cornucopia-LLaMA-Fin-Chinese聚宝盆Cornucopia-LLaMA-Fin-Chinese是一个基于 LLaMA 的中文金融领域大模型开源项目其核心成果之一就是一套 12M 规模的中文金融领域数据集。本文将完整拆解这套金融指令数据集是如何从公开问答、爬取数据一路构建到 LoRA 微调落地的帮助新手快速理解金融 LLM 数据集构建的全流程。一、为什么要专门构建中文金融领域数据集通用大模型直接回答金融问题时经常出现答非所问甚至胡言乱语的情况。聚宝盆的做法是用中文金融指令微调Instruction-tuning让 LLaMA 学会金融领域的问答能力。而微调效果的上限很大程度上取决于指令数据的质量与规模——这正是 12M 条指令数据集的意义所在。二、数据来源两条主线并行项目官方在 README 中明确了数据集的两条构建主线数据主线说明 中文金融公开问答数据金融公开问答数据集覆盖保险、理财、股票、基金等主题️ 爬取的金融问答数据爬取网站问答数据补充长尾业务场景两者共同支撑起 V1.0 版本的训练语料覆盖保险、理财、股票、基金、贷款、信用卡、社保等常见金融业务场景。项目还规划了引入中文金融知识图谱、CFLEB 金融数据集等来源并持续用 GPT3.5/4.0 接口做数据优化与扩充。 小贴士从公开渠道收集数据后建议先做去重 纠错 脱敏三步清洗再进入指令集构建环节。三、指令数据格式标准三字段结构这套金融指令数据集采用业界通用的指令-输入-输出三字段 JSON 结构。仓库中提供了示例文件 instruction_data/fin_data.json可以直接打开查看真实样本例如{ instruction: 可转债风险大吗和股票比风险大还是小, input: , output: 可转债和股票相比来说风险是比较小一些的打新债需要先开账户…… }instruction金融问题指令input可选的补充上下文简单问答场景留空即可output期望的标准回答这种结构的最大好处是通用——无论是 Alpaca 还是金融垂直场景只要换成自己的 JSON 文件同一套训练脚本就能复用。想用自己的数据微调只需按 fin_data.json 的格式构建数据集即可。四、提示词模板设计让模型说金融话数据准备好后还需要一个金融味的提示词模板。项目通过templates/目录管理多套模板核心是 fin_template.json{ prompt_no_input: 下面是一个问题运用金融财经知识来正确回答问题.\n### 问题:\n{instruction}\n### 回答:\n, response_split: ### 回答: }模板在训练和推理时被 utils/prompter.py 中的Prompter类加载训练时把三字段数据拼接成完整 prompt推理时用response_split切分模型输出、只保留真正的答案。项目同时保留了alpaca、alpaca_legacy、alpaca_short等通用模板方便对照实验。五、轻量化训练框架LoRA Int8 微调数据与模板就绪后训练入口是 tuning_train.py一键脚本为 scripts/finetune.sh关键参数如下参数取值作用LoRA 目标模块q_proj、v_proj只训练注意力投影层大幅省显存精度Int8 加载 FP16单卡 A100-80G 即可跑通batch_size64显存占用约 40Gnum_epochs10完整轮次cutoff_len512训练序列长度训练完成后只产出两个小文件adapter_config.json和adapter_model.bin推理时叠加到基模型即可部署成本极低。推理脚本见 scripts/infer.sh多模型横向对比见 scripts/comparison_test.sh。六、效果验证金融问答对比项目提供了测试用例 instruction_data/infer.json覆盖老年人理财还是存定期好股票基金能否当天买卖等高频问题。官方对比显示原始 LLaMA 只能给出泛泛而谈甚至直接回一句英文而基于 12M 指令数据微调的 Cornucopia 模型能准确说出 T1 交易规则、风险等级划分等专业细节表现已可对标文心一言、讯飞星火等商业产品。七、如何贡献你自己的金融数据如果你的团队有优质金融语料可以参与数据集共建。完整流程写在 HOW_TO_CONTRIBUTE.md 中核对官方数据集的三字段格式将数据集上传到数据托管平台新建标题为[Contributing Data]:的 issue说明数据规模与内容在 issue 中附上数据集链接。欢迎扫码加入金融领域 LLM 交流群与开发者一起探讨中文金融数据集构建、LoRA 微调与大模型落地实践。写在最后从公开问答 爬取数据出发经过清洗、三字段结构化、金融提示词模板、LoRAInt8 轻量化微调聚宝盆把 12M 条指令数据变成了一款可商用的中文金融问答模型。这套数据-模板-框架的完整方法论同样适用于医疗、法律等其他垂直领域的数据集构建。【免费下载链接】Cornucopia-LLaMA-Fin-Chinese聚宝盆(Cornucopia): 中文金融系列开源可商用大模型并提供一套高效轻量化的垂直领域LLM训练框架(Pretraining、SFT、RLHF、Quantize等)项目地址: https://gitcode.com/gh_mirrors/co/Cornucopia-LLaMA-Fin-Chinese创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门