D11 | Embedding 模型选型 + 文档切片策略
文章目录D11 | Embedding 模型选型 + 文档切片策略写在前面一、为什么 Embedding + 切片决定 RAG 质量1.1 一个真实场景1.2 Embedding 模型决定"语义"层1.3 切片策略决定"粒度"层二、5 大主流 Embedding 模型横评2.1 全景对比表2.2 详细评测① OpenAI text-embedding-3-small② OpenAI text-embedding-3-large③ bge-large-zh-v1.5(BAAI)④ m3e-large(Moka)⑤ mxbai-embed-large⑥ Cohere embed-multilingual-v32.3 中文场景实测对比三、Embedding 选型决策树3.1 选型 3 问3.2 实际项目建议四、Embedding 实战代码4.1 OpenAI Embedding(API 方式)4.2 bge-large-zh(本地部署)4.3 m3e-large(本地部署)4.4 切换 Embedding 的代价五、文档切片策略:3 种方法对比5.1 为什么必须切片?5.2 策略 ①:固定字符数5.3 策略 ②:递归切片(LangChain 默认)5.4 策略 ③:语义切片5.5 3 种策略对比5.6 实战:同一份文档,3 种切片结果六、切片大小怎么定?6.1 经验值6.2 chunk_size 影响6.3 重叠度影响6.4 实测:切片大小对 RAG 质量影响6.5 自动调优方法七、切片常见问题坑 1:表格被切断坑 2:代码块被切断坑 3:英文+中文混合坑 4:元数据丢失八、实战:RAG 调优案例8.1 原始状态8.2 问题诊断8.3 调优过程调整 1:换 Embedding 模型调整 2:改切片策略8.4 调优结果九、这一篇的小结9.1 5 个 Key Takeaway9.2 决策树9.3 思考题下篇预告D11 | Embedding 模型选型 + 文档切片策略系列:《60 天 AI 全栈转型:传统开发者的大模型工程师之路》(S1 模块 3 · RAG 实战 ③)作者:刘一说(haohaizi_liu)| 15 年开发管理经验配套代码:https://gitcode.com/road-emblem/60-days-ai-stack写在前面D9 我们讲了 RAG 是什么,D10 讲了向量数据库怎么存——RAG 架构的"骨架"已经搭好了。但RAG 真正的"质量"取决于两个环节:Embedding 模型——把文字变成"语义"准不准文档切片——长文切得对不对我见过太多 RAG 项目,技术栈用了 LangChain + Chroma + GPT-4o,结果答非所问——一查,问题出在 Embedding 选错 + 切片策略不对。这一篇把这两个"隐形但关键"的环节讲透。读完你会拿到:5 大主流 Embedding 模型横评(OpenAI / bge / m3e / mxbai / cohere)中文场景选型决策树3 种切片策略对比(固定 / 递归 / 语义)切片大小调