大模型开发者收藏!基于RAG的AI搜索技术实践与落地详解
搜索演进思路**1.**搜索三个阶段1 第一阶段被动搜索典型应用谷歌等传统搜索引擎。核心特点用户主动发起搜索系统基于 RAG 技术增强搜索或总结结果交互随搜索结果返回而结束。局限性用户查询词简短模型难充分理解意图无法预判用户后续需求。2 第二阶段半主动搜索典型形式对话式交互如 Kimi、DeepSeek 等应用。核心特点提供持续对话界面支持用户多轮提问与交互如展示 “其他人还在问” 引导进一步问询。结合多模态对话技术提升用户活跃度DAU与体验。商业模式潜力通过替代传统搜索实现盈利目前处于开发阶段。3 第三阶段主动搜索理想目标系统预判用户需求无需用户明确表达。典型场景汽车等领域如监测到胎压异常时主动推送处理方案、胎压值及服务通道。落地特点依托后台数据监测可能在垂直领域如车联网优先实现。**2.**从被动搜索到主动搜索1 被动搜索阶段第一阶段的局限仅提供 “是什么” 的检索与总结如告知用户车辆有 “运动模式”无法满足用户 “如何做” 的操作需求如驾驶模式设置步骤。2 向半主动搜索过渡第二阶段的改进增加服务通道在 RAG 总结后提供操作入口如点击按钮跳转 APP 设置驾驶模式形成 “搜索 总结 服务通道” 模式。交互延伸思考发现用户期望系统自动完成任务如识别设置意图后直接协助调整驾驶模式而非仅提供手动入口引出主动搜索构想。3 主动搜索阶段第三阶段的目标系统预知用户意图经用户确认后自动执行后续动作如监测胎压异常时主动完成报警、推荐服务并联动车载系统处理。4 当前实践的核心问题与解决方案核心问题用户需求从 “信息获取” 转向 “任务完成”传统搜索仅停留在信息层面缺乏行动闭环。解决方案多模态结果整合结合自然搜索结果实体检索、相关性检索、自动化信息卡片如胎压数值与 RAG 智能助手生成内容统一展示。交互形态设计顶层RAG 生成总结性信息如驾驶模式功能介绍中层直接展示服务通道如 “立即设置驾驶模式” 按钮底层列出自然搜索结果如其他用户常见问题。技术实现关键点大模型训练样本要求需超过 1 万条高质量标注样本如用户意图 - 操作路径映射数据样本质量直接影响大模型微调效果。当前定位仍处于从第一阶段向第二阶段过渡状态需通过持续优化对话交互与任务执行能力逐步向主动搜索演进。02关键技术落地实践**1.**意图识别和请求改写/扩充1添加自定义 Token (Add Token)多数开源大模型允许添加自定义 Token。这对于处理特定领域的词汇至关重要例如一些行业术语或特有表达如讲者提到的“驾象”作为“代驾”的一种更专业的说法这些词汇通用大模型往往难以准确理解。通过增添专用 Token能确保模型正确把握这些词汇的特定含义避免歧义。2监督微调(SFT - Supervised Fine-Tuning)进行常规的监督微调训练。3直接偏好优化 (DPO - Direct Preference Optimization)SFT 在处理许多“疑难案例”hard cases时效果有限——这些案例即便是人工也很难明确归类。DPO 作为一种类强化学习的训练方法能让模型在两个选项A/B中学会选择相对更优的一个从而提升模型的泛化能力。模型训练完成后便会部署上线提供一个在线模型接口。除此之外我们还建立了一套线上实时干预策略。例如当业务部门新增一个活动或词汇而模型在训练阶段未曾见过时该策略能够通过分钟级统计分析用户交互行为如用户搜索某新词后总是点击某个特定活动链接来推断用户意图进而实时校正线上搜索结果。在性能方面最初线上模型的接口响应时间为 350 毫秒。我们认为对于用户查询Query这一初始交互而言此延迟偏高。为此我们引入了基于 Redis 的缓存机制请求首先访问缓存若命中则在 10 毫秒内直接返回结果若未命中再调用耗时 350 毫秒的实时模型接口。基于缓存的引入我们曾考虑是否可以利用一个更大、更精确的模型来生成缓存内容以期获得更快的线上响应和更准的缓存结果。然而讲者示意此方案已调整或放弃我们发现现有的小尺寸模型已能达到很高的准确率最新的意图识别模型准确率约 96%因此无需采用更大的模型。当前做法是小模型直接在线上调用其结果异步存入缓存这样做也保证了数据的一致性避免了使用多模型可能导致的结果不一致问题。关于提示工程Prompt Design我们认为其整体设计与定义相对直接。而在 DPO 训练的样本设计方面我们会筛选出“疑难案例”并将其构建为“采纳”chosen与“舍弃”rejected的样本对用以指导模型学习正确的偏好。最终我们线上服务的平均响应时间AVG控制在 250 毫秒左右表现已相当迅速。在进行压力测试包含大量长尾请求时响应时间可能会略有增加。**2.**多模态向量检索1文本向量检索我们最初致力于实现文本的向量检索。这项通用的文本向量技术旨在覆盖社区资讯、服务等业务场景下特定话术的召回以及商品信息的检索。为此我们进行了数月的数据样本生成与聚合工作。在选择基础模型Base Model方面初期我们选用了当时中文开源领域表现最佳的 BGE 1.5 模型。目前我们正在评估 GTE 模型的新版本此版本尚在离线评估未正式上线。针对 BGE 版本我们选取了最优模型并在内部的召回率Hit Rate测试中验证了其最佳效果后采纳。样本积累主要通过三种途径线上疑难案例case的挖掘、规则生成以及人工标注。基于这些累积的大量样本我们进行了模型训练。训练过程中我们注重样本多样性的调控确保不同业务类型的样本数量按比例分配。训练方法上主要采用批量内负采样in-batch negative sampling策略并结合对比学习损失函数contrastive loss等方法。训练完成后模型在各个业务领域的测试集上召回率基本都能达到95%左右。我们还进行了线上 A/B 实验在其他条件一致的情况下仅替换向量模型也观察到了显著的指标提升。2文本检索的局限与多模态的需求尽管文本向量检索模型取得了良好效果但我们发现仍存在一些问题无法解决内容供给的挑战许多内容如图文帖子文字描述极少甚至只有一张图片导致文本向量模型因缺乏文本信息而难以召回。跨模态排序难题如果单独为图像建立向量模型会发现图像向量与文本向量因其向量空间不一致无法直接进行统一排序和度量难以解决跨模态检索的需求。用户需求的多样性用户实际上存在许多多模态的检索需求。这些因素促使我们研发多模态向量检索技术。3图文多模态向量检索的探索当前阶段我们主要聚焦于图文形式的跨模态检索技术。我们测试了多种开源模型其中 BLIP-2 模型表现相对突出尽管业界公认谷歌的某模型效果最佳但其并未开源。我们选用了一个表现较好的中文多模态模型版本并利用我们特有的一些图片数据进行测试效果显著。该模型效果出色的一个主要原因在于其使用了超过两亿张高质量图文对进行训练因此在我们的业务场景如充电桩、放电站等特有图片中也表现良好。然而其在特定相关领域的样本仍然不足。为此我们正积极汇集公司内部所有的 UGC用户生成内容、PGC专业生成内容及其他图片资源并通过 OCR、以及其他辅助手段生成训练样本以持续优化我们的领域专用多模态模型。4混合检索策略与系统架构拥有多模态向量模型后我们在线上实际应用时并非单纯依赖向量检索而是保留了传统的文本检索能力。具体实现上我们主要依托腾讯云 Elasticsearch (ES) 8.x版本的向量搜索平台。之所以同时保留文本检索和向量检索是因为我们发现对于高精度、用户输入已非常具体的查询传统文本检索的效果往往优于向量检索。我们不希望因为引入向量检索而牺牲这类简单、明确场景下的用户体验。因此我们的整体检索流程如下多路并行召回用户的原始查询及经过意图模型扩充后的查询会同时触发文本检索和向量检索包括多模态向量。结果聚合召回的多路结果会进行聚合。我们采用优先级队列的方式优先保证文本检索的结果以应对高精度查询场景。重排序Re-rank聚合后的初步结果会经过一个重排序模型进行优化。知识供给大模型最终排序后的结果作为知识输入提供给我们的大语言模型进行后续的理解和生成。这构成了从用户请求理解到知识检索阶段的完整链路。**3.**大模型技术1 基座模型的选型和开发思路选择合适的大型语言模型是首要步骤。我们的考量因素主要包括模型自身指标关注模型在各类公开评测和排行榜上的表现尤其重视其在中文处理上的效果。同时模型的参数规模最好能覆盖不同需求以适应不同阶段的任务。后续支持与生态倾向于选择有稳定迭代支持、生态系统相对完善的模型避免选择发布后便无下文的模型。安全合规性至关重要的一点是所有面向消费者的2C大模型应用均需在中国工信部进行备案。因此所选模型必须是已备案的这能显著降低合规风险。国内企业多选用如 Qwen通义千问等已备案的开源模型。经过筛选对比如 DeepSeek、Kimi 以及公司自研的 Nomi 等模型的开源版本我们最终选择了 Qwen 作为基础模型。基于 Qwen 定制化与意图模型类似添加领域特定的 Token。由内部团队如 Nomi 团队进行包含公司业务背景知识的预训练打造出一个已内化了部分自有知识的定制版 Qwen。标准 Qwen SFT 微调 直接使用标准版 Qwen结合特定样本进行监督微调SFT。所有路径最终都会通过业务指标进行评估。2高质量样本的生成与评估——核心挑战在大型语言模型训练中最核心的挑战在于获取高质量的训练样本而非模型本身许多优秀模型已开源。为解决此问题我们设计了一个名为“数据生成与评估 Agent”的自动化系统核心组件该 Agent 由两个 DeepSeek R1 模型构成经测试DeepSeek R1 在此类任务上效果优于 Qwen-7B 等其他模型。工作流程模型 A生成器接收任务定义和相关输入如用户查询生成初始数据样本。模型 B评估器对模型A生成的样本进行评估判断其是否满足任务及样本定义的要求如专业词汇是否清晰、任务描述是否准确等。迭代优化模型 B 向模型 A 提供“自反思”式的反馈指出需改进之处。模型A根据反馈重新生成样本。此循环持续进行直至模型B判定样本“可用”达到预设阈值或达到最大迭代次数限制避免无限循环。一旦可用系统便输出样本并标记其可用性。约 80% 的训练样本通过此 Agent 批量生成。其他样本来源人工标注通过搜索结果满意度标注等定期任务积累。线上反馈线上助手设有“满意/不满意”反馈按钮用户的不满意反馈将作为负样本。样本的二次分析与质控获取样本后我们还会利用自研工具进行第二轮分析主要从以下三方面评估数量是否满足不同模型尺寸的需求如小模型 6000 条大模型 1 万条以及各任务类型的样本量是否充足。多样性词汇丰富度如词频分布、同义词/近义词的覆盖情况。任务覆盖多样性是否覆盖了足够多种类的任务。格式多样性除了预设格式外是否包含其他格式的样本。业务覆盖多样性是否覆盖了足够多的业务场景。质量内部一致性例如同一查询不应对应多个内容冲突的样本。准确性检查错别字和格式问题。最后进行人工抽样检查。通过上述流程我们能够相对快速地获取大量高质量的训练样本。3大型语言模型的训练对于使用开源模型的“调用派”我们的工作重点在于样本的组合与设计以及训练参数的调优。样本组合完全随机打乱适用于小尺寸模型。由于小模型记忆力较差随机打乱有助于其学习若分阶段按比例投喂可能导致遗忘早期学习内容。按类型、比例分阶段适用于大尺寸模型。因大模型对样本需求量大一次性加载所有样本会导致内存不足故采用按比例、分阶段加权训练。Prompt****格式探索以 LLaMA-Factory 等框架为例简单输入输出式对小尺寸模型效果较好。系统指令System Prompt抽取式对大尺寸或复杂任务将系统指令描述任务要求抽取出来。原因大模型指令遵循能力强无需在每轮对话中重复指令工程实现上更简洁只需填充输入槽位无需每次都传入大量指令文本。训练任务与方法LoRA (Low-Rank Adaptation)主要用于大尺寸模型受限于 GPU 资源大部分 GPU 资源需优先保障自动驾驶 ADAS 研发。SFT (Supervised Fine-Tuning)主要用于中小型模型实践证明 SFT 能使小模型达到非常好的效果。DPO (Direct Preference Optimization)用于处理疑难案例和模型校准。训练参数调整可调参数不多主要包括 Epochs、Learning Rate 等。核心依然是拥有高质量的样本数据。通过精心的样本准备和恰当的训练策略即便基于开源模型也能训练出表现优异的领域专用大模型。数据流转与 RAG 系统持续优化机制**数据挖掘阶段补足供给短板**当用户请求进入后系统会分析当前内容供给中存在的不足之处。通过各类数据挖掘手段补充缺失的内容供给以此弥补 RAG 系统在知识覆盖上的短板。内容生成后的线上反馈与优化循环系统包含线上反馈机制。如果某一生成结果被用户多次标注为“不满意”系统会自动将其下线不再展示。这些被标记为“不满意”的结果将作为负向样本用于后续离线的 DPODirect Preference Optimization训练以持续优化模型效果。所有内容在对外展示前都会经过安全合规审查。只有符合规范的内容才会被展示以规避潜在的法律风险。数据时序关系该系统采用 Agent 化的架构进行服务其交互流程如下用户请求与意图识别用户发起请求后系统首先调用后端服务分析用户意图判断是否命中预设的某个 Agent 的处理范围。若未命中任何 Agent 的意图则直接返回常规的自然搜索结果。若成功命中 Agent 意图则进入下一步。信息召回系统尝试根据意图召回相关信息。若无有效召回结果则流程终止可能返回自然结果或预设的兜底回复。若召回成功则继续。Agent****调用与结果选择多 Agent 协作系统会异步调用相关的两个或多个Agent。每个 Agent 处理后其返回的初始信息如首个 Token会表明自身是否成功匹配并处理了该请求即是否“命中”。Agent 之间存在优先级通过优先级队列管理。系统会首先采纳优先级最高的已命中 Agent 所生成的结果。若最高优先级的 Agent 未命中则依次检查次级优先级的 Agent。如果所有相关 Agent 均未能有效命中系统将返回预设的兜底话术。**流式输出**为提升用户体验鉴于大模型响应可能较慢Agent 的回复内容采用流式数据的方式逐步返回给用户。增强信息与服务引导在主要回复内容流式输出完毕后系统会进一步判断是否存在对应的“服务通道”如一键跳转至某项具体服务或功能例如之前提及的“Nomi”相关服务和“参考资料”。如果存在相关的服务通道会将其展示给用户以便用户进行下一步操作。这构成了从数据采集、反馈优化到实时 Agent 交互与服务提供的完整闭环。03总结展望1. RAG****落地过程中的核心经验首先高质量的参考资料是基础。他指出如果召回的资料本身杂乱无章后续的生成结果也难以保证。这意味着传统的搜索数据处理工作如数据清洗、预处理等仍然是不可或缺的一环。其次大量且优质的训练样本至关重要。样本需要做到“多”与“精”数量上建议在一万条以上并且需要均匀分布有效覆盖各个相关的业务领域。再次应采用多 Agent 并行而非单一全能 Agent 的策略。试图用一个 Agent 处理所有任务会极大地增加工程实现的复杂度和交付难度。推荐采用多个专门的 Agent 并行工作各自专注于自身领域例如他们实践中使用的“加电 Agent”和“用车 Agent”**2.**对于大模型技术的未来趋势一是向多模态技术融合。大模型技术正持续向多模态方向发展与融合以满足用户日益增长的对多模态交互的需求。二是大模型应具备自我进化能力。虽然他们已通过用户实时反馈进行小时级 DPO 训练来间接实现此能力但认为目前 DPO 训练对模型整体参数的改进幅度仍然有限未来需要更强的自进化机制。三是个性化能力的深化。鉴于不同用户关注点各异未来需要探索如何将传统的个性化推荐技术与大模型的能力有效融合提供更贴合用户需求的服务。普通人如何抓住AI大模型的风口为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。AI大模型开发工程师对AI大模型需要了解到什么程度呢我们先看一下招聘需求知道人家要什么能力一切就好办了我整理了AI大模型开发工程师需要掌握的知识如下大模型基础知识你得知道市面上的大模型产品生态和产品线还要了解Llama、Qwen等开源大模型与OpenAI等闭源模型的能力差异以及了解开源模型的二次开发优势以及闭源模型的商业化限制等等。了解这些技术的目的在于建立与算法工程师的共通语言确保能够沟通项目需求同时具备管理AI项目进展、合理分配项目资源、把握和控制项目成本的能力。产品经理还需要有业务sense这其实就又回到了产品人的看家本领上。我们知道先阶段AI的局限性还非常大模型生成的内容不理想甚至错误的情况屡见不鲜。因此AI产品经理看技术更多的是从技术边界、成本等角度出发选择合适的技术方案来实现需求甚至用业务来补足技术的短板。AI Agent现阶段AI Agent的发展可谓是百花齐放甚至有人说Agent就是未来应用该有的样子所以这个LLM的重要分支必须要掌握。Agent中文名为“智能体”由控制端Brain、感知端Perception和行动端Action组成是一种能够在特定环境中自主行动、感知环境、做出决策并与其他Agent或人类进行交互的计算机程序或实体。简单来说就是给大模型这个大脑装上“记忆”、装上“手”和“脚”让它自动完成工作。Agent的核心特性自主性能够独立做出决策不依赖人类的直接控制。适应性能够根据环境的变化调整其行为。交互性能够与人类或其他系统进行有效沟通和交互。对于大模型开发工程师来说学习Agent更多的是理解它的设计理念和工作方式。零代码的大模型应用开发平台也有很多比如dify、coze拿来做一个小项目你就会发现其实并不难。AI 应用项目开发流程如果产品形态和开发模式都和过去不一样了那还画啥原型怎么排项目周期这将深刻影响产品经理这个岗位本身的价值构成所以每个AI产品经理都必须要了解它。看着都是新词其实接触起来也不难。从0到1的大模型系统学习籽料最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师吴文俊奖得主给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】适学人群应届毕业生无工作经验但想要系统学习AI大模型技术期待通过实战项目掌握核心技术。零基础转型非技术背景但关注AI应用场景计划通过低代码工具实现“AI行业”跨界。业务赋能突破瓶颈传统开发者Java/前端等学习Transformer架构与LangChain框架向AI全栈工程师转型。AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。基础篇包括了大模型的基本情况核心原理带你认识了解大模型提示词Transformer架构预训练、SFT、RLHF等一些基础概念用最易懂的方式带你入门AI大模型进阶篇你将掌握RAGLangchain、Agent的核心原理和应用学习如何微调大模型让大模型更适合自己的行业需求私有化部署大模型让自己的数据更加安全项目实战篇会手把手一步步带着大家练习企业级落地项目比如电商行业的智能客服、智能销售项目教育行业的智慧校园、智能辅导项目等等但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下AI时代企业最需要的是既懂技术、又有实战经验的复合型人才**当前人工智能岗位需求多薪资高前景好。**在职场里选对赛道就能赢在起跑线。抓住AI这个风口相信下一个人生赢家就是你机会永远留给有准备的人。如何获取这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】