拓冰建站拓冰建站
首页 / 资讯中心 / 正文

提示词工程实战:10个技巧与模板库,让大模型输出稳定可靠

提示词工程这几年被讨论得很多但真正上手之后你会发现核心没那么玄把需求讲到模型一次能听懂、一次能做对。我在业务里调过不下上百条提示词最大的感受是同样一个模型、同一套参数提示词写得好不好效果能差出一个量级。这篇文章把我实测过、可以直接照搬的10个技巧整理出来每个都附上了用法说明后面还有一套配套的模板库结构。内容不涉及复杂理论适合正在接触大模型应用、被输出不稳定折磨过的同学也适合想给团队统一写法的技术负责人。1. 提示词工程的整体思路先想清楚再写提示词1.1 别急着堆指令先确认任务类型提示词写不好很多是因为任务类型没有在大脑里先过一次。同样是“分析一下这篇文章”可能是情感分类、可能是指标抽取、可能是摘要生成三种任务的写法完全不同你不能指望用一套话术通吃所有情况。我接到需求的第一件事是把任务归到几个常见类别里生成类写文案、写代码、抽取类提取关键信息、分类类判断情感或主题、改写类润色、压缩、翻译、推理类数学、逻辑、决策。定了类型再去决定要不要给示例、要不要拆步骤、要不要加思维链。分类任务要准备标签列表和示例抽取任务要明确字段名生成任务要有风格约束和边界推理任务要要求先思考再回答。哪怕只是多花两分钟做这个归类后面写提示词的方向就已经清楚了。我见过很多人一上来就写“请你认真分析”结果模型不知道你要分析出什么结构、什么粒度自然给不出稳定答案。1.2 模板库不是一次性的而是长期资产很多人不愿意维护模板库觉得浪费时间。但提示词在实际业务里是高频复用物同一个客服工单分类模板今天可能用十几次下个月换个项目还要用。如果每次都从零开始琢磨成本是复利的。模板库的价值不只是省时间更重要的是统一输出质量、降低新人的上手门槛、给后续优化提供一个可比较的基线。我的模板库结构很简单按任务类型分文件夹每个模板包含适用场景、提示词正文、变量说明、输出示例、版本记录。这个结构看起来平常但坚持用两周以后你会发现它已经不是一个“抄作业”的地方而是一份带测试记录的知识库。当模型升级或者业务需求变化时你只需要改一个模板而不是翻遍聊天记录找当时是怎么写的。2. 第一组技巧把指令写清楚2.1 技巧1给模型一个具体的角色角色设定的作用不是让模型“扮演”而是压缩语境。你写“你是一名有十年经验的电商客服主管”模型会启动与之相关的表达风格、知识范围和判断标准。但光给身份不够要连语气、专业侧重、回答边界一起给。比如“你是一名电商客服主管擅长处理客户投诉回答时要礼貌、简短、不推卸责任并且优先给出可操作的解决方案。” 这样角色就不再是一顶空帽子而是实打实的约束。注意角色不要长两三句就够。我见过有人写一整段人物小传效果并不会更好反而会挤占模型的注意力让它把精力放在“这个人设”上而不是你要它干的事。角色设定的最佳状态是让模型一看到身份就知道用什么语域、什么标准来回答但又不至于被身份带跑。2.2 技巧2明确输出格式最好直接给范例输出格式是最容易见效的一招。很多人写“请用JSON格式返回”模型可能返回带注释的JSON或者字段名对不上。后来我改用这种方式“输出格式JSON对象字段包括 sentimentpositive/negative/neutral、summary不超过30字、keywords最多5个关键词。示例{sentiment:positive,summary:服务态度好发货快,keywords:[态度好,发货快]}”。给范例比描述格式有效得多模型少走弯路程序解析也更稳定。这里有个细节描述格式时说“不超过30字”模型对字数的感知并不精确它可能给出35字甚至40字。你要么在范例里做一个严格符合要求的样本让模型照着模仿要么在程序侧做二次校验不要指望模型能像尺子一样量字数。格式约束的优先级很高我一般会把格式说明放在任务描述后面而不是放在所有大段背景之后。2.3 技巧3用示例让小模型也能学会套路如果任务涉及分类、抽取、格式转换示例几乎是最强的约束。一个写好的示例能顶三条规则。我自己的经验是准备三个示例一个正常情况一个边界情况一个反面情况。最后一个示例最好跟真实输入的结构接近模型会把它当成最近的参照物。比如客服工单分类我会给一个含多次转交的复杂工单示例这样分类器就不会一味按最后的处理结果来分类。示例怎么选直接决定效果。你不能只给“标准答案”类型的示例还要给那些让人犹豫的案例。比如一个评价说“物流慢但客服态度好”这算好评还是中评如果你希望模型把它识别为中评就把这个例子放进提示词里并给出判断理由。模型会从示例里学会你的尺度而不是自己发明一套尺度。2.4 技巧4设置语义锚点防止漏项复杂输出容易漏项时我会在提示词里预埋一组关键词让模型逐个顺着走。比如“请从价格、质量、物流、客服四个维度分别分析”这里的“价格、质量、物流、客服”就是语义锚点。模型在生成时会倾向于按这几个锚点组织内容不会自己发挥出一堆无关维度。锚点还可以配合数字形成“清单式输出”比如“请对照以下3点逐一说明”。这个技巧很适合生成报告、周报、检查清单能显著减少遗漏。我第一次用这个技巧是在做竞品分析的时候。没有锚点时模型会把“价格”和“性价比”混在一起说结构很乱。加了锚点之后输出立刻变得规整每条分析都落在预设的维度里后续整理成本大幅下降。锚点的数量控制在四到六个比较合适太多了模型记不住太少了又覆盖不全。3. 第二组技巧控制输出质量与稳定性3.1 技巧5给模型划定边界明确不能做什么只告诉模型做什么不够很多时候还要说明不做什么。负面约束用得好能省下大量返工。我的常见写法是“不要编造原文没有的信息如果材料里没有提到某项内容请明确回复‘未提及’不要使用感叹号不要重复同一个观点。” 负面约束要具体不要写“要准确”这种空话。比如“不要编造原文没有的信息”模型能明确执行但“要准确”这种话模型根本不知道具体要它干什么。负面约束也不要堆太多三到四条以内比较合适。我试过一次给模型列了八条“不要”结果它开始变得保守连正常信息都不敢写输出质量反而下降。负面约束就像路障设置几个关键的可以让模型走在正道上但设满了它就没法走了。3.2 技巧6要求模型先思考再给答案面对数学题、逻辑题、多条件判断直接让模型给答案容易出错。我会在提示词里加一句“请先按步骤推理最后再给出结论。” 这个做法就是让模型把推理过程显性化它能纠掉不少计算错误和逻辑跳跃。比如判断一条评价是好评还是差评如果只看“赞”或“骂”的字眼很容易判断错但如果要求模型先提取关键事实再基于事实做判断准确率会明显提升。推理步骤可以控制长度。我会在提示词里写“推理过程控制在3步以内”防止模型为了推理而推理生成一大段无关内容。注意不是所有任务都适合思维链。简单的情感分类加上思维链反而拖慢速度甚至让模型过度分析把简单问题复杂化。我的判断标准是任务里如果涉及多个条件的比较或计算才需要思维链纯粹的格式转换、关键词提取不需要。3.3 技巧7用温度参数动态控制“想象力”提示词不只是文字温度这个参数也值得时刻关注。技术类、逻辑类任务我会把温度设在 0.2 到 0.4保证输出稳定、少幻觉创意类任务比如广告语、短视频标题、命名我会把温度调到 0.7 到 1.0让模型敢跳出常规表达。我在做客服话术生成时把温度从 0.8 降到 0.3最直观的变化就是语气稳定了、重复啰嗦少了对外发布前基本不用二次大改。温度不是唯一影响随机性的参数top_p、top_k、frequency_penalty、presence_penalty 这些也会影响输出。我的建议是先固定其他参数只调温度等确定了合理区间再考虑动别的。不要同时调多个参数否则出了问题你根本不知道是哪个参数引起的。做翻译、数据抽取、代码解释这类任务低温几乎是铁律做创意文案高温才有惊喜。3.4 技巧8复杂任务一定要拆解一次让模型干三件以上的事大概率会顾此失彼。我处理“总结一份50页报告”这类需求时会拆成三个小步骤先提取报告目录和章节标题再按章节生成精炼摘要最后汇总成一份带结论的完整摘要。每一步单独调用一次模型配合角色设定和格式约束结果就非常可控。拆解也可以发生在同一个提示词里用“第一步…第二步…第三步…”的结构让模型按顺序执行并在最后汇总。实际测试下来按步骤走的输出遗漏率比一次性输出低很多。原因是模型在处理多任务时注意力会被分散尤其是后面的要求容易被前面的指令“淹没”。拆解的本质是把一个复杂的认知任务变成几个简单任务的串行相当于给了模型一张清晰的路线图。需要注意的是拆完之后要考虑每一步之间的数据传递不要让模型在一句话里同时承担“抽取出关键词”和“根据关键词写出完整方案”这两件事。4. 第三组技巧持续优化与防止翻车4.1 技巧9把提示词当代码来维护提示词的进化过程跟调代码很像。我会给每条重要提示词建一个版本记录v1 初始版本、v2 增加示例、v3 收紧输出格式。每次改动后用同一组测试用例去跑对比输出是否更符合需求。测试用例不要用理想输入要用真实业务数据。我遇到过很多次“模板示例跑得漂亮一上真实数据就翻车”的情况原因就是测试数据太“干净”没有覆盖真实世界里的噪声、错别字、口语化表达。我在维护模板库时会单独放一个“失败案例”文件记录哪些输入让模板失效再针对这些案例加规则或加示例。这个过程很像写代码时建回归测试集。今天加一个规则明天加一个示例模板的鲁棒性会慢慢变好。如果你只写不测、不记录那提示词永远停留在“碰运气”阶段。4.2 技巧10增加自我检查与追问机制最后一个技巧很简单但很管用在提示词末尾加一句“请检查输出是否满足以上所有要求如果不确定请明确说明哪里不确定。” 这一句能显著减少模型漏掉约束的情况。另一种做法是多轮追问第一轮让模型生成初稿第二轮用“请重新检查一遍是否包含所有维度是否有事实错误”来校对。对于有固定答案的任务也可以给模型一条退路让它知道不知道的时候可以直接说“信息不足”而不是硬编一个答案。诚实选项多了幻觉自然会少。我在一个法律条款问答项目里加了“如果材料中没有相关信息请直接回复‘该问题在材料中未提及’”之后模型编造法条的情况几乎消失。这个技巧让模型从“必须给出一个答案”的压力里解脱出来它反而能更专注地检索已经提供给它的信息而不是去记忆里翻找一些可能对不上的内容。5. 模板库10 个可以直接套用的模板5.1 模板库的结构设计与使用说明模板库不是把几条提示词堆在一起它需要一套固定的结构团队协作和后期维护才高效。我常用的结构包含六个字段模板名称、适用场景、提示词正文、变量说明、输出示例、版本记录。变量统一用{{变量名}}标出来使用时直接替换。每个模板下面还留了“效果备注”一栏记录实测下来哪些场景表现好、哪些场景会翻车。下表可以当作模板库的字段设计参考字段作用示例模板名称方便检索和引用客服工单分类适用场景说明在什么情况下使用投诉工单情感判定提示词正文核心内容包含变量占位请对以下工单进行分类{{工单}}变量说明解释每个变量应该填什么工单用户提交的原始文本建议不超过500字输出示例给模型一个模仿基准分类结果售后问题版本记录追踪每次改动v3 增加物流场景示例5.2 按场景分类的 10 个提示词模板接下来是核心部分给出可以实际套用的模板。每个模板我都标注了适用的任务类型以及配套的变量。你只需要把{{内容}}替换成自己的数据就能立刻跑起来。模板1角色化改写 适用场景把一段口语化内容改写成专业书面语。你是一名资深编辑擅长把口语化内容改写为正式书面语。 要求 - 保持原意不变 - 删除口头禅和冗余表达 - 输出不超过200字 原文{{原文}}模板2结构化信息抽取 适用场景从非结构化文本中提取指定字段。请从以下文本中抽取信息并以JSON格式输出。 字段客户姓名、联系电话、投诉原因、期望解决方案。 注意如果字段在文本中未出现请填未提及。 文本{{文本}}模板3多标签分类 适用场景对工单、反馈、评论进行主题分类。请对以下内容进行分类可以输出多个标签。 候选标签售后问题、物流问题、产品质量、价格问题、其他。 给每个标签附上判断理由理由不超过20字。 内容{{内容}}模板4摘要生成 适用场景长文压缩为结构化摘要。你是会议纪要整理助手。请将以下冗长内容压缩为结构化摘要 - 主要结论不超过100字 - 关键论据最多3条 - 待办事项如果有 原文{{原文}}模板5情感分析 适用场景对评论或反馈进行好评、中评、差评判断。请对以下评论进行情感分析输出格式如下 情感positive好评/ neutral中评/ negative差评 理由一句话说明判断依据 评论{{评论}}模板6润色优化 适用场景把平淡或拗口的句子改得更通顺。请对以下句子进行润色要求 - 不改变原意 - 提升表达流畅度 - 适合书面发布 原句{{原句}}模板7头脑风暴选题生成 适用场景需要一批创意想法时使用建议配合较高温度。你是创意策划。请围绕{{主题}}输出10个选题方向。 要求 - 每个选题一句话说明 - 角度尽量差异化 - 避免空泛的大词 主题{{主题}}模板8数据分析结论解释 适用场景把数据指标翻译成业务结论。你是数据分析师。请解释以下数据指标的业务含义并给出改进建议。 数据{{数据}} 要求解释要通俗建议要可执行不要堆砌专业术语。模板9代码生成与解释 适用场景写代码或解释代码片段。你是资深开发工程师。请完成以下任务 任务{{任务描述}} 要求 - 给出代码实现 - 附带简要注释说明关键逻辑 - 不额外扩展无关功能模板10会议纪要整理 适用场景把零散语音转录稿整理成结构化纪要。请将以下会议转录内容整理成纪要包含 - 参会主题 - 讨论要点分条列出 - 明确结论 - 行动项包含负责人和时间节点如果原文提到 转录内容{{转录内容}}5.3 如何持续沉淀新模板模板库要活起来不能只靠一次整理。我每次项目结束会做一个小复盘这次写提示词时哪句话起效了、哪个变量容易填错、哪个真实输入把模板带崩了。把这些结论追加到模板的“效果备注”里。两周后打开模板库你会发现它已经变成了一个带测试记录的知识库比任何教程都有价值。还有一个容易忽略的坑模型版本升级后要重新跑一遍模板库的测试用例。同一个提示词可能在这个版本表现很好下个版本就因为模型行为变化而失效。这不是提示词的错而是模型本身的变动。把“跑回归测试”当成维护模板库的固定动作能避免很多线上翻车。6. 实战案例一条客服评价分析提示词的完整优化过程6.1 需求描述与第一版提示词用一个实际例子来串一下前面所有技巧电商店铺需要把用户评价自动归类为好评、中评、差评并提取问题主题、给出改进建议。第一版提示词我写得很随意“请分析以下评价给出情感判断和建议。” 结果输出各种风格都有有的只给一个词有的写一大段字段对不上程序根本没法处理。这个案例很典型问题不在于模型能力差而在于提示词没有定义任何结构。模型不知道你要的“情感判断”是三个固定值还是一个自由描述不知道“建议”要写多长也不确定“主题”到底是哪一级的分类。所以第一版翻车是必然的。6.2 从失控到可控的三轮优化优化过程分三轮每一步都对应前面提到的技巧。第一轮加入角色定义要求输出固定字段并给一个输出范例。你是一名电商用户评论分析助手。请对以下评论进行分析输出JSON格式 字段sentimentpositive/negative/neutral、theme问题主题、suggestion改进建议。 评论{{评论}}这轮之后格式基本稳定了但情感和主题偶尔不准。尤其遇到复合情感时模型会倾向于选“positive”因为它看到“不错”这样的词却忽略了“但是等太久”。第二轮补充两个示例一个正常好评一个复合情感的中评。示例1 评论质量很好包装仔细发货也快。 输出{sentiment:positive,theme:产品质量,suggestion:保持现有品控标准} 示例2 评论产品本身不错但物流等了太长时间客服回复也慢。 输出{sentiment:neutral,theme:物流时效,suggestion:优化物流渠道增加客服响应速度}加上这两个示例之后模型对边界情况的理解明显变好。尤其是示例2让模型学会了“虽然产品不错但物流问题拉低体验”这种复合判断。第三轮加负面约束减少幻觉。只基于评论内容判断不要假设用户没有提到的信息。 如果评论没有提到质量theme就写未提及。 suggestion必须具体可执行不能空泛。这轮之后模型不再凭空猜测“如果我是商家我可能会建议改善包装”之类的废话。最终版提示词把所有环节串起来效果稳定到可以接入自动化流程。6.3 优化复盘哪些改动最值钱复盘这个案例真正起决定作用的不是某个单点技巧而是组合使用角色设定给了模型一个基本框架输出格式让它知道交付物长什么样示例缩小了判断误差负面约束抑制了幻觉。这四步缺一不可但如果你只能先做一步我建议先做输出格式。没有格式约束后面一切都是空谈。另一个心得是优化不能靠一次大改。每轮只改一两个变量用同一批测试数据对比效果否则你根本不知道是哪个改动起了作用。这个案例里如果第一轮直接同时加示例、加边界、加自检输出可能依然不稳定但你就不知道是哪部分拖了后腿。7. 常见问题与排查技巧实录7.1 输出总是跑题先按顺序排查跑题的原因通常有三个缺少边界、示例不足、温度过高。我的排查顺序是先看输出格式约束是否够硬再看有没有给出覆盖边界的示例最后才是调低温度。大部分时候问题出在提示词只说了“要什么”没说“不要什么”模型就会根据自己的偏好自由发挥。把负面约束补上跑题率会直线下降。我也遇到过一次例外输出跑题是因为系统提示词里有一句“你是一位乐于助人的助手”模型便一直在解释它有多愿意帮忙。这种语境类冲突很难一眼看出需要把整个提示词从头读一遍检查是否有某句话在引导模型往错误方向走。遇到这种问题最简单的办法就是把无关的礼貌用语全部删掉。7.2 模型在编造事实怎么办幻觉问题的根源是提示词给了模型太多发挥空间。我会在提示词里明确“只能基于给定材料回答材料中没有提到的信息请回复‘材料未提及’”。如果任务确实需要补充常识我会另外开一个数据源或知识库把外部信息通过上下文喂给模型而不是让模型自己“脑补”。温度也会降到0.3以下生成内容会更克制。更重要的是检查你的提示词里有没有诱导模型发挥的句式。比如“请补充一些背景知识”“请结合你的经验”这类句式一旦出现模型就会主动产出它记忆里的信息而这些信息不一定准确。如果你要的是严格基于材料的答案这类开放句式就要彻底避免。7.3 模板换个数据集就失效模板失效最常见的原因是示例太少或者示例跟真实数据分布差异大。解决办法是往模板里补“失败案例”作为反面示例让模型知道哪些情况不要那么判。另外模板中的变量如果填得过于复杂也会影响效果。我会要求使用模板的人只填必要变量不要把整个背景贴进去减少无关干扰。这里要特别提一个误区很多人习惯把一大段任务背景都塞进提示词觉得“模型需要上下文”。其实很多背景信息与任务无关反而会拖慢速度、稀释注意力。真正的做法是只保留与输出直接相关的信息比如任务目标、输入内容、输出格式、约束条件。那些“为什么做这件事”“给谁看”之类的背景除非会影响判断否则都可以不放。7.4 提示词生效但速度太慢速度慢通常来自两部分输出token多、推理步骤长。如果用的是思维链可以在提示词里限制推理步数。如果示例太多每个都几百字也会让模型阅读成本变高。我会在保证效果的前提下精简示例数量把示例控制在三个以内并且只保留跟当前任务最接近的案例。还有一个容易被忽略的点系统提示词和用户提示词里不要重复堆同一句话。模型会反复“思考”你是不是真有额外要求输出速度也会变慢。我见过一份提示词同一句“请确保输出准确”出现四次结果是模型每次都在开头花很长篇幅解释它如何保证准确真正的内容反而被拖到后面。简洁永远是高效的前提。最后分享一点我自己的体会。提示词工程真正难的不是记住技巧而是建立反馈闭环。每一条提示词都当作一个小项目来运营写清楚、跑一遍、记录问题、改下一版。坚持几周之后你会发现很多原来需要跟模型反复拉扯的问题在写提示词的第一分钟就可以规避。我这套模板库里最值钱的不是那些写得漂亮的正文而是每条模板后面的失败记录和修改备注——这些才是踩坑换来的。希望这10个技巧和模板结构能帮你少走几天弯路早点告别“提示词玄学”。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门