拓冰建站拓冰建站
首页 / 资讯中心 / 正文

RACE:基于多源证据锚定的智能体化商品目录增强方案

RACE基于多源证据锚定的智能体化商品目录增强方案论文原信息arXiv:2608.20844v1摘要商品目录是电商平台搜索、商品发现与推荐系统的底层基础但电商目录普遍存在属性稀疏问题消费者与下游系统依赖的商品属性要么埋藏在标题、图片这类非结构化内容中要么直接缺失。面对规模庞大且持续迭代的商品库依靠人工完成目录增强并不具备可行性。本文提出**(\mathcal{T})RACE**一套基于智能体大语言模型实现自动化商品目录属性增强的全新框架。框架包含两个智能体侦察智能体ScoutAgent聚合商户目录、合作数据源、身份匹配网页检索的多模态证据生成附带支撑依据的候选属性值裁判智能体JudgeAgent针对每一条候选属性值结合证据开展核验决定直接入库、拦截或是转交人工复核。离线人工评测数据集上(\mathcal{T})RACE输出候选属性的准确率98.2%属性覆盖率74.7%。部署到工业级真实商品目录后(\mathcal{T})RACE将四大业务类目下曝光加权的属性增强覆盖率提升90.4%。线上对照实验表明在商品详情页展示增强后的结构化属性可使下单转化率提升0.48%。1 引言电商与交易市场平台的商品目录融合非结构化内容标题、图片和结构化属性品牌、规格、饮食标签等。结构化属性能够帮助消费者筛选、对比商品帮助搜索系统理解查询背后的属性意图也让推荐模型学习细粒度的商品偏好。实际业务场景中卖家提供的目录数据往往属性稀疏。很多属性信息藏在非结构化文本内没有转为结构化字段甚至完全缺失。带来两类后果一是消费者缺少信息支撑无法建立对商品的准确预期影响购买决策二是下游系统只能使用粗粒度商品表征降低检索精度、限制个性化推荐效果。商品目录增强的目标就是挖掘、补全缺失属性输出结构化字段。人工处理需要阅读自由文本、解析图片还要整合格式、质量参差不齐的多源证据不仅容易出错面对海量高速增长商品库也完全不可行。早期商品属性抽取研究训练任务专用NLP模型从商品文本与图片还原结构化属性。大模型兴起后借助零样本、少样本能力降低标注数据与任务微调的依赖。但现实业务仍存在两大核心难题部分属性无法仅凭平台自有数据可靠推断必须从外部获取同时严格匹配到** exact 目标商品**基于某一时刻目录评测得到的模型准确率会随着商品集合迭代而失效。系统平均效果再好依然可能输出无依据、错配商品的属性对于过敏原、饮食限制这类安全敏感属性错误属性会造成严重后果。针对上述痛点本文提出(\mathcal{T})RACE框架采用双智能体工作流ScoutAgent负责多源证据搜集JudgeAgent在写入目录前完成核验。本文主要贡献提出面向工业级商品目录增强的端到端智能体大模型框架可融合异构多源证据并完整保留证据溯源引入身份匹配检索锚定机制补全平台自有数据无法推断的属性将JudgeAgent嵌入线上服务链路作为“先核验再写入”的闸门对每一条候选属性执行统一证据标准降低商品集合变化对输出质量的冲击。跨4个业务类目离线实验表明(\mathcal{T})RACE可以实现接近专家人工的准确率同时具备人工无法企及的处理规模与吞吐能力。图1 (\mathcal{T})RACE架构ScoutAgent接收SKU记录、目录、合作数据源、图片证据执行迭代式身份匹配网页检索输出带证据溯源的候选属性JudgeAgent独立核验每一条候选可补充网页检索输出每条属性的裁决结果写入闸门执行写入(WRI(\mathcal{T})E) / 拦截(BLOCK) / 人工复核(REVIEW)三种路由。2 相关工作基于生成式模型从文本、图片还原结构化属性是成熟研究方向。早期方案对编解码模型微调做属性生成近期多使用基座模型零样本/少样本提示部分方案会检索相似目录条目辅助预测。多智能体系统也被用于迭代优化属性预测、交叉校验抽取结果但这类工作大多假设目标属性能够从平台自有数据得到且同类商品已经完成属性抽取。大模型作为裁判LLM‑as‑judge广泛用于模型输出评估包含锚定事实场景、多模型陪审团降低单模型偏见。可以作为独立评估器也可以作为多智能体流程中的批判模块。但现有研究很少将大模型裁判集成到生产环境目录增强流水线针对证据质量动态变化、商品与属性集合持续演变的场景完成单条属性的发布决策。外部检索增强可以弥补大模型内部知识的时效性、专业性短板智能体工具增强检索让模型交替推理与调用搜索降低幻觉风险。但检索增强不能直接套用在商品目录增强任务搜索返回内容只是主题相关很可能描述相近但并不等同的商品变体。商品属性抽取必须做显式身份匹配保证证据严格对应待增强的目标SKU。3 方法3.1 总览记sss为库存单元SKUxsx_sxs​为该SKU目录记录csc_scs​为叶子类目。类目专属模板将csc_scs​映射为一组需要优先抽取的属性集合A∗s(T)emplate(c∗s;(T))\mathcal{A}*{s}\mathrm{(\mathcal{T})emplate}(c*{s};\mathcal{(\mathcal{T})})A∗s(T)emplate(c∗s;(T))其中(T)\mathcal{(\mathcal{T})}(T)是全部属性模板集合模板约束只抽取对该类目业务有意义的属性。针对每一个属性a∈A∗sa\in\mathcal{A}*{s}a∈A∗s系统输出带证据支撑的候选值或者显式选择放弃输出abstention。候选属性的表达形式c∗a(a,,va,,Ea,,τa,,qa,,za)c*{a}\left(a,,v_{a},,E_{a},,\tau_{a},,q_{a},,z_{a}\right)c∗a(a,,va​,,Ea​,,τa​,,qa​,,za​)vav_ava​候选属性值EaE_aEa​支撑证据集合τa\tau_aτa​证据来源类型qaq_aqa​模型输出置信度分数zaz_aza​抽取状态extracted已抽取 /not_found未找到 /not_applicable属性不适用 /ambiguous信息模糊 /conflict证据冲突系统最终会把每个候选映射三种业务动作WRI(\mathcal{T})E写入、BLOCK拦截、REVIEW转交人工复核。(\mathcal{T})RACE采用两阶段“先核验再写入”架构ScoutAgent聚合多源证据校验外部检索证据是否匹配目标商品输出带事实锚定的候选属性JudgeAgent使用更严格核验策略复审全部候选决定是否发布、拦截或者人工复核。算法1单个SKU的(\mathcal{T})RACE增强流程输入SKU s类目属性模板集合 \(\mathcal{T}\)置信度阈值 \(\theta\) 输出候选属性附带 {write, block, review} 业务动作 1: ₛ ← \(\mathcal{T}\)emplate(s, ) 2: if ₛ ∅ then 3: return ∅ 4: end if 5: E ← Catalog(s) ∪ Syndicated(s) ∪ Image(s) 6: for all a ∈ ₛ 且现有证据E无法解析该属性 do 7: for all p ∈ Search(Query(s,a)) do 8: if IdentityMatch(p,s) # 检索页面p与SKU s身份匹配 9: E ← E ∪ ExtractEvidence(p,a) 10: end if 11: end for 12: end for 13: C ← Reconcile(ₛ,E) # 归一化、合并证据必要时放弃输出 14: Y ← JudgeAgent(C,E) 15: d ← WritePolicy(Y,C,confidence,\(\theta\)) 16: Apply(d,c) 17: return C3.2 ScoutAgent侦察智能体ScoutAgent搜集并整合每个目标属性的证据数据源分为三类商户目录数据卖家提供结构化、非结构化商品信息商品标题描述、商品图片。商业合作数据源第三方商业数据服务商输出商品档案可提供权威规格参数但是覆盖率、映射质量参差不齐。智能体网页检索自有证据不足以判定属性时结合商品标识与目标属性构造查询网页检索补充证据。商品图片虽然来自前两类数据源但图片抽取噪声更高(\mathcal{T})RACE将图片证据作为独立层级。策略上优先采信文本证据同时针对材质、认证标识、包装印刷这类适合视觉判断的属性使用图片。基于身份锚定的网页检索网页检索经常返回主题相关但实际描述其他商品/变体的页面。目录增强任务不能只看查询相关性必须保证证据对应目标SKU。ScoutAgent基于ReAct推理循环完成身份匹配校验利用目录记录、网页页面内标识符与元数据做比对。只有页面确认匹配目标SKU才从中提取属性证据否则直接丢弃该页面。算法中IdentityMatch(p,s)代表该推理校验步骤不是独立外部模型调用。证据调和与放弃输出机制搜集全部证据后ScoutAgent做值归一化合并等价写法如NiMH与nickel‑metal hydride60 Hz与60Hz。同源证据指向同一个归一化值就合并完整保留每一条原始证据来源溯源。当证据不足、信息模糊、证据互相冲突时ScoutAgent不会依靠模型内部知识强行输出选择放弃输出标记状态extracted / not_found / not_applicable / ambiguous / conflict。输出候选记录包含归一化取值如果有、支撑证据、来源类型、置信度、抽取状态完整交给JudgeAgent。ScoutAgent完整提示词模板参见附录A图3。3.3 JudgeAgent裁判智能体候选属性写入目录前全部交由JudgeAgent裁决。输入包含ScoutAgent输出完整候选记录属性取值、证据、来源、抽取状态。JudgeAgent重新评估证据是否匹配目标商品、证据是否能够支撑候选取值。当已有证据不足以核验JudgeAgent同样可以调用网页检索补充信息。JudgeAgent以SKU为单位可以对多个SKU并行处理。证据采信标准比ScoutAgent更加严格核心判断现有证据是否能够针对该SKU支撑候选取值。裁决分类体系Verdict taxonomy每条候选返回4种裁决结果PASS通过现有证据支撑目标商品该候选取值FAIL失败证据与候选矛盾/无法支撑取值附带子诊断类型例如幻觉、证据矛盾UNVERIFIED未核验没有证据反驳候选但也没有直接证据确认该取值适用于目标商品代表核验证据不足不等于判定错误UNCER(\mathcal{T})AIN不确定证据互相冲突、信息模糊无法给出可靠判定。UNVERIFIED和UNCER(\mathcal{T})AIN的区分前者缺少确认证据后者证据内部存在实质性分歧4.3节有实验分析。裁决映射目录写入动作裁决结果与业务写入策略解耦。低于置信度阈值θ\thetaθ直接拦截。KaTeX parse error: Cant use function \mathcal in text mode at position 123: …\texttt{UNCER(\̲m̲a̲t̲h̲c̲a̲l̲{T})AIN},\ \tex…yay_aya​JudgeAgent裁决结果qaq_aqa​ScoutAgent输出置信度解耦设计好处可以修改业务发布规则不需要改动JudgeAgent内部裁决逻辑。JudgeAgent完整提示词模板参见附录A图4。4 实验实验数据来自电商平台真实生产目录覆盖多个业务类目结合人工评估与JudgeAgent自动裁决衡量目录增强质量。若无特殊说明ScoutAgent、JudgeAgent后端基座统一使用Gemini 2.5 Flash。4.4节对比其他多模态基座。4.1 数据集采集4大业务类目杂货、酒水、电子产品、家装目标属性数量区间杂货11个家装最高409个。杂货酒水数据集500个SKU2497条SKU‑属性对。人工标注标准答案另一批审核人员复核ScoutAgent输出。用来衡量人工校验下抽取质量分析JudgeAgent和人类判断的差异。电子产品家装数据集955个SKU4990条SKU‑属性对。没有完整人工标注使用JudgeAgent做全量自动裁决作为可规模化业务质量信号。4.2 评价指标针对ScoutAgent抽取准确率输出非空值中正确样本占比人工校验准确率代表正确性由人工审核确认。属性覆盖率目标SKU‑属性对中输出非空候选值的比例。JudgeAgent自动评估数据集统计PASS / UNVERIFIED / FAIL / UNCER\(\mathcal{T}\)AIN各类裁决占比裁判支持率 judge‑supported rate PASS UNVERIFIED占全部抽取结果的比例。该指标只代表符合JudgeAgent证据标准不等同人工验证准确率。4.3 实验结果杂货酒水在全人工标注数据集ScoutAgent实现98.2%抽取准确率74.7%属性覆盖率。使用人工标注分析JudgeAgent行为只有ScoutAgent输出非空候选才进入核验链路。早期版本JudgeAgent只做二分类PASS/FAIL把证据矛盾、证据不足、信息冲突全部归为拒绝。PASS样本中98.4%得到人工确认正确JudgeAgent和人工不一致案例87.8%属于错误拒绝JudgeAgent判FAIL但人工判定正确仅12.2%属于错误放行。二分类策略放行样本精度很高但大量正确候选被拒绝召回偏低策略过于保守。这推动本文设计四分类裁决体系保留PASS标准拒绝类拆分为FAIL证据反驳、UNVERIFIED无确认证据但无矛盾、UNCER(\mathcal{T})AIN冲突模糊。JudgeAgent输出作为规模化业务审计信号和人工校验准确率分开报告。电子产品家装ScoutAgent属性覆盖率87.8%抽取出来的值中97.4%得到JudgeAgent的PASS/UNVERIFIED支持。4.4 大模型基座对比固定JudgeAgentGemini 2.5 Flash替换ScoutAgent后端多模态模型在电子产品家装数据集对比效果。表1 ScoutAgent基座模型对比VLM基座模型裁判支持率属性覆盖率发布覆盖率相对成本Gemini 2.5 Flash97.4%87.8%85.5%1.00×Gemini 3.5 Flash92.7%88.3%81.9%7.21×GP(\mathcal{T})‑5.487.1%84.0%73.2%1.93×Claude Sonnet 578.9%80.5%63.5%3.05×Gemini 3.5 Flash抽取覆盖率小幅上涨0.5个百分点但裁判支持率下降最终可自动发布覆盖率从85.5%降到81.9%推理成本提升7倍以上。GP(\mathcal{T})‑5.4、Claude Sonnet5可发布覆盖率进一步下降。错误分析其他基座的主要问题不是明显幻觉矛盾而是抽取结果缺少足够证据支撑集中在需要大量证据的属性例如包装数量、自由文本描述。说明基座选型不只影响“能不能抽出来”还影响抽取结果是否满足自动发布证据门槛。全部实验组JudgeAgent保持不变属于受控业务行为对比不是直接等价于人工准确率。5 部署(\mathcal{T})RACE上线生产环境完成4个业务类目合计3100万SKU的目录增强。曝光加权属性增强覆盖率提升90.4%曝光加权按消费者商品浏览曝光量统计增强属性占比。图2 商品详情页PDP增强前后对比增强前属性信息埋藏在非结构化文本(\mathcal{T})RACE结合内部外部数据源生成结构化属性展示。5.1 用户业务影响商品详情页PDP是消费者购买决策核心页面。属性缺失会造成信息差消费者对商品预期和实物不符。假设PDP展示(\mathcal{T})RACE生成结构化属性可以缩小信息差改善购买决策降低售后问题。开展为期5周随机A/B测试90%流量实验组展示增强属性PDP10%流量对照组保持原有页面。测试衡量完整链路生成‑核验‑前端展示的端到端业务效果。表2 线上A/B测试业务指标相对对照组变化95%置信区间、p‑value指标相对变化95%置信区间p‑value下单转化率 Checkout conversion0.48%[0.04%, 0.92%]0.034下单转化率重度用户1.18%[0.24%, 2.12%]0.014错发/漏发商品上报率−1.08%[−2.04%, −0.13%]0.026结果整体下单转化率提升0.48%重度用户提升达到1.18%错发漏发反馈率下降1.08%。印证假设更完备结构化商品信息帮助消费者建立准确预期优化购物决策。6 局限性电子产品、家装类目使用JudgeAgent裁判支持率作为规模化业务指标不能完全替代人工精度。JudgeAgent在校验集杂货酒水完成调优但跨类目迁移只做有限人工校验。主实验中ScoutAgent、JudgeAgent使用同系列模型二者可能存在共有的失效模式。线上A/B测试评估整套系统端到端收益无法单独剥离JudgeAgent、写入闸门策略带来的独立贡献。7 结论本文提出(\mathcal{T})RACE多智能体证据锚定商品目录增强框架将候选生成与证据核验解耦ScoutAgent聚合多源证据生成候选JudgeAgent执行更严格证据校验控制写入目录权限。跨多个业务类目实验证明(\mathcal{T})RACE可以高质量、工业规模运行人工标注数据集准确率98.2%。线上随机实验证明详情页展示增强属性下单转化率提升0.48%错漏商品反馈下降。实验证明基于商品专属证据锚定、写入前核验既提升目录数据质量又改善终端用户体验。生成式AI声明论文撰写阶段作者使用生成式AI完成语法拼写检查、文本复述改写作者完成全部审核修改对整篇论文内容承担全部责任。附录A精简版智能体提示词模板说明为排版精简省略重复描述、本体枚举、SKU原始内容、工具调用schema尖括号代表每个SKU运行时动态填入字段。(\mathcal{T})RACE每个合格SKU调用1次ScoutAgent1次JudgeAgent每次调用返回每个属性的输出映射。ScoutAgent 精简指令契约任务处理单个零售SKU。使用可用证据抽取全部需要的优先属性证据不足直接放弃输出不要臆测。证据优先级冲突时高优先级覆盖低优先级网页检索用来填补信息缺口不是推翻商户目录商户目录2. 高质量合作数据源3. 商品图片4. 网页检索。检索规则SEARCH_\(\mathcal{T}\)OOL用于解析不充分属性检索query构造顺序UPC/G(\mathcal{T})IN/EAN → 品牌商品名规格变体 → 型号MPN → 厂商官网 → 属性专项查询。来源偏好优先官网、手册其次大型零售商普通零售商聚合网站。禁止博客、论坛、用户评论、UGC内容。身份匹配规则使用图片、网页证据前必须校验品牌、变体、规格、包装数量完全匹配依靠UPC/型号MPN确认匹配不使用相近变体证据来源身份不匹配该属性标记identity_mismatch。取值约束枚举值严格取自给定集合字符串尽量使用推荐词汇布尔值输出\(\mathcal{T}\)rue/False。多源合并取值需要每个来源提供独立有效信息。事实锚定每一个抽取值输出取值、来源、来源类型、来源链接、原文证据片段置信度[0,1]证据尽量引用原文最多合并3段短原文用于合成字段。输出严格JSON{ identity:{ matched_brand:..., matched_variant:..., matched_size:..., matched_pack:..., confidence:0.0 }, attributes:{ SLUG:{ status:extracted|not_found|not_applicable|ambiguous|conflict|identity_mismatch, value:null|..., source:[cd,hq,image,web], source_type:catalog|hq|image|official_web|official_doc|major_retailer|retailer|aggregator|other, source_ref:..., quoted_evidence:..., confidence:0.0 } } }状态为非extracted时value设为null省略溯源、置信度字段。输入PayloadPRIORI\(\mathcal{T}\)Y_A\(\mathcal{T}\)\(\mathcal{T}\)RIBU\(\mathcal{T}\)ES属性标识、定义、示例、数据类型、枚举/推荐词汇、是否多值标记SKU_CON\(\mathcal{T}\)EX\(\mathcal{T}\)商品名称、详情、规格、标识符、品牌、类目CA\(\mathcal{T}\)ALOG_EVIDENCE目录证据SYNDICA\(\mathcal{T}\)ED_EVIDENCE合作数据源证据IMAGE图片。要求输出全部目标属性SLUG。JudgeAgent精简指令契约角色高精度质量审核员可调用网页检索。针对单个SKU每一组属性标识取值状态输出裁决PASS / FAIL / UNVERIFIED / UNCER\(\mathcal{T}\)AIN。决策执行顺序状态为not_found / not_applicable / ambiguous / conflict / identity_mismatch合理放弃输出则PASS如果证据明显可以抽取却放弃则FAIL标记MISSING_EX\(\mathcal{T}\)RAC\(\mathcal{T}\)ION。如果目录、合作数据源、图片直接支持候选取值 → PASS无需搜索直接矛盾 → FAIL标记CON\(\mathcal{T}\)RADIC\(\mathcal{T}\)ION无需搜索。如果候选来自网页现有证据不足调用SEARCH_\(\mathcal{T}\)OOL查询构造品牌型号MPN商品名属性补充UPC/G(\mathcal{T})IN。严格校验品牌、型号、变体、规格包装完全匹配商品确认证据 → PASS完全匹配商品出现矛盾 → FAIL/INCORREC(\mathcal{T})_VALUE只找到近似变体、通用页面、无结果 → UNVERIFIED。如果目录/合作数据源/图片给出的引用实际并不支撑候选断言 → FAIL/UNSUPPOR(\mathcal{T})ED_INFERENCE禁止用网页证据“挽救”内部来源的错误断言。多个完全匹配商品来源出现实质性冲突 → UNCER(\mathcal{T})AIN。FAIL与UNVERIFIED区分FAIL必须有明确证据证明断言错误/编造。候选听起来合理、没有反证但无法针对确切变体确认输出UNVERIFIED。归一化规则布尔同义词、标准技术缩写、等价计量单位视为相同数值允许2%或者0.5绝对误差内微小舍入。文本处理目录、合作数据源引用尽量原文网页断言要有事实支撑。部分原文只能支持核心主张后续附加内容缺少证据 → UNVERIFIED如果无证据附加引入全新事实主张 → FAIL/PAR(\mathcal{T})IAL_EX(\mathcal{T})RAC(\mathcal{T})ION。FAIL子类型枚举INCORREC\(\mathcal{T}\)_VALUE, UNSUPPOR\(\mathcal{T}\)ED_INFERENCE, HALLUCINA\(\mathcal{T}\)ION, CON\(\mathcal{T}\)RADIC\(\mathcal{T}\)ION, SCHEMA_MALFORMED, PAR\(\mathcal{T}\)IAL_EX\(\mathcal{T}\)RAC\(\mathcal{T}\)ION, INVALID_FORMA\(\mathcal{T}\), UNSAFE, MISSING_EX\(\mathcal{T}\)RAC\(\mathcal{T}\)ION输出严格JSON{ verdicts:{ SLUG:{ verdict:PASS|FAIL|UNVERIFIED|UNCER\(\mathcal{T}\)AIN, failure_type:null|FAILURE_\(\mathcal{T}\)YPE, reasoning:最多30字, url:null|证据链接 } } }输入PayloadSKU_CON\(\mathcal{T}\)EX\(\mathcal{T}\)、目录证据、合作数据源证据、图片、CANDIDA\(\mathcal{T}\)E_VALUESScoutAgent完整属性输出必须对全部候选输出裁决。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门