快 56%,检索性能最高提升 50%: Jina 全新 6 亿参数列表式重排序模型 reranker 内部揭秘

发布时间:2026/7/28 11:57:03
快 56%,检索性能最高提升 50%: Jina 全新 6 亿参数列表式重排序模型 reranker 内部揭秘 作者来自 Elastic Felix Wang 及 Scott MartensJina Reranker 3.5 在判例法上的表现比 v3 提升超过 50%在法律、医疗和金融基准测试中将与体积大 7 倍模型之间的差距缩小并且在结构化数据上直接超越它们。它是 v3 的直接替代品无需修改 API。通过 Elasticsearch 动手实践深入体验我们的示例 Notebook查看Elasticsearch Labs repo开始免费云试用或者立即在你的本地机器上体验 Elastic。jina-reranker-v3.5是一个拥有 6 亿参数的重排序模型相比其前代产品jina-reranker-v3在法律检索任务上实现了显著提升在法律、医疗和金融重排序任务上也缩小了与参数规模大 7 倍模型之间的大部分差距。在长文档场景下它比jina-reranker-v3最快可提升 56% 的运行速度并且在判例法检索任务上的得分提高了超过 50%。它还在 STaRK 结构化数据基准测试中击败了 Qwen3-Reranker-4B。对于 v3 用户来说它是一个可直接替换的版本无需修改任何访问模型的 API 代码。什么是重排序模型它是如何工作的重排序模型reranker是一种用于信息检索流水线后期阶段的 AI 模型。在其他模块已经根据查询query筛选出一组候选结果之后重排序模型会对这些候选结果重新排序从最匹配到最不匹配。使用专门针对候选结果排序训练的模型通常可以显著提升检索结果的质量。Jina AI最新的重排序模型采用了一种称为后期交互late interaction的技术。在这种方法中查询和文档会分别编码为一组token向量嵌入embeddings这些向量表示每个 token 在当前上下文中的语义然后再对这些向量进行比较。这可以看作是词汇歧义消解和语法歧义消解在 AI 中的对应实现。例如考虑下面两个句子中match一词的含义She looked for a match to light the candl/她寻找一根火柴来点燃蜡烛。She looked for a match on Tinder/她在 Tinder 上寻找一个匹配对象。第一句话更可能匹配与火柴盒相关的查询第二句话则更可能匹配与恋爱相关的查询。基于Transformer的模型能够完成这种上下文中的歧义消解而且会将更丰富的语义信息编码进生成的 token 向量中。在第一句话里match的语义向量嵌入可能更接近fire火或illumination照明等词而在第二句话中它则可能更接近smartphone智能手机或swipe滑动等词。后期交互重排序模型会分别为查询和候选文档生成这些融合上下文信息的 token 向量然后通过比较这些向量计算可排序的分数。它完全不依赖于候选结果列表是如何生成的。无论候选结果来自词法搜索例如 BM25、基于 AI 语义向量嵌入的检索还是混合搜索、联邦搜索等从多个数据源或采用不同算法获取候选结果的系统重排序模型的工作方式都完全相同。当然最终效果仍然取决于候选结果本身的质量因此重排序模型无法修复糟糕的第一阶段检索first-stage retrieval但几乎总能进一步提升已有检索结果的质量。jina-reranker-v3.5是一种listwise列表式重排序模型采用了最初为jina-reranker-v3开发的last-but-not-late技术。查询和一组候选结果会一起输入模型并在一次前向计算中完成处理为每个候选结果返回一个数值分数。这使模型能够同时利用查询和整个候选列表中的上下文信息来理解完整输入由于拥有更丰富的信息因此能够生成更好的排序结果。jina-reranker-v3已经证明采用last-but-not-late交互方式的列表式重排序模型可以在通用重排序基准测试中与最大的模型竞争。目前只有jina-reranker-v3.5和参数规模超过 40 亿的模型在 大规模文本向量嵌入基准 Massive Text Embedding BenchmarkMTEB 重排序任务上的表现超过它。不过这种方法也对候选列表的大小提出了严格限制。查询以及所有候选结果必须能够全部放入模型的输入上下文窗口中。Jina Reranker v3.5 解决了哪些问题尽管jina-reranker-v3整体已经具备业界领先的性能但它仍然存在一些明显的性能短板。特定领域文本检索jina-reranker-v3是基于通用文本语料训练的因此在一些重要的应用场景中表现不够理想尤其包括法律文本例如判例法和合同条款。医学文献例如临床试验和患者病历。金融数据集以及包含大量重要数值的其他文本。计算机编程和 IT 文档。包含大量专业术语和技术规格的产品目录。结构化数据表格、 JSON 和键值记录大量重要的现实世界数据都是以电子表格、表格、键值列表以及 JSON 等结构化记录的形式存储。然而仅针对文本比较训练的重排序模型例如jina-reranker-v3在处理这类数据时表现较差。长候选列表带来的计算成本大多数文本处理 AI 模型核心采用的自注意力self-attention架构意味着其内存和计算需求会随着输入规模的增加而呈二次方增长。因此jina-reranker-v3与其他 AI 模型一样在使用完整输入上下文窗口时计算成本非常高。然而为了充分发挥模型的效果我们希望能够尽可能将更多候选匹配结果放入模型输入中。当模型最能发挥价值时它的运行速度也会更慢计算成本也会更高。我们开发jina-reranker-v3.5正是为了专门解决这些问题同时又不会降低它在通用文本检索任务上的性能。Jina Reranker v3.5 有哪些新特性jina-reranker-v3.5采用了改进后的注意力机制attention mechanism不仅提升了性能还提高了处理速度并降低了在推理inference阶段处理完整输入上下文窗口所需的计算资源。我们还引入了一种全新的三阶段自蒸馏self-distillation训练流程使其更适合大输入上下文模型所采用的滑动窗口架构。我们还针对jina-reranker-v3中发现的性能短板精心整理并使用了新的训练数据包括来自多个国际来源的多语言法律文本。主要来自科学文献以及其他 AI 项目资料的医学文本其中包括一套中文医疗问答数据。金融行业数据包括投资相关问答、法规以及包含数值及其相关文本的表格。结构化数据特别是来自电商ecommerce领域以及公开表格语料的数据。扩展后的多语言和跨语言文本。有关jina-reranker-v3.5的数据来源和技术创新的详细信息请参阅我们的技术报告。Jina Reranker 3.5 在检索基准测试中的表现参数数量5.97 亿输入模态仅文本上下文窗口大小131,072 个 token最大候选匹配数量没有固定上限但所有候选结果和查询必须能够放入上下文窗口中。支持语言使用 52 种语言进行训练通用文本重排序性能 BEIR 和 MIRACL jina-reranker-v3.5在通用文本重排序基准测试中的表现相比jina-reranker-v3有所提升。在英文Benchmarking Information Retrieval ( BEIR )基准测试中其平均得分已经提升到超过业界领先的Qwen3-Reranker-4B、Qwen3-Reranker-0.6B以及 Mixedbread AI 的重排序模型。我们还提升了jina-reranker-v3在Multilingual Information Retrieval Across a Continuum of Languages ( MIRACL )基准测试上的多语言重排序性能。目前只有拥有 40 亿参数的 Qwen3 重排序模型能够稳定超过jina-reranker-v3.5的得分。法律、医疗和金融领域的重排序Retrieval Embedding Benchmark (RTEB) suite 包含多个不同领域的检索基准测试。jina-reranker-v3.5在所有与法律、医疗和金融相关的 RTEB 任务中都超过了jina-reranker-v3的表现。只有参数量接近其 7 倍的大型 Qwen3 重排序模型在这三个领域中的平均性能更好。新模型在法律数据方面展现出特别显著的提升在判例法检索任务中其得分相比jina-reranker-v3提升超过 50%。任务Reranker v3Reranker v3.5v3 到 v3.5 的提升AILA-Case20.8232.5511.7356%AILA-Statute32.1546.1614.0144%LegalQuAD81.8483.091.251.5%LegalSum69.6470.991.331.9%结构化数据重排序 Struct-IR 和 STaRK 基准测试我们在两个基准测试上评估了jina-reranker-v3.5的结构化数据重排序能力Struct-IR和STaRK。这两个基准测试都包含由 AI 生成的 JSON 文本数据覆盖多种应用场景包括产品记录、科学论文以及生物医学知识库。jina-reranker-v3.5在 Struct-IR 基准测试上的得分相比jina-reranker-v3有了显著提升再一次只有 Qwen3-Reranker-4B 超过它。在 STaRK 基准测试中jina-reranker-v3.5击败了我们测试过的所有其他模型无论它们的参数规模大小。推理速度短文档和长文档的延迟基准测试候选文档越长我们针对jina-reranker-v3.5所做的架构改进带来的优势就越明显。为了验证这一点我们使用了两个检索数据集这两个数据集的主要区别在于平均文档长度存在较大差异数据集平均文档长度jina-reranker-v3jina-reranker-v3.5加速比例BEIR Natural Questions145.5 个 token371.1 毫秒305.3 毫秒22%RTEB AILAcasedocs1,904.0 个 token16,064.9 毫秒10,290.9 毫秒56%jina-reranker-v3.5在这两种情况下都显著更快。在 Natural Questions 基准测试中与jina-reranker-v3相比它的速度提升了 22%平均请求延迟从 371.1 毫秒降低到 305.3 毫秒。AILAcasedocs 基准测试中的每个查询规模要大得多平均超过 10 倍因此重排序平均需要更长时间jina-reranker-v3需要 16,064.9 毫秒而jina-reranker-v3.5需要 10,290.9 毫秒。这表示新模型实现了 56% 的速度提升为应用程序带来更低的延迟以及更低的计算成本。什么时候应该使用 Jina Reranker v3.5重排序几乎在所有情况下都能提升搜索精准度而jina-reranker-v3.5可以应用于各种信息检索场景。不过它也存在一些限制。下面的表格总结了我们的最佳实践建议使用场景建议常见国际语言的通用文本检索使用jina-reranker-v3.5。法律、金融和医疗领域检索使用jina-reranker-v3.5。半结构化数据、表格、电商产品信息文本使用jina-reranker-v3.5。非文本或混合媒体数据使用支持文本和图像输入的jina-reranker-m0。如何通过 Elastic Inference API 使用 Jina Reranker 3.5jina-reranker-v3.5可以通过Jina API使用并提供免费 token 供你体验。它也可以通过Elastic Inference API和Elastic Inference Service使用。如果你已经在使用jina-reranker-v3你只需要在发送到 Jina API 的请求中修改model字段里的模型名称或者在配置 Elastic Inference API端点时修改model_id字段即可。这两个模型的接口完全一致。你可以将jina-reranker-v3.5作为Jina On-Prem 容器安装以获得一个完全自包含的服务器并在你自己的硬件上运行。模型权重也可以下载用于测试和研究。请按照 Hugging Face 上该模型页面中的说明进行操作。在这两种情况下该模型都基于CC BY-NC-4.0 许可证提供因此你可以自由地将其用于测试、构建原型或开展科学研究。对于商业用途请联系 Elastic 销售团队。原文Jina Reranker v3.5: faster legal, medical and structured search - Elasticsearch Labs