NLP-progress 关键词提取与生成(KPE/KPG)任务全景:数据集、评测指标与 SOTA 基准解析
NLP知识库文档【免费下载链接】NLP-progressRepository to track the progress in Natural Language Processing (NLP), including the datasets and the current state-of-the-art for the most common NLP tasks.项目地址https://gitcode.com/gh_mirrors/nl/NLP-progress点击查看免费下载导读本文是 NLP-progress 仓库中 关键短语提取与生成 任务页的深度技术指南系统梳理关键短语提取Keyphrase Extraction, KPE与关键短语生成Keyphrase Generation, KPG的任务边界、present/absent 两类关键短语的定义、业界常用公开数据集、评测指标约定以及 KP20K、SemEval、Inspec、Krapivin、NUS 五个主流基准上的 SOTA 结果表。读完本文你将掌握该任务的完整研究坐标系能准确理解不同论文在 F15、F1O/M、R10/50 等指标下的可比性并学会如何在 NLP-progress 仓库中检索、比对与贡献该任务的实验结果。任务界定关键短语提取KPE与关键短语生成KPG关键短语提取是 NLP 中识别文档中关键短语key phrases的任务在信息检索、问答系统、文本摘要等场景有广泛应用。关键短语存在两个维度present keyphrases在场关键短语直接出现在文档原文中的关键短语可直接从文本中抽取absent keyphrases缺席关键短语虽然不出现在文档原文中但依然能作为该文档合适的摘要或标签的关键短语。传统 NLP 研究主要处理present关键短语的提取而深度学习兴起之后的研究也逐步覆盖absent关键短语。由此形成两条技术路线KPEKeyphrase Extraction被建模为序列标注sequence labeling问题输出直接从原文中选出的短语片段KPGKeyphrase Generation被建模为序列到序列sequence-to-sequence生成问题可以产生原文中不存在的短语集成方法integrated approach将两者统一看作一个生成问题在一个框架内同时处理 present 与 absent 关键短语。研究脉络两篇权威综述该任务页引用了两篇近年发表的系统性综述作为研究者快速切入该领域的入口A Survey on Recent Advances in Keyphrase Extraction from Pre-trained Language ModelsSong et al., 2023EACL 2023聚焦预训练语言模型时代关键短语提取的最新进展From statistical methods to deep learning, automatic keyphrase prediction: A surveyXie et al., 2023Information Processing and Management 60(4)覆盖从统计方法到深度学习的完整发展脉络。两条综述恰好呼应了上述 KPE/KPG 两条路线前者以提取序列标注/抽取为主线后者以端到端预测含生成为主线。标准数据集该任务的数据集普遍遵循统一范式一组文本实例 每个文本对应的关键短语列表。关键短语有两种来源人工标注或从预标注的网络内容中自动提取关键短语本身既可以是 present 也可以是 absent。按数据规模与使用频率数据集分为常用数据集与其他数据集两类。常用数据集KP20K最早由 Meng et al.2017提出包含20,000 篇计算机科学领域学术论文的标题、摘要与关键短语关键短语为自动提取可从 Hugging Face hub 以midas/kp20k标识访问。该数据集是目前 KPG 领域事实上的标准训练集详见下文评测协议说明。Inspec包含2,000 篇来自 Inspec 数据库的英文科学摘要关键短语由专业标引员professional indexers标注出自 Hulth2003。可从 Hugging Face hub 以midas/inspec标识访问。Krapivin包含2,000 篇计算机科学领域的英文论文全文关键短语由论文作者标注、审稿人复核出自 Krapivin et al.2010。可从 Hugging Face hub 以midas/krapivin标识访问。NUS包含约 200 篇英文科学出版物全文关键短语由作者以及一组独立标注者共同标注出自 Nguyen and Kan2007。可从 Hugging Face hub 以midas/nus标识访问。SemEval源自SemEval 2017 Task 10ScienceIE包含500 篇来自 ScienceDirect 的开放获取英文科学出版物。关键短语先由一组学生志愿者标注再由一名专家标注者进行二次标注。可从 Hugging Face hub 以midas/semeval2017标识访问。其他数据集DUC出自 Wan and Xiao2008包含约 300 篇英文新闻文章及其关键短语可从 Hugging Face hub 以midas/duc2001标识访问。KPTimes出自 Gallina et al.2019是大规模新闻关键短语数据集包含279,923 篇来自 NYTimes 的新闻文章与 10,000 篇来自 JPTimes 的文章关键短语由编辑策展标注。可从 Hugging Face hub 以midas/kptimes标识访问。OpenKP出自 Xiong et al.2019包含约 15 万篇approximately 150K带人工标注关键短语的 Web 文档。可从 Hugging Face hub 以midas/openkp标识访问。评测指标与报告约定该任务的评测体系围绕top-k 匹配展开在对比模型输出与黄金关键短语ground-truth时计算Macro Precision / Recall / F1。F1k最常报告的是 k 5 或 k 10 的 F1 值F1O以黄金关键短语数量作为 k 的变体F1M以模型预测的关键短语数量作为 k 的变体针对absent关键短语部分论文额外报告R10 / R50。任务页的基准表统一以F15对模型排序覆盖五个最常报告的数据集KP20K、Inspec、Krapivin、NUS、SemEval。解读结果时须注意以下约定来自原文档的官方说明星号Asterisk表示论文报告的是Micro分数而非 Macro感叹号!表示论文未说明报告的是 Macro 还是 Micro 指标所有结果均取自各模型原始论文报告的数值由于部分论文以 0–1 量纲、部分以 0–100 量纲报告有时同一篇论文在不同表格中还会混用两种量纲任务页已将全部结果统一换算为 0–1 量纲以保证可比性。SOTA 结果基准表任务页遵循一个统一的评测协议使用 KP20K 作为训练数据分别在 KP20K、NUS、SemEval、Inspec、Krapivin 上测试。近年研究普遍采用这一设定。以下五张表完整保留自原文档Present-F15 与 Absent-F15 两列分别对应在场与缺席关键短语的 F15。KP20KModelPresent-F15Absent-F15Paper / SourceCodeChatGPTMartinez et al., 20230.232 (!)0.044 (!)ChatGPT vs State-of-the-Art Models: A Benchmarking Study in Keyphrase Generation Task-P-AKGWu et al., 20220.351 (!)0.032 (!)Fast and Constrained Absent Keyphrase Generation by Prompt-Based Learning-WR-SetTransXie et al., 20220.3700.050WR-One2Set: Towards Well-Calibrated Keyphrase Generation-BeamKPD-AChowdhury et al., 20220.3630.067KPDROP: Improving Absent Keyphrase Generation-SetTransYe et al., 20210.3580.036One2Set: Generating Diverse Keyphrases as a Set-UniKeyphraseWu et al., 20210.408 (!)0.047 (!)UniKeyphrase: A Unified Extraction and Generation Framework for Keyphrase Prediction-ExHiRD-hChen et al., 20200.3110.016Exclusive Hierarchical Decoding for Deep Keyphrase Generation-CorrRNNChen et al., 2018--Keyphrase Generation with Correlation Constraints-CopyRNNMeng et al., 20170.333-Deep Keyphrase Generation-SemEvalModelPresent-F15Absent-F15Paper / SourceCodeChatGPTMartinez et al., 2023--ChatGPT vs State-of-the-Art Models: A Benchmarking Study in Keyphrase Generation Task-P-AKGWu et al., 20220.329 (!)0.028 (!)Fast and Constrained Absent Keyphrase Generation by Prompt-Based Learning-WR-SetTransXie et al., 20220.3600.043WR-One2Set: Towards Well-Calibrated Keyphrase Generation-BeamKPD-AChowdhury et al., 20220.3430.053KPDROP: Improving Absent Keyphrase Generation-SetTransYe et al., 20210.3310.026One2Set: Generating Diverse Keyphrases as a Set-UniKeyphraseWu et al., 20210.416 (!)0.030 (!)UniKeyphrase: A Unified Extraction and Generation Framework for Keyphrase Prediction-ExHiRD-hChen et al., 20200.2840.017Exclusive Hierarchical Decoding for Deep Keyphrase Generation-CorrRNNChen et al., 20180.320-Keyphrase Generation with Correlation Constraints-CopyRNNMeng et al., 20170.293-Deep Keyphrase Generation-InspecModelPresent-F15Absent-F15Paper / SourceCodeChatGPTMartinez et al., 20230.352 (!)0.049 (!)ChatGPT vs State-of-the-Art Models: A Benchmarking Study in Keyphrase Generation Task-P-AKGWu et al., 20220.26 (!)0.017 (!)Fast and Constrained Absent Keyphrase Generation by Prompt-Based Learning-WR-SetTransXie et al., 20220.3300.025WR-One2Set: Towards Well-Calibrated Keyphrase Generation-BeamKPD-AChowdhury et al., 20220.3220.036KPDROP: Improving Absent Keyphrase Generation-SetTransYe et al., 20210.2850.021One2Set: Generating Diverse Keyphrases as a Set-UniKeyphraseWu et al., 20210.29 (!)0.029 (!)UniKeyphrase: A Unified Extraction and Generation Framework for Keyphrase Prediction-ExHiRD-hChen et al., 20200.2530.011Exclusive Hierarchical Decoding for Deep Keyphrase Generation-CorrRNNChen et al., 2018--Keyphrase Generation with Correlation Constraints-CopyRNNMeng et al., 20170.278-Deep Keyphrase Generation-KrapivinModelPresent-F15Absent-F15Paper / SourceCodeP-AKGWu et al., 2022--Fast and Constrained Absent Keyphrase Generation by Prompt-Based Learning-ChatGPTMartinez et al., 2023--ChatGPT vs State-of-the-Art Models: A Benchmarking Study in Keyphrase Generation Task-WR-SetTransXie et al., 20220.3600.057WR-One2Set: Towards Well-Calibrated Keyphrase Generation-BeamKPD-AChowdhury et al., 20220.3230.078KPDROP: Improving Absent Keyphrase Generation-SetTransYe et al., 20210.3260.047One2Set: Generating Diverse Keyphrases as a Set-UniKeyphraseWu et al., 2021--UniKeyphrase: A Unified Extraction and Generation Framework for Keyphrase Prediction-ExHiRD-hChen et al., 20200.2860.022Exclusive Hierarchical Decoding for Deep Keyphrase Generation-CorrRNNChen et al., 20180.318-Keyphrase Generation with Correlation Constraints-CopyRNNMeng et al., 20170.311-Deep Keyphrase Generation-NUSModelPresent-F15Absent-F15Paper / SourceCodeChatGPTMartinez et al., 2023--ChatGPT vs State-of-the-Art Models: A Benchmarking Study in Keyphrase Generation Task-P-AKGWu et al., 20220.412 (!)0.036 (!)Fast and Constrained Absent Keyphrase Generation by Prompt-Based Learning-WR-SetTransXie et al., 20220.4280.057WR-One2Set: Towards Well-Calibrated Keyphrase Generation-BeamKPD-AChowdhury et al., 20220.4180.079KPDROP: Improving Absent Keyphrase Generation-SetTransYe et al., 20210.4060.042One2Set: Generating Diverse Keyphrases as a Set-UniKeyphraseWu et al., 20210.434 (!)0.037 (!)UniKeyphrase: A Unified Extraction and Generation Framework for Keyphrase Prediction-ExHiRD-hChen et al., 2020--Exclusive Hierarchical Decoding for Deep Keyphrase Generation-CorrRNNChen et al., 20180.358-Keyphrase Generation with Correlation Constraints-CopyRNNMeng et al., 20170.334-Deep Keyphrase Generation-结果解读要点综合上述五张表可以提炼出几条对该领域现状的判断仅基于本仓库收录的数据不涉及仓库之外的信息方法谱系清晰可辨从 CopyRNNMeng et al., 2017基于 copy 机制的序列生成→ CorrRNN2018→ ExHiRD-h2020→ SetTrans/One2Set2021把关键短语当作集合生成→ UniKeyphrase2021统一抽取与生成框架→ WR-SetTrans / BeamKPD-A / P-AKG2022→ ChatGPT 零样本评测2023完整覆盖了 seq2seq、集合生成、统一框架与预训练大模型四条演进路线。absent 关键短语是难点所有模型在 Absent-F15 上的得分都远低于 Present-F15普遍低一个数量级说明生成原文中不存在的短语仍是该任务最具挑战性的部分。统一评测协议的重要性由于各模型均以 KP20K 为训练集、五个数据集为测试集跨数据集、跨模型横向比较在协议上是自洽的但(!)标记提醒读者部分论文未披露 Macro/Micro 口径跨表比较仍需谨慎。ChatGPT 对比基准Martinez et al.2023将 ChatGPT 作为零样本生成式基线纳入对比其在 InspecPresent-F15 0.352上表现突出但在 KP20K 上低于多数专用模型体现了通用大模型 vs 任务专用模型这一当前研究热点。在 NLP-progress 仓库中的定位与维护方式本任务页是 NLP-progress 英文任务板块之一已收录于 README.md 的英文目录中见 Keyphrase Extraction and Generation 条目。从仓库结构看README 的 Wish list 中仍保留 Keyphrase extraction 条目说明该任务领域的数据与结果仍期待社区持续补充。仓库为此提供了完整的维护与消费机制结果表规范README.md 的贡献指南要求结果优先来自已发表论文数据集须至少被一篇非提出论文使用过Code 列应标注官方实现链接。新增结果时只需在对应表格按最佳结果置顶的顺序插入一行并通过编辑页面提交 Pull Request 即可。结构化导出仓库提供了 structured/export.py 解析脚本可将 Markdown 中的任务描述、数据集说明与 SOTA 表格自动解析为机器可读的 JSON。从源码看其解析逻辑extract_sota_table以表头是否包含 Model 列与 Paper/Source 列作为 SOTA 表的识别依据——这正是本任务页五张结果表所遵循的列格式extract_dataset_desc_links 则负责抽取数据集描述中的链接。运行方式见 structured/README.md在仓库根目录执行python structured/export.py english即可将english/目录含本任务页导出为structured.json可用--output参数自定义输出文件名。本地站点构建若需在浏览器中预览任务页效果可按 jekyll_instructions.md 的步骤用 Jekyll 构建站点bundle exec jekyll serve本地预览地址为http://localhost:4000站点主题配置见 _config.yml表格与图表组件分别位于 _includes/table.html 与 _includes/chart.html。结语关键短语提取与生成是从序列标注到序列生成的经典任务迁移样本present 关键短语使它可以被建模为抽取问题absent 关键短语又把研究推向生成范式。通过本任务页的数据集体系、评测约定与五张 SOTA 基准表研究者可以在统一协议下快速定位自己方法的位置而借助 NLP-progress 仓库的贡献流程与结构化导出工具实验结果可以被持续沉淀、比对并被机器可读地引用。若需获取最新或更细粒度的结果可直接查阅仓库中 english/keyphrase_extraction_generation.md 的持续更新版本。赞分享NLP知识库文档【免费下载链接】NLP-progressRepository to track the progress in Natural Language Processing (NLP), including the datasets and the current state-of-the-art for the most common NLP tasks.项目地址https://gitcode.com/gh_mirrors/nl/NLP-progress点击查看免费下载相关推荐终极教程使用windows-imaging-tools自动化生成多环境Windows镜像KVM/VMware/Hyper-V终极教程使用windows imaging tools自动化生成多环境Windows镜像KVM/VMware/Hyper V windows imaginNLP知识库文档如何让AI智能代理帮你管理日程、控制设备Fay数字人框架实战指南如何让AI智能代理帮你管理日程、控制设备Fay数字人框架实战指南 你是否曾经想过如果能有一个AI助手不仅能和你聊天还能主动帮你安排日程、控制智能设备、查询NLP知识库文档如何在Blender中集成Stable DiffusionAI-Render完整实践指南如何在Blender中集成Stable DiffusionAI Render完整实践指南 AI Render是一个革命性的Blender插件它直接将StabNLP知识库文档上一篇marshmallow Schema完全指南flask-smorest数据处理的终极武器下一篇突破设备壁垒Vue.Draggable组件的BrowserStack跨设备测试方案创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考