拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Leveraging Language Models for Interpretable Analysis of Narratives in a Large Corpus

文章核心总结与翻译一、主要内容本文提出了一种可解释的混合框架,用于大规模文本语料库的叙事分析,核心是将词袋模型(BoW)的主题建模与基于大型语言模型(LLM)的问答(QA)叙事模型相结合,共享再生核希尔伯特空间(RKHS)的潜在表示。核心流程主题筛选:通过BoW主题模型对语料库进行无监督主题学习,由LLM筛选出与用户兴趣相关的主题及对应文档;问答生成:LLM设计分类问题并对筛选后的文档作答,将文档转化为结构化的QA向量;叙事建模:基于QA数据构建双softmax叙事模型,每个叙事对应一组问答概率分布(PMF),可解释为对语料的连贯视角;高效推断与外推:通过函数梯度下降实现模型学习,借鉴Transformer架构设计上下文问答外推机制,无需重复查询LLM即可预测未标注文档的问答结果;多场景验证:在联合国大会演讲(2002-2007)、NeurIPS会议论文(1987-2019)等数据集上验证,支持跨语言分析(中英双语)。关键优势可解释性:从问题设计、叙事结构到证据溯源均透明可审计;高效性:减少LLM重复调用成本,支持大规模语料扩展;灵活性:适配多语言、多领域(地
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门