拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Hyper-Extract 模板最佳实践:清晰描述、具体规则、双语支持指南

Hyper-Extract 模板最佳实践清晰描述、具体规则、双语支持指南【免费下载链接】Hyper-ExtractHypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.项目地址: https://gitcode.com/GitHub_Trending/hy/Hyper-ExtractHyper-Extract 是一个用 LLM 将非结构化文本转化为结构化知识图谱、超图、时空抽取的开源工具。而YAML 抽取模板正是它聪明程度的核心所在——同样的文档模板写得越清晰抽取质量越高。本文分享 Hyper-Extract 模板设计的最佳实践如何写清字段描述、如何制定具体抽取规则、以及如何正确支持中英双语。先认识模板一份 YAML 决定抽取质量Hyper-Extract 的模板由几个固定区块组成。以财报摘要模板 earnings_summary.yaml 为例每个模板包含区块作用类比description模板整体用途说明简历的个人简介output定义抽取哪些字段、什么类型表格的表头guideline告诉 LLM 如何做好抽取作业要求的评分标准identifiers定义实体/关系的唯一标识数据库的主键display控制展示时的标签格式页面的显示样式完整的设计规范见 DESIGN_GUIDE_zh.md官方模板库位于 templates/presets/按 general、finance、legal、medicine、tcm、industry 等 7 个领域组织。最佳实践一清晰描述拒绝模糊字段描述要自包含每个字段的description是 LLM 理解字段含义的唯一依据。好的描述应该包含格式示例和取值范围让 LLM 不需要猜测- name: quarter type: str description: zh: 财报季度格式如2024Q3对比模糊写法季度——前者直接给出格式规范LLM 输出会稳定得多。target 要指定角色与职责guideline.target相当于给 LLM 的岗位说明书应明确角色 任务 质量要求target: zh: 你是一位专业的投研分析师负责从财报电话会议记录中准确提取业绩数据和关键信息。三条快速自检✅ 每个字段的description都能让陌生人看懂字段含义✅description给出了格式或取值示例如2024Q3、积极/中性/消极✅target写清了角色和具体职责而非只写你是一个助手最佳实践二具体规则划清 Schema 与 Guideline 的边界这是新手最容易踩的坑。Schema 定义是什么Guideline 定义如何做好两者不应互相重复。应该写在outputSchema应该写在guidelineGuideline字段名称、类型抽取策略提取精确数字与原文一致字段描述质量要求语调评估基于管理层措辞必填/可选常见错误提示❌ 反例在guideline里写提取 name 字段作为实体名称——这只是在重复 Schema 定义。 ✅ 正例写只提取文本中出现的全名不提取代词——这是 Schema 里没有的抽取约束。控制字段数量每组件不超过 5 个实体、关系的字段建议≤ 5 个按必要 → 重要 → 可选排序如source/target必要type/time重要description可选。超限时优先拆分模板或删减冗余字段。命名统一减少歧义元素规范示例模板名PascalCaseEarningsSummary字段名snake_casecompany_name关系类型字段固定用type不用relation_type时间字段固定用time不用event_date这些自动修复规则在 rules-naming.md 中有完整定义规则与 Guideline 边界问题可参考 rules-consistency.md。最佳实践三双语支持语言纯净是核心正确姿势zh/en 各写一份互不混杂language: [zh, en] description: zh: 财报会议摘要模板 - 从财报电话会议记录中提取公司业绩、预期对比和前瞻指引 en: Earnings Call Summary Template - Extract company performance, guidance from transcripts核心原则是语言纯净zh字段必须是纯中文en字段必须是纯英文。❌zh: 类型entity(实体)—— 中英混杂✅zh: 类型实体/en: Type: entity哪些能翻译哪些不能翻译根据 multilingual 技能 的定义可翻译不可翻译description、output.descriptionname、type、tags每个字段的fields[].description字段名name: company_name保持原文guideline.target、guideline.rulesidentifiers、display常见术语对照实体→entity、过程→process、关系→relation、高/中/低→high/medium/low。单语言模板升级双语只需两步将language: zh改为language: [zh, en]给每个可翻译字段补一个en子字段并整体校验术语一致性用 he template validate 一键体检模板写完后运行校验命令即可按 HE-T001–HE-T009 检查码体检实现见 validator.pyhe template validate my_template.yaml关键检查项 error 级YAML 可解析、标识字段存在于 schema、relation_members类型匹配 warning 级声明语言缺失、字段数超过 5、与内置预设重名校验器还能自动发现zh 字段混入英文术语这类双语问题是发布前最后一道防线。抽取效果一份好模板长这样下图是用模板抽取后he show的可视化界面——节点、关系、描述都来自模板定义的 Schema最佳实践速查清单☑️描述自包含每个字段description带格式示例☑️边界清晰Schema 管是什么Guideline 管如何做好不互相重复☑️规则具体提取与原文一致的精确数字而非提取数字☑️字段克制每个组件 ≤ 5 字段按必要/重要/可选排序☑️命名统一type、time、snake_case标签小写☑️语言纯净zh 纯中文、en 纯英文字段名不翻译☑️过一遍校验he template validate无 error 再交付完整工作流可参考官方技能包 hyperextract-skills/ 中的 brainstorm → designer → optimizer → validator 流水线以及 模板选择指南 和 模板格式文档。【免费下载链接】Hyper-ExtractHypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.项目地址: https://gitcode.com/GitHub_Trending/hy/Hyper-Extract创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门