六份阿里财报,如何从 PDF 变成一张可计算的表

发布时间:2026/8/3 4:00:07
六份阿里财报,如何从 PDF 变成一张可计算的表 本文截图均来自 InfiniSynapse 的公开只读任务已裁去侧栏、账号信息和无关任务。企业知识库里最常见的材料往往不是一张已经整理好的数据库表而是 PDF 年报、Word 报告、研究文档和扫描件。这些文件看起来是“非结构化文档”但里面又包含大量结构化内容财年、营收、净利润、单位、表头、行列关系。真正困难的不是让 AI 读懂一句话而是把散落在多份文档里的这些字段提取出来、对齐口径、映射成表再交给计算引擎继续处理。这次我们用一个公开任务演示完整过程从 InfiniSynapse 知识库中分别查询阿里巴巴 FY2021—FY2026 六个财年的营收和净利润先映射成表再计算同比增长率并生成图表。用户给出的要求很明确六个财年要分别查不能直接凭一段摘要计算查完以后要先建表再算增长率。这条指令看似简单实际上要求系统连续完成四种不同工作在知识库中找到六份不同财年的年报证据从每份年报中提取营收、净利润和单位把六次检索结果映射到统一表结构对表执行跨行计算并把结果变成可复查的表格和图表。第一步不是“一次问完”而是逐财年查知识库InfiniSynapse 先把任务拆成 FY2021、FY2022、FY2023、FY2024、FY2025 和 FY2026 六次知识库查询。为什么要分六次查因为每个数字都需要回到对应财年的年报。若把六年问题压缩成一次宽泛检索模型可能只命中其中一两份文档或者把不同财年的字段混在一起。逐年查询会多花一些时间但证据链更清晰也更容易发现漏项。例如FY2021 的查询结果明确返回营收717,289 百万元人民币净利润143,284 百万元人民币财年截至 2021 年 3 月 31 日。同样的动作继续执行到 FY2026。过程中 FY2025 首次检索返回空结果任务没有把空值直接带入计算而是换一种查询表达重新检索。这一点很重要知识库分析不是“搜不到也往下算”而是先补齐证据再进入下一阶段。当六个财年的数据全部拿到以后任务才宣布进入表映射阶段。第二步把文档里的字段映射成表六次检索返回的仍然是六段文本答案。它们已经可读但还不适合直接做跨年计算。为了让计算引擎接手需要先把每条结果规范成稳定字段字段含义fiscal_year财年如 FY2021fiscal_period财年区间revenue_rmb_million营收统一为百万元人民币net_income_rmb_million净利润统一为百万元人民币这一步就是“从非结构化数据里提取结构化内容”的关键输入仍然来自 PDF 年报但输出已经不再是一段自然语言而是一组能够装入表格的行和列。任务先把六个财年的结果组织成 JSON再加载为临时表。完成映射以后系统明确提示数据已经成为表现在可以计算同比增长率。最终得到的基础表如下。它不是手工复制出来的展示表而是从六份年报检索结果映射而来财年财年区间营收百万元人民币净利润百万元人民币FY2021Apr 2020 – Mar 2021717,289143,284FY2022Apr 2021 – Mar 2022853,06247,079FY2023Apr 2022 – Mar 2023868,68765,573FY2024Apr 2023 – Mar 2024941,16871,332FY2025Apr 2024 – Mar 2025996,347125,976FY2026Apr 2025 – Mar 20261,023,670102,127这里有三个容易被忽略、但决定结果能否计算的细节财年必须对齐。FY2026 指截至 2026 年 3 月的财年不能把自然年直接混进来。单位必须统一。六行数据都使用“百万元人民币”否则同比计算会失真。字段必须固定。“收入”“营收”“Revenue”最终要进入同一列净利润同理。第三步让 SQL 计算而不是让模型心算数据成为表以后同比增长率就可以使用窗口函数计算。核心逻辑可以简化为ROUND((revenue-LAG(revenue)OVER(ORDERBYfiscal_year))/LAG(revenue)OVER(ORDERBYfiscal_year)*100,2)净利润增长率使用相同方法。FY2021 是基准年没有上一行因此增长率留空FY2022—FY2026 则逐行与上一个财年比较。计算结果是财年营收增长率净利润增长率FY2021——FY202218.93%-67.14%FY20231.83%39.28%FY20248.34%8.78%FY20255.86%76.61%FY20262.74%-18.93%这正是“先映射成表再做计算”的价值检索模型负责从文档中找证据表结构负责保存统一后的数据SQL 负责可重复的计算最终表负责让人复查每一行。如果后续需要增加毛利率、经营利润、自由现金流等指标只需要扩展字段和查询不必重新发明一套计算过程。若企业还有数据库中的经营数据也可以在相同的表空间里继续做关联分析本次公开任务只使用知识库资料没有声称使用数据库。第四步把结果变成一眼能读懂的图表适合精确核验图适合快速观察趋势。任务生成了营收趋势图和同比增长率图。从结果表可以直接看到六年营收从 717,289 百万元人民币增长到 1,023,670 百万元人民币但年度增速并不是一条直线净利润的波动更明显FY2022 和 FY2026 为负增长。图表用于快速浏览表格仍是精确复核的基准。当前公开任务生成的趋势图主要清晰展示了营收柱增长率图中的负值也不如表格直观因此涉及具体数字时应回到上面的结果表而不是只凭图形判断。真正可复用的不是这六个数字六份阿里财报只是一个例子。更值得复用的是这条数据链非结构化文档 → 逐份检索 → 字段提取 → 单位与口径统一 → 映射成表 → SQL 计算 → 表格与图表交付它适用于很多企业场景从多家上市公司的年报中提取同一组财务指标从合同和报价单中提取客户、产品、金额和日期从研究报告中整理行业规模、增速和预测区间从审计材料中提取异常项再与业务表进行核验从项目周报中提取里程碑、负责人和延期天数。传统知识库通常停在“帮我找一段答案”。InfiniSynapse 希望继续向前一步不仅找到答案还把答案变成可以继续计算、关联和复查的数据。这也是为什么“映射成表”不是一个排版动作而是知识库从问答工具走向数据分析工具的分界线。你可以直接打开这个公开只读任务查看六次知识库检索、数据映射、SQL 计算和最终交付的完整过程。说明本文展示的是公开任务中的分析流程与结果不构成投资建议。具体财务指标应以公司正式披露文件为准。