拓冰建站拓冰建站
首页 / 资讯中心 / 正文

亚马逊开始买旧书训练 AI:大模型真正缺的,可能已经不是算力了

今天看到一条新闻Amazon 在大量购买一些稀有、绝版甚至网上根本找不到电子版的实体书。这些书被送到专门的处理设施直接切掉书脊、拆页、高速扫描数字化之后再用于 AI 相关的数据处理。书基本也就没了。第一眼看到的时候我关注的其实不是“Amazon 居然开始拆书”这件事而是另一个问题现在的大模型是不是真的开始缺数据了这里说的“缺”并不是互联网上没东西可抓了。恰恰相反现在网上的内容比任何时候都多。问题是还能不能找到足够多的、干净的、真正由人产生的数据。这几年做大模型最容易拿到的训练数据基本都在公开互联网里。网页、论坛、新闻、论文、GitHub、问答网站大规模爬取之后清洗、去重、分类再进入预训练或者后训练流程。这套方法以前很好用。但到了现在有个问题越来越绕不过去你今天重新抓一遍互联网里面到底有多少内容已经是模型写的博客是 AI 写的SEO 文章是 AI 批量生成的论坛回答里也混着 AI代码仓库里甚至开始出现大量 Copilot、Claude Code 之类辅助生成的代码。于是会出现一个挺尴尬的情况模型正在越来越多地吃自己生产出来的数据。从训练角度看这并不是一个特别理想的状态。因为生成数据当然可以用甚至很多模型训练本身就会主动使用 synthetic data。但前提是你知道这些数据是怎么来的、质量怎么样、由什么模型生成、经过什么筛选。最麻烦的是另一种情况AI 生成内容已经混进公开互联网你抓数据的时候根本分不出来。久而久之训练集里面的人类原始分布会越来越少模型自己的语言习惯、错误模式和偏差反而可能被一轮轮放大。这也是为什么2022 年以前的内容现在反而越来越有价值。一本 1995 年出版、从来没有电子化的小众专业书过去看可能只是旧书市场里几十美元的一本书。但站在模型公司的角度它有几个很特殊的属性它大概率完全由人写成没有被 ChatGPT 改写过网上没有重复版本可能从来没有进入过主流训练集而且经过出版、编辑和校对信息密度往往比普通网页高。这种数据突然就有价值了。这也是 Amazon 买这些旧书让我觉得很有意思的地方。我们以前讨论 AI 基础设施最容易想到的是 GPU、显存、网络、存储、推理成本。但模型继续往下做数据本身其实也正在变成一种基础设施。而且这个资源可能比算力更麻烦。GPU 不够还能买至少理论上供应链成熟以后是可以扩的。模型架构也很难形成永久壁垒今天一家做出来过一段时间论文、开源实现、工程经验都会慢慢扩散。但一份别人从来没有拿到过的数据不一定能复制。比如企业几十年的内部知识库、医生积累的病例、制造业现场数据、专业领域文档、没有数字化的档案甚至就是这些从来没有上过互联网的旧书。这些东西以前可能只是“资料”。现在开始变成训练资产。我甚至觉得接下来模型厂商真正拉开差距的地方可能越来越不只是模型参数多少、benchmark 高几分而是谁能拿到更好的数据以及谁能把自己的数据闭环跑起来。包括现在大家都在做 Agent也会碰到类似的问题。Agent 本身的框架其实越来越容易做模型 API 也可以买。但真正决定一个 Agent 能不能在某个行业里长期工作的最后还是它能不能接触到企业真实的数据、流程、反馈和结果。没有这些东西换再强的模型很多时候还是一个“很聪明但不了解业务的人”。所以回头看 Amazon 拆旧书这件事我倒不觉得它只是一个猎奇新闻。它更像是一个信号互联网这个曾经几乎免费的 AI 数据矿正在变得越来越脏也越来越不够用了。下一阶段的竞争很可能会重新回到那些过去大家觉得很传统的东西上——档案、数据库、行业资料、企业内部数据甚至纸质书。有时候技术发展挺有意思。我们花了几十年把所有东西数字化现在为了训练最新的 AI又开始回头找那些还没来得及数字化的东西。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门