大型AI模型的饥渴:二手书籍成新资源

3557

最近在东京的神田神保町,作为世界上最大的古书店街之一,出现了一种令人困惑的现象。这里的书店老板们在接待一些不寻常的“大客户”。这些客户并非是戴着老花镜的老学者,也不是对文献情有独钟的收藏家,更不像是普通的读者。他们购买书籍时,对作者、知名度、装帧甚至品相毫不挑剔。无论是昭和年代的地方志、陈旧的法律判例集,还是被淘汰的医学手册,甚至是无趣的农业统计册,只要是有文字的书籍,统统都被收入囊中。某些书店一天内被买走上百本,个别商家的销售量甚至超过了千册。这些买家的账号风格各异,但包裹都指向同一个跨境物流转运站。随着日本媒体的调查发现,自去年以来,超过50吨的二手书籍被运往美国,人们才明白这并非普通读者的疯狂购物,而是一场由全球算力巨头发起的“纸质文化扫荡”。按每本书500克计算,50吨即是十万本纸质书。这些隐藏在书架上、积满灰尘的知识,正在被大量装箱,送往远洋彼岸。究竟是什么原因导致高科技AI公司突然对这些纸质书产生如此强烈的需求呢?答案既令人惊奇又讽刺:随着互联网几乎被完全吸收,大型模型开始转向“吃纸”。

一、互联网内容告罄,大型模型面临数据短缺

在过去的几年里,人工智能的发展策略十分简明粗暴:追求极大规模。只要模型大、数据多,AI的智能就会不断提升。硅谷的爬虫程序就如同蝗虫一般,迅速抓取全球网站上的维基百科、论坛、新闻,还有社交媒体的各种争论。然而,网络上人类留下的文字终究是有限的。权威的AI研究机构Epoch AI发布了令人担忧的预测,认为按照当前大型模型对数据的消耗速度,互联网上累积的高质量文本数据将在2026年前后被耗尽。这被硅谷科学家称为“数据墙”。更令人担忧的是,一个充斥着AI生成的营销内容和水军垃圾信息的网络环境,若被AI继续利用,便可能导致灾难性后果。如剑桥大学与牛津大学的研究指出,让AI使用其生成数据进行训练,将导致模型输出变成毫无逻辑的胡言乱语。相当于一位画家只临摹印刷品,经过几代后,画作只剩模糊的噪点。这种“算力近亲繁殖”会大幅降低AI的智力。在面对日益枯竭的网络数据和铺天盖地的垃圾信息时,硅谷的巨头们开始把目光转向全球,发现那些未被数字化的实体书籍正是最纯净、逻辑深邃的“高蛋白数据源”。

二、从优雅的抓取到粗暴的拆解:硅谷的数字化之道

既然从互联网获取的数据已经无以为继,目标就转向了纸质书籍。或许你以为 AI公司会通过雇佣工作人员逐页翻阅和扫描书籍?其实,科技巨头对效率的追求远远超过了我们的想象。他们在将纸质书转化为训练集的过程中,采用了一种极具工业化的手法。此前,外媒曾报道AI公司Anthropic的某种操作:为了迅速获取大量优质文本,他们建立了一条“图书数字化流水线”。这样一来,巨头们购买大量实体书,甚至对书籍的内容并不关注,直接将其送入工业级的切纸机。随着铡刀的落下,珍贵的书脊瞬间被切除,每本厚重的书籍变成成百上千张薄纸。接下来,这些纸张被投入高速工业扫描仪,以每分钟百余页的速度转换为高分辨率图像。最后,最新的光学字符识别(OCR)模型将图像中的文字、排版和表格迅速提取为结构化的数字文本。这便是所谓的“拆书炼丹”,一本倾注了作者一生心血的著作,在短短几秒内经历从物理消亡到数字化的过程。书脊断裂的声音,犹如大型模型吞噬人类文明的声音。

三、为什么日本的古旧书籍特别受青睐?

在这场全球的“纸质文本抢购战”中,日本的二手书籍为何成为硅谷的“优质资源”?首先是因为数据的纯度和排版质量极高。自近现代以来,日本拥有庞大的出版业,具备精湛的印刷工艺和规范的排版。这类纸张和印刷质量使得现代OCR软件的识别准确率几近99.9%。相比之下,其他语言的旧书常常因质量参差不齐,影响扫描效果,而日本古书却较少出现此类问题。其次,这些书籍中蕴含着难以替代的领域知识,这次神秘买家购买的大多是地方志、过期法律判例集以及昭和时代的行业报告。这些书籍在当时通常发行量不多且罕有人上传到互联网,里面记载的社会运行逻辑和历史细节,是现代网页无法提供的深刻洞见。

与足球为伴,感受力量与智慧交织的精彩!...

与足球为伴,感受力量与智慧交织的精彩!...