AI焚书还是合理转型?Anthropic"巴拿马计划"曝光的背后

2026年08月04日 | IT深度观察

事件始末:从法庭文件到公众哗然

2026年8月1日,随着越来越多细节浮出水面,一场本应在2025年6月就已定谳的官司再次引爆舆论——AI公司Anthropic为训练Claude模型,通过代号"巴拿马计划"(Project Panama)的工程,大规模购买实体书籍进行数字化,再将数百万册纸质书直接销毁。

这不是简单的"电子化存档"。根据美国北加州联邦法院2025年的判决书,Anthropic在2024年聘请前Google Books主管Tom Turvey,向Better World Books、World of Books等二手书商批量采购2022年以前出版的旧书, Józef 液压切割机去除书脊,工业扫描仪逐页成像,纸质残骸随后直接进入回收流程。整个项目预估耗资数百万美元,预计在六个月内将50万至200万册实体书数字化转型。

法院的判决充满张力:法官William Alsup裁定,这种"买书→扫描→销毁"的模式属于美国版权法中的合理使用,理由是过程具有转化性,且并未增加副本数量。但同一案件的另一面——Anthropic因从"创世纪图书馆"等盗版平台下载约700万册电子书用于训练——被判赔15亿美元,成为美国版权诉讼史上金额最高的和解案。

舆论反弹:焚书坑儒的现代版本

法院说"合法",但舆论并不买账。2026年8月的报道显示,被扫描销毁的不只是普通旧书,还包括孤本和极稀有的绝版书——市场可能仅存一两本。

马斯克在相关报道下直接留言:"SpaceX AI绝不会这么干。"这句话的弦外之音直指问题的核心:当AI公司在追求训练数据"纯度"时,是否已经跨越了某种不可言说的底线?

批评者指出,Anthropic偏好采购2022年前的书籍,是因为那个年代的文本不含AI生成内容,质量最为纯粹。但问题是,这个"纯净"标准直接导致了绝版书的加速灭绝。当最后一本实体书被液压机压碎时,那个保证——文字和思想能继续留在世界上某个角落——就不复存在了。

行业潜规则:从Anthropic到全行业的"数据饥渴"

Anthropic绝非孤例。根据已披露的信息,Google、Meta等公司都在进行类似操作,甚至出现了专门面向AI公司的匿名批量书籍供应商,单次采购规模可达百万册。OpenAI和微软选择了不同的路——与哈佛大学图书馆合作,使用近百万本公版书籍训练AI,同时保留实体原件。

两种路径的分野清晰可见:一种是"读完就扔"的消耗模式,另一种是"边读边藏"的图书馆模式。但两者共同面临的困境是一样的——训练数据的天花板正在逼近。

深度分析:数据伦理的三个层面

第一层:法律与伦理的灰色地带

"合理使用"的法理逻辑成立,但对文化传承的损害却不在法律考量的范围内。法律不会因为一本书是孤本就阻止扫描,但文化遗产的消失是不可逆的。这是典型的"合法但不合理"场景。

第二层:AI产业的数据饥渴悖论

AI模型对高质量语料的需求是无止境的,而互联网已经充斥着大量AI生成的低质内容,形成"污染递传"的循环。2022年以前的纸质书成为最后一批可靠的高质量人类文本,这让AI公司对旧书产生了近乎偏执的依赖。

讽刺的是,Anthropic在盗版数据上赔了15亿美元,却从未为合法出版的纸质书向作者支付一分钱。版权法的边界在这里显得极为荒诞:保护商业盗版的代价比保护纸质书高价更高。

第三层:技术路线的文化代价

AI行业正面临一个根本性选择:能否在不毁灭知识载体的前提下,实现知识数字化?非破坏性扫描技术早已存在(Internet Archive就是典型),AI公司选择破坏式扫描,不是因为技术做不到,而是因为成本更低、速度更快。

当"效率"成为唯一标准,文化遗产就变成了可以被牺牲的代价。

未来走向:行业需要一场关于数据的契约

这场争议的核心,不是某一家公司是否违法,而是整个AI产业的数据采集伦理是否需要一个根本性的重塑。

可以预见的方向:

结论

Anthropic的"巴拿马计划"揭示了一个冷酷的真相:当前的AI发展范式,本质上是一种"消耗性创新"——以消耗高质量人类文化遗产为燃料,追求模型能力的边际提升。

法律可以容忍这种消耗,市场可能鼓励这种效率,但文明不该对此缄默。当AI公司在法庭上赢了官司,却在文化传承上输了道义,这或许是整个行业都需要反思的拐点。

AI的未来不该建立在对过去的废墟之上。


参考来源: