HyperAIHyperAI

Command Palette

Search for a command to run...

AI公司批量采购绝版纸质书用于模型训练

自2024年初起,Anthropic等人工智能企业悄然启动全球实体书采购行动。受互联网语料被AI生成内容污染引发的模型坍塌危机驱动,2022年前出版的纸质书成为稀缺的高质量训练数据源。为此,Anthropic秘密推行巴拿马计划,委托2077AI等中间商在全球二手市场批量收购绝版书,经高速工业扫描提取文本后,将纸质原籍作为废料销毁。该操作虽引发欧美旧书商困惑,但得益于美国法院裁定合法购买并扫描销毁属转化性合理使用,企业得以规避版权风险,并于2026年7月以15亿美元达成和解。 此举凸显大模型数据获取的合法悖论与文化遗产危机。尽管AI巨头试图通过规模化采购独占知识资源,但人类历史出版书籍总量仅能提供约三十至四十万亿字词,远难满足下一代模型的数据需求。事件曝光后,科技界与创作者强烈反弹,多方呼吁建立非破坏性采集标准并重塑版权分配机制。在算法渴求与文明存续的博弈中,实体书的物理消亡正深刻映射出人工智能数据伦理的结构性困境。

相关链接