今
🤖 AI行业 · 语料版权
🔥 互联网AI生成内容泛滥导致"数据污染",旧书成了大模型眼中最后一片"纯净语料"。
一、AI扫货旧书:从废纸到硬通货
近期,多家AI公司被曝通过中间商大量收购二手旧书,单... 展开 ▼
🤖 AI行业 · 语料版权
🔥 互联网AI生成内容泛滥导致"数据污染",旧书成了大模型眼中最后一片"纯净语料"。
一、AI扫货旧书:从废纸到硬通货
近期,多家AI公司被曝通过中间商大量收购二手旧书,单笔订单规模从1000本到100万本不等,几乎不挑题材、不讲价格。一位书商透露,过去一周只能卖20本书,如今每周销量飙升至数百本。这背后的逻辑并不复杂:据研究机构数据,2025年以来互联网新增内容中超51%为AI生成,继续用网络文本训练模型无异于"用AI垃圾喂AI",极易导致模型质量断崖式下跌,业内称之为"模型塌缩"。正是在这个背景下,#AI公司被曝大量收购旧书#,把目光投向2022年前出版的人类原创文本——那些没有经过任何机器"加工"的纯粹信息。
旧书回收行业的游戏规则随之改写:定价权从"品相+稀缺性"变为"出版年份优先",2022年前出版的任何书籍自带溢价。地方志、冷门学术专著、80年代通俗读物等曾经的"长尾库存",一夜之间变成了AI公司眼中的"数据金矿"。
二、"巴拿马计划"曝光:扫完即毁的流水线
这场旧书抢购潮并非都市传说。据外媒披露的法庭文件,Anthropic公司内部曾运行一个代号为"巴拿马计划"的项目,斥资数千万美元全球收购二手书。操作流程堪比工业流水线:书籍运入厂房后直接切断书脊胶装,打散书页送入高速扫描仪逐张拍摄,电子化完成后,实体书即被销毁。这意味着这些凝聚几代人智慧的纸质文本,在变成训练数据后便从物理世界消失,沦为少数巨头的私有"数字石油"。
虽然Anthropic后续因版权问题以15亿美元达成和解,但这起判例也让"训练数据版权"成为悬在AI行业头上的法律利剑。行业内正在热议,AI公司批量收购旧书的行为边界究竟在哪里——买书不违法,但扫描转训练是否构成侵权,全球尚无统一裁决标准。
三、旧书被掏空,知识谁来守
值得对比的是,图书馆和文博机构做古籍数字化,目的是保护原件的同时方便公众查阅,原件仍在恒温恒湿库房妥善保存。而AI公司把实体书当作"一次性耗材"处理,读完即弃,背后折射出一种对待知识的工具化态度。当商业和技术狂奔时,那些看得见摸得着的纸质书,或许比我们想象的更加珍贵。
专家建议,个人家中的老教材、地方文史册子等不要当废纸随意出售,可捐赠公共图书馆或卖给真正爱书之人。对于那些不说明用途的批量扫货行为,多留一个心眼,就是对自己过往知识积累的一份尊重。
综合今日头条、新浪乐迷公社、澎湃新闻报道 | 2026年8月2日
收起 ▲