吖亮V 发表于 2026-8-7 13:31:26

AI巨头毁书200万,中国出版社连夜贴避妖符

太讽刺了。
2026年,AI巨头拆书训练模型的旧账被集中曝光。
中国出版社也开始在版权页写下“禁止用于人工智能训练”。



一边急着给大模型喂数据,一边忙着给版权上锁。



2021年,Anthropic联合创始人本·曼恩先下载了Books3。
至少500万份LibGen图书随后被搬进服务器,PiLiMi又送来至少200万份。
Claude还没公开上线,Anthropic内部已经攒下超过700万份电子书。



虽然书先拿到了,授权却没有逐本跟上。
2023年3月,Claude正式上线。



随着用户越来越多,那700多万份电子书的来源也开始变成Anthropic绕不过去的风险。



2024年2月,公司招来汤姆·特维。
他曾参与谷歌图书扫描项目,进入Anthropic后,先联系大型出版社,询问AI训练授权。



邮件发出去了,大规模许可却没有跟着落地。
出版社没有交出整套书库,Anthropic的采购单很快转向图书经销商、零售商和二手书商。
数百万美元花出去,数百万册纸书被买下,再整箱整箱送进扫描服务商。



服务商拆掉装订,切开书脊,把完整图书变成一摞散页。



到了扫描厂,几道工序又把它拆回散页。
这项计划后来在诉讼材料中被披露为“Project Panama”。



一家服务商曾提出,六个月可以处理50万至200万册。
最终完成数量仍被遮盖,美国法院确认的是“数百万册”,不是正好200万册。



2024年8月19日,安德烈娅·巴茨、查尔斯·格雷伯和柯克·华莱士·约翰逊起诉Anthropic。
一类来自书店和二手渠道。



Anthropic付过书钱,拆掉纸本,只保留内部电子副本。
另一类来自LibGen、PiLiMi等盗版书库。
这些作品没有逐本购买,也没有逐本取得许可,却被整批下载,长期保存在公司书库里。



2025年6月23日,法官威廉·阿尔苏普把训练、纸书扫描和盗版下载分开处理。
在本案三名原告和现有证据范围内,法院认为,模型训练具有转化性,可以认定为合理使用。
Anthropic买下一册纸书,毁掉纸本,只留下一个内部电子副本。



但LibGen和PiLiMi部分没有过关。



2025年,双方谈定15亿美元和解。
2026年7月,法院最终批准方案,超过48.2万部作品被纳入。



美国法院刚把两种拿书方式分开,中国出版社已经开始把训练限制写进版权页。



2026年3月17日,华夏出版社出版《新译黄庭经 阴符经》。
读者翻到版权页,会看到一句过去很少出现的话:
“禁止将本书内容用于人工智能训练,违者必究。”
这句话随新书一同印出,并非8月临时加上。



8月4日,华夏出版社负责人解释,部分引进版图书的权利方,已经把禁止AI训练写进合同。
出版社签下合同后,再把限制印到版权页,一些非引进版图书随后也加入类似声明。
没有全国出版社统一行动,也没有“连夜贴避妖符”的官方通报。
出版社把用途边界提前写进书里,训练名单却仍掌握在模型公司手中。






模型公司买走一本纸书,却可能把内容长期留在商业系统里。



华夏出版社把“不准用于AI训练”印上版权页,也把这笔账摆到了台面上。
技术可以继续向前跑,版权边界也要跟上。
让创作得到尊重,让授权透明,下一本好书才有人愿意写,读者才能继续读到有价值的内容。
页: [1]
查看完整版本: AI巨头毁书200万,中国出版社连夜贴避妖符