|
|
新智元报道% ^. o( p: q* v! y$ c
编辑:倾倾5 p9 O6 f, ~1 t1 S! o8 ~
【新智元导读】3月16日,大英百科全书联合韦氏词典,起诉了OpenAI,并且罗列了ChatGPT的「四宗罪」。不要觉得Britannica心狠,此前ChatGPT编造错误信息,却把来源伪托给Britannica。OpenAI未作回应。' F9 b9 W: [2 l$ \( q
OpenAI又被起诉了。; G1 n8 S3 i3 H2 f
3月16日,大英百科全书联合旗下的韦氏词典,对OpenAI提起诉讼。
# r. H- O% D) p6 r) S: |3 ?$ i2 d1 G原因是,它认为ChatGPT进行了大规模的版权侵权。) b3 x ^) a& E# l0 b
Britannica比所有原告准备得更充分:它紧抓训练数据抓取、模型记忆输出、RAG实时检索,同时追加《兰纳姆法》商标侵权。8 P0 }1 r6 W, m8 A0 r1 U
这是AI版权诉讼史上,第一次有人试图把整条生成链路一锅端。
2 u4 o/ t1 Z" v& NGPT-4能逐字默写大英百科, o& W, q! @) u0 z
根据TechCrunch报道,Britannica直接点名GPT-4,认为它已经记住了其大量版权内容,能够按需输出近乎逐字逐句的复制品。
& m$ m0 x* @0 H: \6 c G不是相似,不是接近,是逐、字、复、制。1 m9 s% x/ z# A: H2 M" D! Q
这背后有一定的技术依据。斯坦福和耶鲁的研究团队曾做过实验,从主流大模型中提取《哈利·波特》原文,最高提取率达到96%。# C+ Z+ t! a" I' j2 t- f
6 V! S9 _ {' ?& [3 O+ x- E9 E3 Q
4 \" }2 ]9 q d* [( e7 r6 H也就是说,训练数据里的内容,有相当一部分被记在了模型权重里,在特定提示词下可以几乎原样还原。
6 p2 W" F, F, u0 {, S( H$ E, DBritannica持有的版权内容规模并不小。它旗下近10万篇在线文章、百科条目和词典释义,覆盖从科学、历史到文学的几乎所有主要知识领域。
1 z& `' `, H V这些内容由专业编辑和学科专家历经数十年积累而成。在维基百科崛起之前,这套体系就是人类知识的标准索引。
! r5 b( z6 G# \3 Z: V4 i而OpenAI一直在灰色地带游走。. }& |4 I* x% q, Q: p
查一次资料,也算侵权
0 o& H1 q/ G# z此前,各方一直在争论:用我的内容训练模型,算不算版权侵权?
! C: V& `8 u: jBritannica这次的指控更进一步。他的指控分三层:
6 b% Z$ }1 E8 O( Y第一层,未经许可抓取近10万篇内容用于大模型训练。
2 ?. o# F( ?1 v+ G% o第二层,ChatGPT在生成回答时,输出了Britannica内容的完整或部分逐字复制,这构成直接侵权。8 ~2 h$ Q6 v1 v
第三层,也是最具争议的一层。OpenAI在ChatGPT的RAG工作流中使用了Britannica文章。
2 |6 u# y) [3 ^# W& O, r' KRAG是ChatGPT扫描外部数据库、获取最新信息的机制。% n- }: R4 b- j" \) e
8 r( Z# E& m" D! a" f+ r8 B3 z5 w
Britannica认为,即便它的内容没有进入训练集,但只要它出现在实时检索里,就被视为侵权。6 [. h2 j. R6 }' j
这种想法前所未有,它意味着不管是静态训练还是动态检索,只要调用了版权内容而未获授权,都要负责。7 v. k! w& | j* X4 V
更有意思的是第四条指控:Lanham Act商标侵权。3 ~6 ]6 t# w j
Britannica认为,ChatGPT有时会产生幻觉,然后把这些错误内容归因于Britannica,制造Britannica生成了错误信息的假象。
7 F$ ^8 J( Z/ Q9 _2 }2 m. t这不单单是侵权,Britannica的品牌信誉都要替OpenAI的错误买单。( x- f" p+ _( u" N1 I& ]9 a" g9 R
这危及公众持续获取高质量、可信赖在线信息的能力。1 k6 P2 o5 ]) ~( {8 M
同一个问题:德国说侵权,英国说没有
' x1 b9 f' [5 N5 P0 c这是整场官司的核心,也是目前全球司法界争论最激烈的问题之一。3 H4 s" G, `9 j8 g% Z
德国慕尼黑法院在GEMA诉OpenAI案中认定:GPT-4和GPT-4o的模型权重中确实嵌入了歌词,这构成版权意义上的复制,可以提出禁令和赔偿请求。% u: v4 Q/ k# J# n; r. A1 Y7 A
: [5 }, z- Z( T) O
2 W9 y% Q9 a4 U# w% y3 H+ c6 w" v模型权重是AI在训练过程中学到的数值参数,它决定了模型会输出什么。在慕尼黑法院看来,只要能从这些参数里还原出作品就足以构成侵权。1 g" r+ [9 z/ W4 i0 j4 }
英国高等法院在Getty Images诉Stability AI案中得出了完全相反的结论。
6 e% ]+ Z- x' F; @, j+ g t5 F+ v1 q+ i' Z
& M) s" O. l& r: ^1 CAI模型不是侵权副本,因为其权重既不包含也不复制版权作品本身,只存储了学习到的规律性模式。
6 ^5 \1 O! n; n4 {. @$ x) g美国这边,Anthropic曾在版权诉讼中说服联邦法官William Alsup,认定将内容用作训练数据具有足够的转化性,可以适用合理使用原则。8 b) V8 ^- i4 a+ Q/ |
但Alsup同时认定Anthropic非法下载了数百万本书而非付费获取,这一点构成违法,最终促成了1.5亿美元的集体和解。5 Y, k9 i) f9 x- o, ^* x7 \
Britannica这起案子在纽约提起,适用的是美国联邦法律。
/ O; o# w! F5 R0 b$ N, T: w但目前没有确立性先例明确说明用版权内容训练LLM究竟算不算侵权,每起案子的结果,在相当程度上仍取决于具体法官的认定逻辑。
, |1 \* H9 o+ X2 G5 Q如果法院认可实时检索也构成侵权,那对整个AI行业的影响将远超任何一起训练数据纠纷。
2 z7 s5 Q6 l, d5 U告Perplexity,是在给OpenAI热身
$ v) C3 d: ^- r1 X7 M这不是Britannica第一次出手。- Z7 Q; U$ F& t3 }8 @
早在2025年9月,Britannica就对Perplexity提起了类似的版权和商标侵权诉讼,该案目前仍在审理中。
- Q( s3 m* m6 f. O4 C1 x5 z5 J1 M7 X# {
( Z9 \$ L" T4 x! o+ c
Perplexity是一家以RAG为核心产品逻辑的AI搜索公司。2 E% W+ Q2 u; ?8 h1 w. t; g
Britannica选择先打Perplexity,像是在做法律预演,摸清RAG侵权这条路的可行性,然后再把同样的逻辑复制到OpenAI身上。8 p+ B2 A4 ^8 g. e9 b
与此同时,行业里的版权战场正在全面升温。
$ I7 a( q+ A( {" ]! {《纽约时报》、Ziff Davis、美国和加拿大十余家报纸先后起诉OpenAI。$ t Z/ N* C/ J4 q
4 ^ m5 U! U6 `
! b+ V7 o8 g- n( M: E; ?( LThe Intercept和US News & World Report也已加入原告队伍。& v( p* I+ t4 H# E* I U$ o
截至目前,专门追踪AI版权诉讼的网站ChatGPT Is Eating The World统计显示,这已是针对OpenAI的第63起版权诉讼。. A8 U7 ~$ E6 {8 D1 Z& ^
OpenAI对TechCrunch的置评请求未作回应。" o1 ^. Q$ Z3 ?
被维基百科打残,又被ChatGPT截流* `5 l7 V; c5 i6 o& \9 ?
退一步看,有些事情比赔偿金额更值得关注。
9 B" u8 ]9 M9 SBritannica创立于1768年,是英文世界里持续时间最长的百科全书品牌,它代表的是几百年人类知识整理传统的某种象征。% H4 F% b4 k& r: I: s
当这样一个机构出现在AI版权诉讼的原告席上,传递的信号很清晰:知识权威这个概念,正在试图通过法律手段,重新在AI生态里划定自己的边界。9 T2 N% q: U& k/ o
Britannica曾是纸质百科时代的绝对权威,被维基百科打得几乎找不到存在感。
5 d1 V0 ?) b. }. u0 D" f: {0 u6 T N+ s1 e
) X) o; B1 ~9 S
后来转型为数字订阅平台,靠着内容的可信度和专业性重新站稳脚跟。
" f9 y0 b% W" h% p如今,ChatGPT的出现让它又一次面临被替代的威胁——但不是被更好的百科替代,而是被一个用它内容训练出来、但不分给它一分钱的模型替代。
* F( @ V: w5 r诉状里有一句话:! \9 z, N* A. O( ~: U# j
ChatGPT通过生成替代出版商内容的回复,抢走了出版商的流量。
$ I, q6 C* X- z1 G i; G这是商业模式的正面冲突。RAG这条指控是否能站住脚,目前没有人能给出确定答案。
3 C5 }9 t# H k; P: t& L2 `: m) e5 V; S但如果法院哪天认可了这个逻辑,整个行业的实时检索管道都需要重新谈授权。! @) ?3 Q9 P2 L, t) I# n9 r
所有以联网搜索+AI生成为核心产品的公司,都要面临这样的问题。
( X* i$ `% g( [' [, g {250年的老牌百科,正在用一份诉状,尝试给AI的边界划一条线。
+ V' P$ k" h w- A这条线最终画在哪里?2026年,大概会有答案。
4 L( D0 G' Z- c* Q! y% C" \! P/ @参考资料:
% ]3 D: C# i6 a8 H" |( \) Fhttps://www.reuters.com/legal/litigation/encyclopedia-britannica-sues-openai-over-ai-training-2026-03-16/
, J% K7 V8 D% Y* Q; D" a: |https://techcrunch.com/2026/03/16/merriam-webster-openai-encyclopedia-brittanica-lawsuit/
" v5 K+ L- Q7 P* E) O) ihttps://the-decoder.com/encyclopedia-britannica-sues-openai-for-training-on-nearly-100000-articles-without-permission// M# o4 ?- w$ U! ~1 W7 E0 g" `
https://gizmodo.com/encyclopedia-britannica-sues-openai-over-ai-training-data-2000607770
C6 y4 ~; e$ T$ }2 ^5 y2 |( |% Xhttps://news.bloomberglaw.com/ip-law/britannica-merriam-webster-accuse-openai-of-copying-thEIr-works
" f, V& Y1 a) \* c0 Phttps://chatgptiseatingtheworld.com/wp-content/uploads/2026/03/Encyclopedia_Britannica_Inc-v-OpenAI-COMPLAINT-Mar-13-2026.pdf3 s9 A9 p1 M" C9 |8 G
https://www.aol.com/articles/encyclopedia-britannica-sues-openai-over-141324436.html |
|