|
|
新智元报道
2 \( [* v9 q0 R编辑:倾倾) Q" h9 i5 X. c, {& o! A) f
【新智元导读】3月16日,大英百科全书联合韦氏词典,起诉了OpenAI,并且罗列了ChatGPT的「四宗罪」。不要觉得Britannica心狠,此前ChatGPT编造错误信息,却把来源伪托给Britannica。OpenAI未作回应。5 P" h( g. W+ f# H! z; P
OpenAI又被起诉了。1 e3 t7 k# b5 o, c: ^: x
3月16日,大英百科全书联合旗下的韦氏词典,对OpenAI提起诉讼。
. i8 V; Z, h) B$ _2 d2 G2 ]原因是,它认为ChatGPT进行了大规模的版权侵权。
2 U) ?8 B8 D+ a" W# B. yBritannica比所有原告准备得更充分:它紧抓训练数据抓取、模型记忆输出、RAG实时检索,同时追加《兰纳姆法》商标侵权。% r" r( L' F" Y4 F+ g5 @4 N3 w
这是AI版权诉讼史上,第一次有人试图把整条生成链路一锅端。5 o8 X" i. F: w( r- T+ G
GPT-4能逐字默写大英百科) c) d. ?) v' X( `* X I0 z. U
根据TechCrunch报道,Britannica直接点名GPT-4,认为它已经记住了其大量版权内容,能够按需输出近乎逐字逐句的复制品。
3 N: D* n3 Z* a4 }+ _/ B不是相似,不是接近,是逐、字、复、制。( _* I9 ~* H0 h7 {" b$ {- C/ A
这背后有一定的技术依据。斯坦福和耶鲁的研究团队曾做过实验,从主流大模型中提取《哈利·波特》原文,最高提取率达到96%。 t# S3 Z; u4 y+ C' M3 v
# }0 p1 N2 {9 \6 t3 m' z& {+ y. S$ p
也就是说,训练数据里的内容,有相当一部分被记在了模型权重里,在特定提示词下可以几乎原样还原。2 Q* X9 g! b& A: n" o4 r
Britannica持有的版权内容规模并不小。它旗下近10万篇在线文章、百科条目和词典释义,覆盖从科学、历史到文学的几乎所有主要知识领域。1 l# w( |6 B+ `
这些内容由专业编辑和学科专家历经数十年积累而成。在维基百科崛起之前,这套体系就是人类知识的标准索引。
$ {: s, c( r- f4 i而OpenAI一直在灰色地带游走。
6 I- @( v: l" L) Q/ R1 ^查一次资料,也算侵权
" G0 F8 y0 t/ T2 n f' H5 k此前,各方一直在争论:用我的内容训练模型,算不算版权侵权?& a: z" A0 [, V
Britannica这次的指控更进一步。他的指控分三层:: ?) w. f. x; E. ]6 h. A. a: _9 ^, V
第一层,未经许可抓取近10万篇内容用于大模型训练。5 T0 }: X% T( o% o' T, {/ I! U
第二层,ChatGPT在生成回答时,输出了Britannica内容的完整或部分逐字复制,这构成直接侵权。
8 B- i$ ]/ U# G% d8 I: R第三层,也是最具争议的一层。OpenAI在ChatGPT的RAG工作流中使用了Britannica文章。
0 W; ]% W- ]. C* {2 ~RAG是ChatGPT扫描外部数据库、获取最新信息的机制。: R0 z3 U7 \5 O- z+ l
! `3 z) [% x" U. `& R
- {. j* f% N: W6 t7 |! FBritannica认为,即便它的内容没有进入训练集,但只要它出现在实时检索里,就被视为侵权。
2 n" n! ], h7 I这种想法前所未有,它意味着不管是静态训练还是动态检索,只要调用了版权内容而未获授权,都要负责。
6 e- `/ k6 a7 v6 A更有意思的是第四条指控:Lanham Act商标侵权。
# U( S0 D( n; W8 Z! F" TBritannica认为,ChatGPT有时会产生幻觉,然后把这些错误内容归因于Britannica,制造Britannica生成了错误信息的假象。
( w3 C' w$ G/ a$ B这不单单是侵权,Britannica的品牌信誉都要替OpenAI的错误买单。* [! f/ r' r7 a# |+ S5 B* }. k
这危及公众持续获取高质量、可信赖在线信息的能力。: x$ u5 M& h* Y7 k/ H
同一个问题:德国说侵权,英国说没有0 }: M* c1 V' S( f+ | _5 F
这是整场官司的核心,也是目前全球司法界争论最激烈的问题之一。$ K' P* X, r1 {
德国慕尼黑法院在GEMA诉OpenAI案中认定:GPT-4和GPT-4o的模型权重中确实嵌入了歌词,这构成版权意义上的复制,可以提出禁令和赔偿请求。4 @) x$ m0 ~0 k: u5 |
- r6 S/ y! i( q4 k: d
( U3 Z5 k. o& _# b- t9 o
模型权重是AI在训练过程中学到的数值参数,它决定了模型会输出什么。在慕尼黑法院看来,只要能从这些参数里还原出作品就足以构成侵权。/ X3 e8 B+ G, G0 P6 g7 x7 V
英国高等法院在Getty Images诉Stability AI案中得出了完全相反的结论。
# s6 D5 b p' Z% y0 K% m( ], W/ y1 [) B5 ^4 K1 K& \0 K3 r
$ q% A9 q+ ` XAI模型不是侵权副本,因为其权重既不包含也不复制版权作品本身,只存储了学习到的规律性模式。
W- [: g' H0 w6 n0 r5 a( g. `美国这边,Anthropic曾在版权诉讼中说服联邦法官William Alsup,认定将内容用作训练数据具有足够的转化性,可以适用合理使用原则。
, @' |7 k: T( C' M8 _, B6 R但Alsup同时认定Anthropic非法下载了数百万本书而非付费获取,这一点构成违法,最终促成了1.5亿美元的集体和解。
2 P9 |% I% x0 w4 E( k$ x& WBritannica这起案子在纽约提起,适用的是美国联邦法律。7 L/ I# u: f* }" Y
但目前没有确立性先例明确说明用版权内容训练LLM究竟算不算侵权,每起案子的结果,在相当程度上仍取决于具体法官的认定逻辑。# Q+ Q- Z( a# Y% V; a+ x# i
如果法院认可实时检索也构成侵权,那对整个AI行业的影响将远超任何一起训练数据纠纷。
0 p }0 m# g% \0 [告Perplexity,是在给OpenAI热身. A4 W. R2 Y; J7 Q3 B' d$ H
这不是Britannica第一次出手。 ?5 W' r2 b6 }
早在2025年9月,Britannica就对Perplexity提起了类似的版权和商标侵权诉讼,该案目前仍在审理中。6 a5 W2 D+ l( H# f# ?3 \
/ d" ~$ ]! M) Z8 A2 f% I
% c2 h+ T, ?$ ?5 X2 z
Perplexity是一家以RAG为核心产品逻辑的AI搜索公司。4 t8 G$ ^$ a3 s# L ?0 [ }
Britannica选择先打Perplexity,像是在做法律预演,摸清RAG侵权这条路的可行性,然后再把同样的逻辑复制到OpenAI身上。
) I3 M) {) a/ X与此同时,行业里的版权战场正在全面升温。+ g! ]6 V) s+ `0 E# v0 L6 |" c2 f
《纽约时报》、Ziff Davis、美国和加拿大十余家报纸先后起诉OpenAI。
; I& G: j' d2 T# d2 G! Q8 m: d+ J* l. c; `$ L6 a
: w0 S( R! w: S$ b# xThe Intercept和US News & World Report也已加入原告队伍。* g' n8 e+ o/ S3 K0 ?) m
截至目前,专门追踪AI版权诉讼的网站ChatGPT Is Eating The World统计显示,这已是针对OpenAI的第63起版权诉讼。
( H! y/ `0 i1 H, r8 ^& S4 }* hOpenAI对TechCrunch的置评请求未作回应。
' v, p: |' |4 G% O被维基百科打残,又被ChatGPT截流' T* p" |2 v7 r+ X7 d! S7 O! W0 ]
退一步看,有些事情比赔偿金额更值得关注。
1 W) T) t5 K: D" B. h5 ^Britannica创立于1768年,是英文世界里持续时间最长的百科全书品牌,它代表的是几百年人类知识整理传统的某种象征。
5 r+ J! o D# t4 R当这样一个机构出现在AI版权诉讼的原告席上,传递的信号很清晰:知识权威这个概念,正在试图通过法律手段,重新在AI生态里划定自己的边界。( {% h; W' |3 M9 W' l/ c' ]- D# U# ^
Britannica曾是纸质百科时代的绝对权威,被维基百科打得几乎找不到存在感。& _3 i" U7 N( {1 d8 H8 {
" v/ [2 H/ W3 r# M# j; Y. r# l1 X. @! f! U6 q0 c1 v
后来转型为数字订阅平台,靠着内容的可信度和专业性重新站稳脚跟。
+ b' z+ b2 @6 Y! @9 x如今,ChatGPT的出现让它又一次面临被替代的威胁——但不是被更好的百科替代,而是被一个用它内容训练出来、但不分给它一分钱的模型替代。
) y/ H( g& E) S& `4 V诉状里有一句话:
* v" Q; \# a! ]. A% yChatGPT通过生成替代出版商内容的回复,抢走了出版商的流量。$ d+ I& j" J @8 n
这是商业模式的正面冲突。RAG这条指控是否能站住脚,目前没有人能给出确定答案。. C! ~5 N$ L( r. i
但如果法院哪天认可了这个逻辑,整个行业的实时检索管道都需要重新谈授权。3 F# u. T8 m( G( Q0 C( d, `
所有以联网搜索+AI生成为核心产品的公司,都要面临这样的问题。6 l4 o( y8 C1 S' H% c
250年的老牌百科,正在用一份诉状,尝试给AI的边界划一条线。" @7 r1 ~2 }7 y; F
这条线最终画在哪里?2026年,大概会有答案。
0 d- b6 G( ~' t: M" Q+ g) J3 o参考资料:+ W G; r; j. ]
https://www.reuters.com/legal/litigation/encyclopedia-britannica-sues-openai-over-ai-training-2026-03-16/
1 r) Z' r9 K, X; x5 hhttps://techcrunch.com/2026/03/16/merriam-webster-openai-encyclopedia-brittanica-lawsuit/
& Z; w" J. u) M- `1 B; Ehttps://the-decoder.com/encyclopedia-britannica-sues-openai-for-training-on-nearly-100000-articles-without-permission/
; V: r# ^) y2 k) khttps://gizmodo.com/encyclopedia-britannica-sues-openai-over-ai-training-data-20006077703 X- }7 H$ W4 j1 ]3 t6 }, N; H0 V
https://news.bloomberglaw.com/ip-law/britannica-merriam-webster-accuse-openai-of-copying-thEIr-works+ {& z! ~, V; Y
https://chatgptiseatingtheworld.com/wp-content/uploads/2026/03/Encyclopedia_Britannica_Inc-v-OpenAI-COMPLAINT-Mar-13-2026.pdf$ V# v1 }! Y% ^- p& |4 l6 G# Y+ t
https://www.aol.com/articles/encyclopedia-britannica-sues-openai-over-141324436.html |
|