2026-08-28 18:49:47

大模子如何“吃”全网语料?合理使用与侵权的界限分析

摘要
当大模型厂商竞相为千亿算力基建烧钱时,一颗更为隐秘的<span style="font-weight:bold;">版权暗雷</span>正在逼近。8月中旬,苹果拟付数...

当大模型厂商竞相为千亿算力基建烧钱时,一颗更为隐秘的<span style="font-weight:bold;">版权暗雷</span>正在逼近。

大模子如何“吃”全网语料?合理使用与侵权的界限分析

8月中旬,苹果拟付数亿美元采购新闻语料的消息传出,一时激起内容行业千层浪。近两年,围绕AI训练语料的版权诉讼已在全球蔓延。

新闻界,《纽约时报》起诉OpenAI和微软公司,指控两家企业未经授权使用数以百万计文章训练ChatGPT等大模型。文学界,包括两届普利策奖得主约翰·卡雷鲁等六位作家,同时将Anthropic、OpenAI、谷歌、Meta、xAI及Perplexity告上法庭,指控其实施了“蓄意盗窃行为”。

此前,据报道,Anthropic被指控滥用著作训练AI聊天机器人Claude,后经和解,仍需支付15亿美元赔偿金。这也是目前美国版权案中已知金额最高的和解协议。

国内方面,去年11月,上海市金山区人民法院一审宣判了上海首例人工智能大模型著作权侵权案,涉及《斗破苍穹》系列动漫中角色形象的复制权、信息网络传播权问题。

迭代的大模型一路狂奔,背后的“版权之争”如何破局?面对争议,法律上如何界定“合理使用”与“侵权”的边界?记者就此对话了相关律师、知识产权教授及出版商等内容从业者。

“按量付费”是公平交易还是定价权游戏?

苹果这一动作之所以引发关注,不只是因为它计划掏了数亿美元买新闻版权,也因其提出“按量付费”的浮动报酬机制。即当合作方内容实际被 Siri 使用时,才向出版商支付费用。

大模子如何“吃”全网语料?合理使用与侵权的界限分析

有人认为,苹果此次提出的“按使用量付费”模式,这是AI时代内容授权的新范式。

从版权保护的法律层面,“按量付费不是新范式。苹果支付的依然是因AI使用受版权保护作品而产生的美国版税,所涉作品类型与授权内容都依照美国现行《版权法》判定。按量付费本身是版权法常见的许可费计价模式之一。”

上海财经大学竞争法与知识产权研究中心执行主任厉彦冰告诉记者。同时她也是上海财经大学中国式现代化研究院特聘研究员,主要研究方向是知识产权与竞争法、数据报道、生成一段摘要,这是五次使用、三次还是一次?如果中间发生技术故障,进行了再次调用,但最终只生成了一段摘要,这个使用量如何计算?

“使用量”,是否针对抓取、训练、检索、引用、输出等不同环节、不同目的的使用行为,分别分类计算?”哪怕是按量付费,当前的界定仍然不清晰。

这也意味着:技术模式的选择,会直接影响到许可费的收取。

到实际运作层面,AI大模型企业和内容方,“议价权到底在哪一边”是大家关注的核心议题。

厉彦冰认为,无论是固定年费制度,还是按使用量付费,两种计价方式本身无所谓优劣,真正决定结果的是议价能力:“谁掌握计量数据报道类内容语料版权侵权问题不太重视。而且由于新闻报道数量巨大、文字表述质量较高、且广泛公开刊登在互联网,比较容易获取,成为内容语料版权侵权争议的重灾区。

黄阳阳认为,除极少量对新闻事件简单描述的内容,绝大多数新闻报道都是版权作品。新闻事件事实本身不受版权保护,但记者的文字表达、叙事编排、采访成果属于受保护作品,AI大模型训练利用新闻报道内容语料依旧存在侵权风险。

她进一步指出:“大模型合规需要把版权、内容安全、产品责任放在一起评估,不能只看重模型效果,把版权当作后置问题。”

目前的实际情况如何?“大部分大模型企业都没有主动向著作权人提出购买的,并在大模型产品商用之前隐匿了训练语料数据报道、教学科研等具体情形中,同时要求不得影响作品的正常使用,也不得合理损害权利人的合法权益。

多位律师告诉记者,我国现行法律并没有明确规定一个普遍适用于商业大模型训练的文本和数据挖掘的例外,但也不能简单照搬美国法中的“转换性使用”概念,认为只要作品被用于模型训练就当然构成合理使用。

“未来相关裁判规则,大概率也会继续沿着分阶段、分场景、分责任主体的方向逐步细化。判断重点已经从抽象讨论“AI是否可以学习作品”,逐步转向对数据来源、训练方式、输出结果和市场影响的全过程审查。司法仍然需要结合数据来源、使用目的、复制规模、技术必要性、输出结果和市场影响进行具体判断。”

同时,目前国内也有一系列管理办法和支持政策出台。

《生成式人工智能服务管理暂行办法》第七条已要求,使用具有合法来源的数据和基础模型;涉及知识产权的,不得侵害他人依法享有的知识产权。

大模子如何“吃”全网语料?合理使用与侵权的界限分析

大模子如何“吃”全网语料?合理使用与侵权的界限分析

图片来源:《生成式人工智能服务管理暂行办法》

2025年11月,国家标准《网络安全技术 生成式人工智能服务安全基本要求》正式实施,这是该国标是我国首部针对生成式人工智能服务安全的国家标准。

大模子如何“吃”全网语料?合理使用与侵权的界限分析

标准4.1.3 条写明,开源语料须有许可协议或授权文件;自采语料须有采集记录,不应采集他人已明确声明不可采集的语料;商业语料须有具法律效力的合同并要求提供方出具承诺与证明材料。

大模子如何“吃”全网语料?合理使用与侵权的界限分析

图片来源:《网络安全技术 生成式人工智能服务安全基本要求》

今年 5月,22 家机构在深圳启动的“国家级正版高质量语料库”确立了“先授权、后使用”的原则,并引入区块链留痕。该语料库目前仍处于共建启动阶段,未披露语料规模、授权价格与分成方案。

法学教授厉彦冰表示,合规义务已经落地,但履行义务所必需的市场基础设施和可交易市场尚在建设中,还存在实际的制度落差。具体来看,语料交易的标准化授权模板、公开透明的定价机制、版权方与AI企业的常态化授权通道、可大规模复用的授权交易平台等均处于探索初期。

不过,厉彦冰表示,随着技术的成熟、案例的增多,司法裁判会通过类型化和法律解释方法,逐步达成共识。“仅就AI对作品使用行为的认定而言,不存在由AI造成的法律层面的结构性问题,现代版权法加上法教义学的解释方法足以应对,这是在颠覆性技术出现时的正常现象,需要的正常更新适应的过程和时间。”

声明:文章不代表币圈子观点及立场,不构成本平台任何投资建议。投资决策需建立在独立思考之上,本文内容仅供参考,风险自担!转载请注明出处!侵权必究!
热门新闻
热门百科
回顶部