诉讼频发!AI训练“盗用”版权内容,建立共享数据库迫在眉睫?

版权成为AI的又一块绊脚石。AI很强,但并不能无中生有。AI具备的能力,本质上来自算法和训练大模型所用的数据,数据的数量和质量会对大模型起到决定性作用。此前OpenAI工作人员表示,因没有足够多的高质量数据,Orion项目(即GPT-5)进展缓慢

版权成为AI的又一块绊脚石。

AI很强,但并不能无中生有。

AI具备的能力,本质上来自算法和训练大模型所用的数据,数据的数量和质量会对大模型起到决定性作用。此前OpenAI工作人员表示,因没有足够多的高质量数据,Orion项目(即GPT-5)进展缓慢。不得已之下,OpenAI招募了许多数学家、物理学家、程序员原创数据,用于训练大模型。

AI公司在数据方面面临的难题远不止于此,因频频侵权造成的版权问题,正困扰着AI公司。大型AI公司有足够的资源和精力应对侵权问题,小公司一旦收到大量起诉,很可能遭受灭顶之灾。

版权,AI行业的又一块绊脚石

自从ChatGPT诞生,版权之争就已开启。最初反对AI的人以画师为主,AI公司用他们的作品训练大模型,又抢了他们的工作。但当时AI大模型训练所需的数据量不够大,不至于得罪太多人,画师群体规模小,能够发出的声音和起到的效果有限。

可AI大模型功能不断强化能力的同时,对于数据的需求量也与日俱增。除了公开的科学论文,AI公司还会抓取社交平台上的帖子、媒体发布的新闻报道等信息。社交平台上的帖子还好说,要求不是特别严格,可媒体上的新闻报道却存在版权。

(图源:豆包AI生成)

2024年11月底,加拿大《多伦多星报》及旗下的五家媒体,向OpenAI发起诉讼,称其在未经允许的情况下从加拿大媒体抓取内容训练大模型,要求OpenAI为使用的新闻报道每篇支付2万加元(约合人民币10万元),总金额估计有数十亿加元。

面对《多伦多星报》的指控和天价赔偿要求,OpenAI自然矢口否认,并发表声明称训练AI大模型以公开数据为基础,以公平使用和国际版权原则为依据,对于创作者是公平的。

不只是加拿大媒体,美国的The Intercept、《纽约时报》、Raw Story、AlterNet ,印度的ANI,以及德国版权机构GEMA等,都曾起诉过OpenAI。

因视频生成和音频生成大模型日渐成熟,AI公司引发的版权问题也愈发严重。2024年6月,美国唱片协会起诉了Suno和Udio两家AI音乐公司。

国内AI行业存在相同的问题,例如位列中国AI大模型六小龙之一的MiniMax,因未经授权使用爱奇艺的素材训练海螺AI,日前遭遇爱奇艺起诉,被索赔10万元。

9b0eddb5-9284-46ab-8408-07b57951e658.png

(图源:MiniMax)

更有甚者,不但侵犯作品的版权,还侵犯了公众人物的肖像权。例如著名的AI孙燕姿、AI雷军事件,某些网友利用AI合成技术让孙燕姿演唱各种歌曲,让雷军“口吐芬芳”。2024年4月23日,国内首例AI生成声音人格侵权案宣判,被侵权的殷女士获胜,侵权公司赔偿其25万元,总算给创作者们一丝安慰。

OpenAI面对侵权起诉时,虽表示训练AI大模型以公开数据为基础,但公开并不意味着数据无版权。摄影师拍摄的图片、编辑创作的文章等内容,都存在版权,放任AI公司随意抓取,无疑是在侵害创作者的利益。

长此以往,创作者的创作热情和信心难免受到打击,减少内容创作。如此一来,训练AI大模型的数据也将更加捉襟见肘,影响到AI行业的正常发展。如何维护创作者的合法权益、打击侵权行为,已成为AI行业必须解决的问题。

成立“共享数据库”势在必行

前段时间国内AI公司DeepSeek基于数据蒸馏方案,以其他AI大模型为教师模型,训练出了参数量和占用资源更少,且训练成本极低的DeepSeek-V3大模型。但因回答用户问题时自称“ChatGPT”,DeepSeek-V3遭遇OpenAI CEO山姆·奥特曼嘲讽。自认为没有侵权加拿大媒体的OpenAI,面对其他AI公司对他们可能存在的侵权行为却表现得十分不满。

无论山姆·奥特曼如何否认,OpenAI侵权的行为已经坐实,且侵权问题在整个AIGC行业普遍存在。

为处理更多、更复杂的问题,未来先进AI大模型的参数还会不断增加,对于数据量的需求也会越来越高。尤其是视频生成和音频生成大模型的到来,侵权行为将更加广泛、更加频繁。

(图源:豆包AI生成)

解决版权纠纷源头上需要相关部门制定相应的法律法规,限制AI公司侵权,保护创作者的权益。2022年12月印发的《中共中央 国务院关于构建数据基础制度更好发挥数据要素作用的意见》,对待AI公司使用互联网公开内容的态度是,淡化所有权、强化使用权,如涉及商业使用,则需要向创作者支付费用。

2024年11月19日在西安举办的中欧数字环境下版权保护研讨会上,主办方强调将以《中华人民共和国著作权法实施条例》为修订契机,完善制度设计,保护著作人的合法权益。

中国版权协会理事长阎晓宏表示,从技术角度来看,使用有版权的作品要公布版权信息,原则上要获得作品的授权,但实际上是做不到的。究其原因,企业训练AI大模型的数据来源过于复杂,媒体的新闻报道、个人发布的帖子、科研机构的论文、各大公司报告等,很难一一统计和申请授权。

因而还需要全球互联网企业、学术研究机构联合起来,打造一个共享数据库,对互联网上公开的数据进行标注,明确版权归属。AI公司需要数据时,必须与互联网公司和学术研究机构成立的联盟合作,商谈能够调用哪些数据、需要支付多少成本。互联网公司联盟在打造共享数据库的同时,也要与创作者沟通合作,取得创作者的授权并支付相应的费用后,才能将内容加入数据库中。

生成数据库图片.png

(图源:豆包AI生成)

这样一来,掌握大量数据的互联网公司将承担起“中间商”的责任,同时与创作者和AI公司对接,即保障了创作者可以获取收益,本身也能从中抽取一定的利润。对于腾讯、百度、字节跳动、FaceBook、X等国内外互联网公司而言,还多出了一条信息变现渠道。

AI公司虽要花钱购买数据,但抓取数据的难度大幅降低,获取数据的渠道也会增多,反而能够减少一部分成本。OpenAI工作人员吐槽数据不够用,实际是公开且易获取的数据不够用了。互联网宛如一座冰山,只有三分之一浮在水面上,剩下的三分之二则藏在水底。唯有AI公司愿意付出相应的成本,才能够利用这部分数据训练大模型。

健全的数据共享机制,是AI的基石

OpenAI前员工Ilya Sutskever曾表示,数据是AI的化石燃料,而这份燃料即将耗尽,但我们只有一个互联网,最大化数据的时代已经过去了。再加上原定2024年中后期面世的GPT-5迟迟未能完成训练,不少人已在怀疑,人类社会的数据不够支撑AI行业进入下个阶段。

事实上,人类社会每时每刻都在产生新数据,《全国数据资源调查报告》显示,2023年中国数据产生总量高达32.85ZB(泽字节),平均每天产生900亿GB数据。

生成数据库图片 (1).png

(图源:豆包AI生成)

在网络渗透进我们生活、办公、娱乐等各个领域,并覆盖全球接近70%人口的今天,用于训练AI大模型的数据不够用是个伪命题。对于AI公司而言,难点在于如何将有效数据提取出来。

相关部门提供法律基础、互联网巨头合力打造数据库,筛选有效数据并保障创作者权益,无疑是最省时省力的方案。过去AI企业不缺数据,又想着吃独食,没有打造共享数据库的意识。如今形势发生变化,易获取的数据不足以支撑AI行业进入下个阶段,唯有所有企业消除隔阂齐心协力,方能渡过数据量不足的难关。

在元宇宙、区块链、3D打印、常温超导、人工智能等诸多被认为可能是第四次工业革命导火索的产业中,目前看来最有希望引领人类开启第四次革命的就是人工智能和与其相关的机器人产业。

为了推动和规范行业发展,2024年10月21日的德国数字峰会上,德国施瓦茨数字公司和德国铁路公司宣布成立“欧洲数据中心”,旨在为AI公司训练大模型提供数据支持。

该会议结束后仅一个月,中欧数字环境下版权保护研讨会就在西安召开,表明中欧相关部门和企业有意合作,共同构建AI行业发展基石。相信在全球诸多国家、企业的合作之下,未来数据将不再是困扰AI公司的难题。内容创作者在提供数据帮助AI公司训练大模型的同时,也将能够从中获利,告别频繁被侵权却拿不到任何收益的时代。

来源:雷科技

       原文标题 : 诉讼频发!AI训练“盗用”版权内容,建立共享数据库迫在眉睫?

(来源:维科网)
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

相关推荐

  • 国产存储巨头,拟投资349亿元扩产

    9月28日晚间,长鑫科技发了一则重要公告,大体内容是在当天董事会上通过一项议案,打算把180亿元超募资金,投到两个新项目上。 公司拟使用130 亿元超募资金投建技术研发项目;同时以增资 + 借款的形式

    2026-09-30
  • 企业级AI智能体怎么落地?金秋10月,深圳有答案!

    企业级AI智能体怎么落地?金秋10月,深圳有答案! 近期,AI 进千行百业在一路铺开,从办公到制造,好像哪里都能塞进去一个AI智能体。热度涨得快,退得也快。等这一波热闹过去,问题集中暴露出来,工具调用

    2026-09-29
  • 保利物业携手海康威视 以AI大模型打造智慧小区管理新模式

    传统小区管理长期依赖人工巡检、被动响应的运营模式,园区安防排查、设备运维、业主服务等各项工作,高度依靠人力值守跟进。人工巡查存在覆盖盲区、排查效率有限等痛点,不仅增加运维压力,也难以全方位保障社区居住

    2026-09-24
  • AI时代,独立思考和原创知识更有力量

    人工智能时代,跨界人才怎么培养?知识还是不是力量?9月19日,《知识就是力量》创刊70周年活动圆桌对话现场,主持人抛出了这些直接的问题。对此,植物病理学藻类学家、中国科学院院士赵进东,化学工程专家、中

    2026-09-23
  • 阿里巴巴,最新AI芯片亮相

    维科网9月22日消息,9月22日上午,杭州国际博览中心,2026云栖大会上,阿里巴巴CEO吴泳铭上台,抛出了一个机器智能的新说法。他把AI模型、AI芯片、AI云说成机器智能时代的三大基石,表态阿里会坚

    2026-09-22
  • AI系统可快速精准匹配X光与三维扫描图像

    手术中的二维X光图像与术前三维CT或磁共振成像(MRI)如何快速“对上”?美国麻省理工学院等机构科学家开发的人工智能(AI)系统“xvr”给出了新方案。该系统可针对患者进行个性化适配,在数秒内将术中X

    2026-09-22
  • AI为珍稀鸟儿“上户口”

    初秋的南京绿水湾国家城市湿地公园万木葱茏,植被茂密的林间,一台AI声纹监测设备挂在树上,静静“聆听”树林的“密语”。“这台设备集成了高灵敏度音频采集与抗干扰处理技术,能在复杂野外环境中自动剔除风雨声、

    2026-09-22
  • 我国首款藏语多语言全模态AI输入法发布

    9月20日,在青海师范大学教师教育高质量发展暨建校70周年大会科研成果展示环节,我国首款藏语多语言全模态AI输入法——智达AI输入法及配套藏文字体集正式发布。据悉,近年来,青海师范大学藏语智能全国重点

    2026-09-21
  • 约五分之一英国成年人使用AI获取新闻

    英国通信管理局9月15日发布的一项调查显示,约五分之一的英国成年人过去一个月曾使用人工智能(AI)应用或服务获取新闻,其中ChatGPT是使用最广泛的相关AI工具。英国通信管理局当天发布的《2026年

    2026-09-20
  • AI系统可让3D打印实现同步质检

    美国劳伦斯利弗莫尔国家实验室研究人员开发出一种利用摄像头和人工智能(AI)检测3D打印质量的系统,在打印过程中,3D打印机可逐层“检查”自己制造的零部件,并及时发现断丝、尺寸异常等细微缺陷。研究人员表

    2026-09-19