36kr 2024年08月06日
英伟达版Sora被曝违规抓取大量数据,官方表示不服
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_guoji1.html

 

英伟达正在开发一款名为Cosmos的全新视频基础模型,旨在利用人工智能技术模拟光传输、物理和智能,并应用于Omniverse 3D世界生成器、自动驾驶汽车系统和数字人产品等领域。然而,该模型的训练数据来源引发争议,据称英伟达从YouTube、奈飞等平台抓取大量未经授权的视频数据,引发版权争议。对此,英伟达回应称其行为合法,并强调版权法保护的是特定的表达方式,而非事实、想法、数据或信息。

👨‍💻英伟达正在开发一款名为Cosmos的全新视频基础模型,旨在利用人工智能技术模拟光传输、物理和智能,并应用于Omniverse 3D世界生成器、自动驾驶汽车系统和数字人产品等领域。该模型由英伟达研究副总裁刘洺堉领导,他也是IEEE Fellow,带领英伟达Deep Imagination研究小组,推出了NVIDIA Picasso [Edify]、NVIDIA Canvas [GauGAN]和NVIDIA Maxine [LivePortrait]等产品。

⚠️据泄露的内部文件显示,英伟达每天都会抓取大量视频数据来训练Cosmos模型,包括从YouTube、奈飞等平台抓取未经授权的视频数据。这些数据涵盖了电影预告片、网络视频、游戏镜头等,每天的抓取量相当于一个人一生能感知到的视觉数据。

⚖️英伟达回应称其行为合法,并强调版权法保护的是特定的表达方式,而非事实、想法、数据或信息。他们认为,任何人可以自由地从其他来源了解事实、想法、数据或信息,并用它来表达自己的观点。合理使用还保护将作品用于变革性目的的能力,例如模型训练。

🤔尽管英伟达坚称其行为合法,但YouTube和奈飞等平台都表示未与英伟达达成内容提取协议,并强调其服务条款不允许抓取内容。这引发了关于数据版权和人工智能模型训练伦理的讨论。

📈值得注意的是,使用原始数据训练大模型确实能带来先发优势,但随着AI数据越来越泛滥,反而容易让大模型崩溃。这提醒我们,在追求技术进步的同时,也要关注数据伦理和版权问题。

英伟达版Sora曝光——

代号Cosmos,研究副总裁刘洺堉担任负责人。

不过随着几份内部文件的泄露,他们还被曝非法抓取数据。

(确实这也不是一次两次了……)

员工被默许每天在网络上抓取任何未经授权、未经同意数据,比如YouTube、奈飞等等这种平台上。

合起来,每天抓取的几乎是一个人80年能感知到的视觉数据。

结果英伟达回应称:我们这做法,完全合法!

英伟达版Sora曝光:代号Cosmos

据404Media所获取的泄密文件显示,英伟达每天都会抓取非法数据来训练新模型。

Cosmos的目标是构建一个最先进的视频基础模型。据泄露的邮件显示该模型集合了光传输、物理和智能的模拟,以解锁对各种下游应用。

图源:404 Media

比如被用到Omniverse 3D 世界生成器、自动驾驶汽车系统和数字人产品。

英伟达研究副总裁Ming-Yu Liu(刘洺堉)担任Cosmos的项目负责人。

他同时也是IEEE Fellow。他带领英伟达Deep Imagination研究小组,推出了NVIDIA Picasso [Edify]、NVIDIA Canvas [GauGAN]和NVIDIA Maxine [LivePortrait]等产品。

此前5月份的一封电子邮件中显示:

我们正在完成 v1 数据管道并确保必要的计算资源,以构建一个视频数据工厂,该工厂每天可以产生相当于人类一生视觉体验的训练数据。

图源:404 Media

这张图中显示英伟达首席科学家 Francesco Ferroni给了个表格链接,里面汇集了各种视频数据集,包括 MovieNet(一个包含 60,000 个电影预告片的数据库)、WebVid、 InternVid-10M,以及几个内部捕获的视频游戏镜头数据集。

如今据一位前员工爆料称,员工会被要求从YouTube、奈飞等来源来抓取数据。

他们会使用一个名为yt-dlp的开源YouTube视频下载器,它能使用虚拟机来刷新IP地址,以避免被YouTube屏蔽。

为此,英伟达向404 Media回应称:

我们尊重所有内容创作者的权利,并相信我们的模型和研究工作完全符合版权法的条文和精神。

版权法保护特定的表达方式,但不保护事实、想法、数据或信息。任何人都可以自由地从其他来源了解事实、想法、数据或信息,并用它来表达自己的观点。合理使用还保护将作品用于变革性目的的能力,例如模型训练。”

而谷歌则是扔给404 Media一个链接,今年4月YouTube CEO表示,如果OpenAI用YouTube视频来训练Sora,那么明显违反YouTube的使用条款。

而奈飞则表示,他们并未与英伟达达成内容提取协议,而且该平台的服务条款不允许抓取内容。

有意思的是,同一天,YouTube博主正在寻求对OpenAI集体诉讼,指控该公司在未通知或补偿视频所有者的情况下,使用数百万条 YouTube 视频记录来训练其生成式 AI 模型。

而此前这些大厂被曝非法抓取数据的事情也屡见不鲜。

不过必须要说的是,这种原始数据真的很有用…

之前英伟达还用游戏视频,来改善训练数据质量。

最近登上Nature封面的那篇研究显示,这种用最初互联网数据训练的大模型,具有先发优势,数据质量最好,对应的模型性能也最好。

之后随着AI数据越来越泛滥,反而容易让大模型崩溃。

Garbage in,Garbage out

对于这件事,你怎么看呢?

参考链接

[1]https://techcrunch.com/2024/08/05/youtuber-files-class-action-suit-over-openais-scrape-of-creators-transcripts/

[2]https://www.gamedeveloper.com/business/report-nvidia-used-scraped-video-game-footage-to-train-ai-products

[3]https://www.404media.co/nvidia-ai-scraping-foundational-model-cosmos-project/

[4]https://pivot-to-ai.com/2024/08/05/nvidia-caught-ingesting-as-much-of-youtube-as-possible/

本文来自微信公众号“量子位”,作者:白交,36氪经授权发布。

Fish AI Reader

Fish AI Reader

AI辅助创作,多种专业模板,深度分析,高质量内容生成。从观点提取到深度思考,FishAI为您提供全方位的创作支持。新版本引入自定义参数,让您的创作更加个性化和精准。

FishAI

FishAI

鱼阅,AI 时代的下一个智能信息助手,助你摆脱信息焦虑

联系邮箱 441953276@qq.com

相关标签

英伟达 Sora Cosmos 视频基础模型 数据抓取 版权争议
相关文章