蓝点网 01月09日
埃隆马斯克也认为用于训练AI的真实世界数据所剩无几 未来只能靠合成数据
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_guoji1.html

 

埃隆马斯克认为用于训练AI的真实世界数据已耗尽,合成数据是未来方向。包括他的xAI及多家科技巨头已开始使用合成数据训练AI模型,合成数据有优点但也存在缺点。

🎯埃隆马斯克称2024年人类AI训练知识基本耗尽

💻合成数据是未来发展方向,AI可自我评分与学习

👍合成数据获取易、成本低、可避版权问题

👎但可能导致模型崩溃,存在偏见和局限性

埃隆马斯克的观点与其他人工智能行业专家的观点基本相同,那就是用于训练人工智能模型的真实世界 (区别于机器生成) 数据已经所剩无几。

本周埃隆马斯克与 STAGWELL 董事长在 X/Twitter 进行直播时埃隆马斯克表示,我们现在基本上已经耗尽人类在人工智能训练方面积累的全部知识,这基本上发生在 2024 年。

有鉴于人类自己产生的数据已经被耗尽,所以埃隆马斯克认为合成数据也就是由人工智能模型本身生成的数据是未来的发展方向,补充的唯一方法就是使用合成数据,有了合成数据后人工智能就会自我评分并经历自我学习的过程。

值得注意的是由于无法获取到最后多的真实世界新数据,包括埃隆马斯克的 xAI、微软、Meta、OpenAI 和 Anthropic 等科技巨头都已经开始使用合成数据训练 AI 模型。

市场调查公司 Gartner 的预计则是在 2024 年用于人工智能和分析项目中的数据可能有高达 60% 都是合成的而非人类产生的真实数据。

微软在最新推出的 Phi-4 系列模型中也同样使用合成数据和真实数据进行训练,谷歌开源的 Gemma 模型同样如此,都是靠合成数据才完成模型的最终训练。

使用合成数据的优点很多,包括获取方式相对来说比较容易、节省成本还可以规避某些版权问题等。但缺点也很明显,某些研究表明合成数据可能会导致模型崩溃,即模型的输出不那么有创意而且会更加偏颇。

如果用于训练的合成数据本身存在偏见和局限性,那么训练出来的人工智能模型也同样会存在这样的缺点或受到影响,最终影响到人工智能模型的质量。

Fish AI Reader

Fish AI Reader

AI辅助创作,多种专业模板,深度分析,高质量内容生成。从观点提取到深度思考,FishAI为您提供全方位的创作支持。新版本引入自定义参数,让您的创作更加个性化和精准。

FishAI

FishAI

鱼阅,AI 时代的下一个智能信息助手,助你摆脱信息焦虑

联系邮箱 441953276@qq.com

相关标签

埃隆马斯克 人工智能 合成数据 数据耗尽
相关文章