谷歌计划融合 Gemini 与 Veo 模型，打造全能 AI 助手

IT之家 04月13日 08:58

../../../zaker_core/zaker_tpl_static/wap/tpl_guoji1.html

谷歌DeepMind计划整合其Gemini AI模型与Veo视频生成模型，旨在增强Gemini对物理世界的认知能力。DeepMind首席执行官Demis Hassabis在播客中提到，Gemini从一开始就被设计成多模态模型，目标是构建一个能够在现实世界中提供帮助的通用数字助手。随着AI行业向“全能”模型发展，谷歌的Gemini不仅能生成图像、文本和音频，OpenAI和亚马逊也在开发类似模型。Veo的视频数据主要来源于YouTube，通过分析海量YouTube视频，Veo 2能够学习物理世界的规律。

💡谷歌计划将Gemini AI模型与Veo视频生成模型融合，以提升Gemini对物理世界的理解能力。

🤖Gemini被定位为多模态模型，旨在成为一个通用的数字助手，能够在现实世界中提供帮助。

🖼️“全能”模型是行业发展趋势，这类模型能够理解和整合多种媒体形式，如图像、视频、音频和文本。

📹Veo的视频数据主要来源于YouTube平台，通过分析YouTube视频来学习物理世界的规律。

📝谷歌可能使用YouTube内容训练其AI模型，并已扩大服务条款以获取更多数据。

IT之家 4 月 13 日消息，谷歌 DeepMind 首席执行官 Demis Hassabis 在由领英联合创始人 Reid Hoffman 共同主持的播客节目 Possible 中透露，谷歌计划将旗下的 Gemini AI 模型与 Veo 视频生成模型进行融合，以此提升 Gemini 对物理世界的理解能力。

Hassabis 表示：“我们从一开始就将 Gemini 这一基础模型打造为多模态模型，因为我们有着构建一个通用数字助手的愿景，这个助手能够在现实世界中真正为你提供帮助。”

目前，整个 AI 行业正逐渐朝着“全能”模型的方向发展，这些模型能够理解和整合多种媒体形式。谷歌最新的 Gemini 模型不仅可以生成图像和文本，还能生成音频；而 OpenAI 在 ChatGPT 中的默认模型如今也能创建图像，包括宫崎骏风格的艺术作品。亚马逊也宣布计划在今年晚些时候推出一款“任意到任意”的模型。

据IT之家了解，这些“全能”模型需要大量的训练数据，包括图像、视频、音频、文本等。Hassabis 暗示，Veo 的视频数据主要来源于谷歌旗下的 YouTube 平台。他说道：“通过观看大量的 YouTube 视频，Veo 2 能够了解世界的物理规律。”此前，谷歌曾向 TechCrunch 表示，其模型可能会根据与 YouTube 创作者达成的协议，使用“部分”YouTube 内容进行训练。据报道，该公司去年扩大了服务条款的部分内容，以便获取更多数据来训练其 AI 模型。

Fish AI Reader

FishAI

联系邮箱 441953276@qq.com

相关标签