智源社区 03月29日 16:57
AI大模型看手相!图片视频加持深度思考,阿里QVQ-Max“神了神了”
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_guoji1.html

 

阿里推出了首个视觉推理大模型QVQ-Max,该模型能够深度分析图像和视频内容。它不仅能进行手相分析、识别西湖风景的季节差异,还能解决数学题、分析视频内容并生成字幕。经过测试,QVQ-Max展现了强大的图像解析、推理能力,并能进行角色扮演等创作。QVQ-Max免费开放,用户可体验其在MathVision基准测试中的表现,以及对图片细节的识别和分析能力。

🔮 QVQ-Max的核心功能在于对图像和视频进行深度思考。例如,通过分析手掌照片进行手相解读,或者识别出两张西湖风景照片的季节差异。

➕ QVQ-Max具备强大的数学推理能力。通过输入题目图片,它能够识别题目并给出正确答案,展示了其在理解和解决问题上的能力。

🎬 视频分析也是QVQ-Max的一大亮点。它可以分析手绘简笔画视频,将视觉内容与文字结合,并为视频创建字幕,展现了其在多模态理解方面的潜力。

💡 QVQ-Max的背后技术亮点包括在MathVision基准测试上的表现,以及对图片细节的快速识别能力。它能够识别图片中的物品、文字标识,并结合背景知识进行推理。

🎨 除了分析和推理,QVQ-Max还能进行创作,例如设计插画、生成短视频脚本,甚至创作角色扮演内容。用户可以上传草稿或照片,体验其多样化的应用。

阿里又发了个有意思的大模型——

QVQ-Max,第一版视觉推理模型,对任意图像或视频都可以进行深度思考。

举个有趣的例子,上传一张你的手掌,再点击Thinking,QVQ-Max就可以给你看手相

可以看到,在深度思考过后,QVQ-Max就开始逐步分析手掌上的线条和其他特征。

包括心线、头线、生命线等主要线条的分析,以及戒指手指上的金戒指的象征意义。

这还只是一个比较有娱乐性的例子。

如果你一口气给QVQ-Max“喂”多张图片,它也可以进行深度思考:

这两张图片描绘了哪些风景?它们之间的关系是什么?

在一顿思考过后,QVQ-Max准确地识别出两张图联系——都是西湖的风景,但一张是春夏时节,另一张是冬季。

再如数学推理,同样是给它“喂”一张图即可,连提问都省了:

在思考之后,QVQ-Max是找到了数字们之间的规律,并最终给出了正确答案:10。

以及直接上传一个手绘简笔画视频,并附上一句:

分析视频,将视觉内容与文字结合,并为视频中的镜头创建生动有趣的字幕。

最终,QVQ-Max依旧是稳稳地完成了任务。

网友们看罢,也是麻溜地去试了试。

不过这一次,QVQ-Max有点小翻车——路飞是认对了,但这个乔巴……

以及啊,这两天被OpenAI GPT-4o图像生成带火的吉卜力,网友们也是跟上了:

那么QVQ-Max的图像视频深度思考实力到底如何,我们这就亲手尝试一番。

实测QVQ-Max

首先,我们还是来测试一下QVQ-Max看图解数学题的能力。

题目是这样的:

然后我们提问:

这道题的答案是多少?

在深度思考过后,QVQ-Max不仅精准识别出了手写的题目,而且给出了正确答案:2。

刚才Qwen官方给出了看手相的例子,这次我们再来“喂”下这张图:

问题是这样的:

这是什么?

嗯,是比较全面地介绍了星盘。

接下来,我们再来测试一下视频推理,例子就用Anthropic最新发布的一个:

若是刨去视频里的背景音,单是看内容,还是比较抽象的。

对此,QVQ-Max给出的理解是:

从观察到推理

除了效果之外,虽然Qwen团队没有公布相关论文,但对于背后的技术亮点,团队还是简单的介绍了一番。

首先,团队在MathVision这个benchmark(汇集各类困难多模态数学)上进行了一番测试:

结果表明,通过调整模型thinking的最大长度,模型在MathVision上的准确率也会持续提升。

除此之外,团队还总结了QVQ-Max的三大能力特点。

包括对图片的解析能力非常强,无论是复杂的图表还是日常生活中随手拍的照片,它都能快速识别出关键元素。比如,它可以告诉你一张照片里有哪些物品、有什么文字标识,甚至还能指出一些你可能忽略的小细节。

仅仅识别出图片里的内容还不够,QVQ-Max还能进一步分析这些信息,并结合背景知识得出结论。

例如,在一道几何题中,它可以根据题目附带的图形推导出答案;在一段视频里,它能根据画面内容推测出接下来可能发生的情节。

除了分析和推理,QVQ-Max还能做一些有趣的事情,比如帮你设计插画、生成短视频脚本,甚至根据你的需求创作角色扮演的内容。

如果你上传一幅草稿,它可能会帮你完善成一幅完整的作品;上传一个日常照片,它可以化身犀利的评论家,占卜师。

值得注意的是,QVQ-Max是免费可用的哦,感兴趣的朋友快去试试吧~

体验地址:
https://chat.qwen.ai

参考链接:
[1]https://qwenlm.github.io/zh/blog/qvq-max-preview/
[2]https://x.com/Alibaba_Qwen/status/1905342260100956210

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —

速抢席位!中国AIGC产业峰会观众报名通道已开启 🙋‍♀️

首批嘉宾曝光啦 🔥 百度、无问芯穹、数势科技、生数科技、像素绽放等十数位AI领域创变者将齐聚峰会,让更多人用上AI、用好AI,与AI一同加速成长~

4月16日,就在北京一起来深度求索AI怎么用 🙌 点击报名参会


🌟 一键星标 🌟

科技前沿进展每日见


内容中包含的图片若涉及版权问题,请及时与我们联系删除

Fish AI Reader

Fish AI Reader

AI辅助创作,多种专业模板,深度分析,高质量内容生成。从观点提取到深度思考,FishAI为您提供全方位的创作支持。新版本引入自定义参数,让您的创作更加个性化和精准。

FishAI

FishAI

鱼阅,AI 时代的下一个智能信息助手,助你摆脱信息焦虑

联系邮箱 441953276@qq.com

相关标签

QVQ-Max 视觉推理 大模型 人工智能 图像分析
相关文章