IT之家 06月06日 08:48
阿里开源 Qwen3 新模型 Embedding 及 Reranker,带来强大多语言、跨语言支持
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_guoji1.html

 

阿里巴巴近日开源了Qwen3-Embedding系列模型,专为文本表征、检索与排序任务设计,基于Qwen3基础模型训练。该系列模型在多项基准测试中表现优异,尤其是在多语言文本表征和排序任务中展现出卓越性能,超越众多商业API服务。Qwen3-Embedding系列模型提供0.6B到8B参数规模的多种配置,支持表征维度自定义和指令适配优化,并具备全面的多语言支持,涵盖超过100种语言。开发者可以灵活组合表征与排序模块,以满足不同场景下的性能与效率需求,有效提升搜索结果的相关性。

🥇 卓越的泛化性:Qwen3-Embedding系列在多个下游任务评估中达到行业领先水平。其中,8B参数规模的Embedding模型在MTEB多语言Leaderboard榜单中位列第一(截至2025年6月6日,得分70.58),性能超越众多商业API服务。

⚙️ 灵活的模型架构:Qwen3-Embedding系列提供从0.6B到8B参数规模的3种模型配置,以满足不同场景下的性能与效率需求。开发者可以灵活组合表征与排序模块,实现功能扩展。

📐 定制化特性:模型支持表征维度自定义,允许用户根据实际需求调整表征维度,有效降低应用成本;指令适配优化,支持用户自定义指令模板,以提升特定任务、语言或场景下的性能表现。

🌐 全面的多语言支持:Qwen3-Embedding系列支持超过100种语言,涵盖主流自然语言及多种编程语言。该系列模型具备强大的多语言、跨语言及代码检索能力,能够有效应对多语言场景下的数据处理需求。

💡 模型工作机制:Embedding模型接收单段文本作为输入,取模型最后一层“EOS”标记对应的隐藏状态向量,作为输入文本的语义表示;Reranker模型则接收文本对(例如用户查询与候选文档)作为输入,利用单塔结构计算并输出两个文本的相关性得分。

IT之家 6 月 6 日消息,阿里今日凌晨开源了 Qwen3-Embedding 系列模型(Embedding 及 Reranker),专为文本表征、检索与排序任务设计,基于 Qwen3 基础模型进行训练。

官方表示,在多项基准测试中,Qwen3-Embedding 系列在文本表征和排序任务中展现了卓越的性能。

其具备如下特点:

卓越的泛化性:Qwen3-Embedding 系列在多个下游任务评估中达到行业领先水平。其中,8B 参数规模的 Embedding 模型在 MTEB 多语言 Leaderboard 榜单中位列第一(截至 2025 年 6 月 6 日,得分 70.58),性能超越众多商业 API 服务。此外,该系列的排序模型在各类文本检索场景中表现出色,显著提升了搜索结果的相关性。

灵活的模型架构:Qwen3-Embedding 系列提供从 0.6B 到 8B 参数规模的 3 种模型配置,以满足不同场景下的性能与效率需求。开发者可以灵活组合表征与排序模块,实现功能扩展。

此外,模型支持以下定制化特性:

全面的多语言支持:Qwen3-Embedding 系列支持超过 100 种语言,涵盖主流自然语言及多种编程语言。该系列模型具备强大的多语言、跨语言及代码检索能力,能够有效应对多语言场景下的数据处理需求。

据介绍,Embedding 模型接收单段文本作为输入,取模型最后一层「EOS」标记对应的隐藏状态向量,作为输入文本的语义表示;Reranker 模型则接收文本对(例如用户查询与候选文档)作为输入,利用单塔结构计算并输出两个文本的相关性得分。

IT之家附开源地址如下:

ModelScope:

Hugging Face

GitHub:

技术报告:

Fish AI Reader

Fish AI Reader

AI辅助创作,多种专业模板,深度分析,高质量内容生成。从观点提取到深度思考,FishAI为您提供全方位的创作支持。新版本引入自定义参数,让您的创作更加个性化和精准。

FishAI

FishAI

鱼阅,AI 时代的下一个智能信息助手,助你摆脱信息焦虑

联系邮箱 441953276@qq.com

相关标签

Qwen3-Embedding 文本表征 模型开源 多语言支持
相关文章