IT之家 04月24日
Nari Labs 开源 16 亿参数文字转语音 AI 模型 Dia,支持精细化调节音频的音色 / 情绪 / 语调
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_guoji1.html

 

韩国Nari Labs工作室开源了名为Dia的文字转语音AI模型,该模型拥有16亿参数,在GitHub上获得了广泛关注。Dia在音质和语音自然度上超越了ElevenLabs Studio和Sesame等竞品,支持对输出音频的音色、情绪和语调进行精细调节,并能模拟非语言交流。目前Dia仅支持英文,用户可在Hugging Face Spaces在线使用或本地部署运行,Nari Labs计划推出一键部署服务,降低使用门槛。

🎤 Dia是一款由Nari Labs工作室开发的文字转语音AI模型,拥有16亿参数,并在GitHub上开源。

✨ Dia在语音质量和自然度方面表现出色,优于ElevenLabs Studio和Sesame等竞品。

🕹️ Dia支持对输出音频的音色、情绪和语调进行精细调节,并能模拟非语言交流,如大笑、咳嗽等。

💻 目前Dia仅支持英文,用户可以在Hugging Face Spaces在线使用,或通过英伟达RTX 3080及以上显卡进行本地部署。

🚀 Nari Labs计划推出一键部署服务,以降低使用门槛,让更多人体验高质量文本转语音技术。

IT之家 4 月 24 日消息,由两名韩国研究者组建的 Nari Labs 工作室于前天在 GitHub 和 Hugging Face 开源了拥有 16 亿参数的文字转语音 AI 模型 Dia,目前相应模型已在 GitHub 上收获了超过 9300 颗星标,IT之家附项目 GitHub 页如下:https://github.com/nari-labs/dia

相应研究者声称 Dia 的音质相对于业界的文字转语音模型拥有更灵活的自由度,同时在生成的语音自然度方面超越了 ElevenLabs Studio、Sesame 等竞品。其支持对输出音频的音色、情绪和语调进行精细调节,还能模拟各种非语言交流(如大笑、咳嗽或清嗓子等)

官方对比测试显示,Dia 在声调自然度、表情丰富度和语音节奏感方面,均优于专注自然语音合成的 ElevenLabs Studio 以及 Sesame 推出的对话语音模型 CSM-1B。

目前,Dia 仅支持英文,需要英伟达 RTX 3080 及以上显卡才能本地部署运行,不过用户也可以在 Hugging Face Spaces 线上平台中在线使用。Nari Labs 表示,后续将推出面向普通消费者的一键部署服务,进一步降低使用门槛,让更多人无缝体验高质量文本转语音技术。

Fish AI Reader

Fish AI Reader

AI辅助创作,多种专业模板,深度分析,高质量内容生成。从观点提取到深度思考,FishAI为您提供全方位的创作支持。新版本引入自定义参数,让您的创作更加个性化和精准。

FishAI

FishAI

鱼阅,AI 时代的下一个智能信息助手,助你摆脱信息焦虑

联系邮箱 441953276@qq.com

相关标签

Dia 文字转语音 AI模型 Nari Labs 开源
相关文章