4 月 24 日消息,由两名韩国研究者组建的 Nari Labs 工作室于前天在 GitHub 和 Hugging Face 开源了拥有 16 亿参数的文字转语音 AI 模型 Dia,目前相应模型已在 GitHub 上收获了超过 9300 颗星标,附项目 GitHub 页如下:https://github.com/nari-labs/dia
相应研究者声称 Dia 的音质相对于业界的文字转语音模型拥有更灵活的自由度,同时在生成的语音自然度方面超越了 ElevenLabs Studio、Sesame 等竞品。其支持对输出音频的音色、情绪和语调进行精细调节,还能模拟各种非语言交流(如大笑、咳嗽或清嗓子等)。
官方对比测试显示,Dia 在声调自然度、表情丰富度和语音节奏感方面,均优于专注自然语音合成的 ElevenLabs Studio 以及 Sesame 推出的对话语音模型 CSM-1B。
目前,Dia 仅支持英文,需要英伟达 RTX 3080 及以上显卡才能本地部署运行,不过用户也可以在 Hugging Face Spaces 线上平台中在线使用。Nari Labs 表示,后续将推出面向普通消费者的一键部署服务,进一步降低使用门槛,让更多人无缝体验高质量文本转语音技术。
该内容转自IT之家
本文共 303 个字数,平均阅读时长 ≈ 1分钟
喜欢就支持一下吧
本站为个人博客,博客所发布的一切破解补丁、注册机和注册信息及软件的文章仅限用于学习和研究目的。
不得将上述内容用于商业或者非法用途,否则,一切后果请用户自负。
本站信息来自网络,版权争议与本站无关,您必须在下载后的24个小时之内从您的电脑中彻底删除上述内容。
访问和下载本站内容,说明您已同意上述条款。
本站不贩卖软件,所有内容不作为商业行为。如果有侵犯您的权益请点击“关于”联系WFXL,核实后会及时删除
版权属于:新闻发布
作品采用《署名-非商业性使用-相同方式共享 4.0 国际 (CC BY-NC-SA 4.0)》许可协议授权
评论 抢沙发