简介
Dia 是由 Nari Labs 开源的一款文本转语音(TTS)模型。它最鲜明的特点是面向对话场景设计:只需在文本中用说话人标签区分角色,即可一次生成多人对话音频,并且能够表达笑声、叹气、停顿等非语言声音,让合成语音更接近真实对白。
Dia 以开源、表现力和易用性见长,适合播客、有声内容与语音应用的原型开发。
核心功能
多说话人对话
在同一段文本中区分多个角色,一次生成自然的对话音频。
情感与音效
支持笑声、叹息、情绪语气等副语言特征的表达。
开源可部署
模型权重开放,可本地运行与二次开发。
适用场景
- 播客与有声书配音
- 游戏与虚拟角色的对话语音
- 语音应用与交互原型开发