Dia
🎵

Dia

Nari Labs 开源的文本转语音模型,支持多说话人对话与情感语音生成。

🎵 音频 🆓 免费 ★★★★☆
访问官网
✓ 优点
  • 一段文本即可生成多人对话音频
  • 合成音质自然、表现力强
  • 开源可自由定制与商用
  • 支持笑声、叹气等非语言声音
! 缺点
  • 长文本稳定性偶有波动
  • 音色克隆能力相对有限
  • 本地运行需要较好 GPU
✦ 核心功能
  • 高质量中英文语音合成
  • 多说话人对话生成
  • 情感与非语言声音控制
  • 可本地部署运行
  • 开源模型权重

简介

Dia 是由 Nari Labs 开源的一款文本转语音(TTS)模型。它最鲜明的特点是面向对话场景设计:只需在文本中用说话人标签区分角色,即可一次生成多人对话音频,并且能够表达笑声、叹气、停顿等非语言声音,让合成语音更接近真实对白。

Dia 以开源、表现力和易用性见长,适合播客、有声内容与语音应用的原型开发。

核心功能

多说话人对话

在同一段文本中区分多个角色,一次生成自然的对话音频。

情感与音效

支持笑声、叹息、情绪语气等副语言特征的表达。

开源可部署

模型权重开放,可本地运行与二次开发。

适用场景

  • 播客与有声书配音
  • 游戏与虚拟角色的对话语音
  • 语音应用与交互原型开发