简介
Step-Audio 是阶跃星辰(StepFun)开源的语音大模型,定位于”端到端”的语音交互:输入端理解语音内容与情感,输出端直接生成自然流畅的语音回复,同时支持语音克隆与风格控制,是一个覆盖”听懂—思考—说出”全链路的语音基座模型。
核心功能
- 语音理解:直接理解语音中的语义、语调与情感,无需先转文字。
- 语音生成:生成自然、富有表现力的语音,支持播报、对话等多种场景。
- 实时对话:低延迟的语音交互能力,适用于智能助手与实时客服。
- 风格控制:可通过指令控制情感、语速、方言与音色,并进行语音克隆。
对于希望自建语音助手、有声内容生成或需要中文语音交互能力的开发者而言,Step-Audio 提供了完整且开源的技术基座。