千问发布语音合成大模型 Qwen-Audio-3.0-TTS,支持自然语言指令控制,Flash 版首包延时 300 毫秒级别

据千问官方消息,千问正式发布语音合成大模型 Qwen-Audio-3.0-TTS。该模型支持 Free-style 自然语言指令控制,用户可通过自然语言描述实现对合成语音效果的定制。

此次发布的模型包含两个版本:Flash 版本与 Plus 版本。Flash 版本面向实时交互场景设计,首包延时达到 300 毫秒级别,可用于对话等低延迟语音合成任务。Plus 版本面向高质量生成需求,提供更优的合成音质表现。

市场有风险,投资需谨慎。本文为AI基于第三方数据生成,仅供参考,不构成个人投资建议。

财经频道更多独家策划、专家专栏,免费查阅>>

责任编辑:钟离
AI智能分析该文,为您挖掘投资机会该AI功能处于试用阶段,内容仅供参考,请仔细甄别!
展开
精彩推荐
加载更多
全部评论
热榜
关闭 下载金融界app
金融界App
金融界微博
金融界公众号