Qwen-Audio-3.1-TTS-Next
NEW复制成功!
概述
Qwen-Audio-3.1-TTS-Next 是一款面向统一音频生成的 Audiogen 模型,不再局限于传统 TTS 的单一语音合成,而是能够围绕文本、时间戳和参考音频等输入,一次生成完整的音频内容,包括人声、音效、环境音、背景音乐等。模型支持多语种 TTS、单人说话、多人对话、Podcast 播客、影视剧声景、音乐、环境音与音效等任务。其核心亮点在于更自然的人声表达、稳定的音色保持、灵活的时间控制,以及高质量音乐与综合声景生成能力,适用于内容创作、短视频、播客、影视和游戏音频制作等场景。
输入
文本音频
输出
音频
功能
定价
- 输入¥6/M tokens
- 输出¥12/M tokens
速率限制
- RPM每分钟请求数180
API 参考
调用API复制成功!
1234567891011121314151617181920
# coding=utf-8
import dashscope
from dashscope.audio.tts_v2 import *
# If the API Key is not configured in the environment variable, your-api-key needs to be replaced with your own API Key
# dashscope.api_key = "your-api-key"
dashscope.base_websocket_api_url='wss://maas.qianwenaiapi.com/api-ws/v1/inference'
model = "qwen-audio-3.1-tts-next"
#Please enter the correct voice below.
voice = ""
synthesizer = SpeechSynthesizer(model=model, voice=voice)
audio = synthesizer.call("How is the weather today?")
with open('output.mp3', 'wb') as f:
f.write(audio)