Qwen-Audio-3.1-TTS-Next

NEW
复制成功!
加入对比

概述

Qwen-Audio-3.1-TTS-Next 是一款面向统一音频生成的 Audiogen 模型,不再局限于传统 TTS 的单一语音合成,而是能够围绕文本、时间戳和参考音频等输入,一次生成完整的音频内容,包括人声、音效、环境音、背景音乐等。模型支持多语种 TTS、单人说话、多人对话、Podcast 播客、影视剧声景、音乐、环境音与音效等任务。其核心亮点在于更自然的人声表达、稳定的音色保持、灵活的时间控制,以及高质量音乐与综合声景生成能力,适用于内容创作、短视频、播客、影视和游戏音频制作等场景。

输入

文本音频

输出

音频

功能

前缀补全

调用通义千问 API 时启用 Partial Mode,可让模型严格接续您提供的前缀文本进行生成。查看文档

函数调用

通过函数调用将大模型与外部工具和系统连接起来。查看文档

缓存

Context Cache 会缓存长上下文请求的公共前缀,减少重复计算、提升响应速度并降低成本。查看文档

结构化输出

结构化输出可确保模型返回符合预期格式的 JSON 字符串。查看文档

批量任务

异步批量处理请求,降低调用成本。查看文档

联网搜索

启用联网搜索后,模型可基于实时检索的数据进行回答。查看文档

微调

基于样本数据训练模型,使其更适配特定任务。查看文档

定价

  • 输入
    ¥6/M tokens
  • 输出
    ¥12/M tokens

速率限制

  • RPM每分钟请求数
    180

API 参考

调用API
复制成功!
1234567891011121314151617181920
# coding=utf-8

import dashscope
from dashscope.audio.tts_v2 import *

# If the API Key is not configured in the environment variable, your-api-key needs to be replaced with your own API Key
# dashscope.api_key = "your-api-key"

dashscope.base_websocket_api_url='wss://maas.qianwenaiapi.com/api-ws/v1/inference'

model = "qwen-audio-3.1-tts-next"

#Please enter the correct voice below.
voice = ""

synthesizer = SpeechSynthesizer(model=model, voice=voice)
audio = synthesizer.call("How is the weather today?")

with open('output.mp3', 'wb') as f:
    f.write(audio)