Qwen-Omni-Turbo
复制成功!
多模态
概述
多模态
千问全模态理解生成大模型,支持文本, 图像,语音,视频输入理解和混合输入理解,具备文本和语音同时流式生成能力,多模态内容理解速度显著提升,提供了4种自然对话音色,此版本为2025年1月19日的快照版本,预计维护至下一个快照发布前的一个月左右。
输入
文本图像视频音频
输出
文本音频
功能
定价
- 输入:文本¥0.4/M tokens
- 输入:音频¥25/M tokens
- 输入:图片/视频¥1.5/M tokens
- 输出:文本(输入仅包含文本时)¥1.6/M tokens
- 输出:文本(输入包含图片/音频/视频时)¥4.5/M tokens
- 输出:文本+音频(输出的文本不计费)¥50/M tokens
速率限制与上下文
- 最大输入30.72K
- 最大输出2.04K
- RPM每分钟请求数60
- TPM每分钟 Token 数100K
- 上下文32.76K
API 参考
获取 API Key复制成功!
12345678910111213141516171819202122232425
import os
from openai import OpenAI
client = OpenAI(
# 新加坡和北京地域的API Key不同。获取API Key:https://www.alibabacloud.com/help/zh/model-studio/get-api-key
api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
completion = client.chat.completions.create(
model="qwen-omni-turbo-2025-01-19",
messages=[{"role": "user", "content": "你是谁"}],
# 设置输出数据的模态,当前支持两种:["text","audio"]、["text"]
modalities=["text", "audio"],
audio={"voice": "Ethan", "format": "wav"},
# stream 必须设置为 True,否则会报错
stream=True,
stream_options={"include_usage": True},
)
for chunk in completion:
if chunk.choices:
print(chunk.choices[0].delta)
else:
print(chunk.usage)