Qwen-Omni-Turbo
复制成功!
多模态
概述
多模态
千问全新多模态理解生成大模型,支持文本, 图像,语音,视频输入理解和混合输入理解,具备文本和语音同时流式生成能力,多模态内容理解速度显著提升,提供了4种自然对话音色,此版本为2025年3月26日的快照版本,相比1月19日的快照版本在视觉能力上有大幅提升。
输入
文本图像视频音频
输出
文本音频
功能
定价
- 输入:文本¥0.4/M tokens
- 输入:音频¥25/M tokens
- 输入:图片/视频¥1.5/M tokens
- 输出:文本(输入仅包含文本时)¥1.6/M tokens
- 输出:文本(输入包含图片/音频/视频时)¥4.5/M tokens
- 输出:文本+音频(输出的文本不计费)¥50/M tokens
速率限制与上下文
- 最大输入30.72K
- 最大输出2.04K
- RPM每分钟请求数60
- TPM每分钟 Token 数100K
- 上下文32.76K