Qwen3-Omni-30b-a3b-Captioner
复制成功!
语音识别
概述
语音识别
千问3-Omni-30b-a3b-Captioner是一款强大的音频细粒度分析模型,专为在复杂多变的音频场景中生成精准、全面的内容描述而设计,可自动解析并描述从复杂语音、环境声到音乐、影视声效等各类音频内容,能够在多声源、混合化的环境中亦保持稳定而可信的输出。
输入
音频
输出
文本
功能
定价
- 输入:音频¥15.8/M tokens
- 输出:文本(输入包含图片/音频/视频时)¥12.7/M tokens
速率限制与上下文
- 最大输入32.76K
- 最大输出32.76K
- RPM每分钟请求数60
- TPM每分钟 Token 数100K
- 上下文65.53K