Qwen-Audio-3.1-ASR

NEW
复制成功!
加入对比

概述

Qwen-Audio-3.1-ASR-Flash是一款支持短语音高效识别的大模型,面向高质量、多语种及文化内容转写场景。模型支持多语种与多地区中文方言识别,同时针对中文古诗词的韵律、节奏与文言表达进行优化。具备上下文增强、标点预测与文本规范化能力。同时该版本支持多种方言 ASR/AST 可控输出。原生转写润色能力及工业级多人对话分角色转写能力。

输入

音频

输出

文本

功能

前缀补全

调用通义千问 API 时启用 Partial Mode,可让模型严格接续您提供的前缀文本进行生成。查看文档

函数调用

通过函数调用将大模型与外部工具和系统连接起来。查看文档

缓存

Context Cache 会缓存长上下文请求的公共前缀,减少重复计算、提升响应速度并降低成本。查看文档

结构化输出

结构化输出可确保模型返回符合预期格式的 JSON 字符串。查看文档

批量任务

异步批量处理请求,降低调用成本。查看文档

联网搜索

启用联网搜索后,模型可基于实时检索的数据进行回答。查看文档

微调

基于样本数据训练模型,使其更适配特定任务。查看文档

定价

  • 输入
    ¥0.8/M tokens
  • 输出
    ¥2.7/M tokens

速率限制

  • RPM每分钟请求数
    600

API 参考

调用API
复制成功!
1234567891011121314151617181920212223242526
curl --location --request POST 'https://maas.qianwenaiapi.com/api/v1/services/aigc/multimodal-generation/generation' \
     --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
     --header "Content-Type: application/json" \
     --header "X-DashScope-SSE: disable" \
     --data '{
    "model": "qwen-audio-3.1-asr-flash",
    "input": {
        "messages": [
            {
                "role": "user",
                "content": [
                    {
                        "type": "input_audio",
                        "input_audio": {
                            "data": "{YOUR_AUDIO_URL}"
                        }
                    }
                ]
            }
        ]
    },
    "parameters": {
        "format": "wav",
        "sample_rate": "16000"
    }
}'