一句话识别及翻译V1.0

复制成功!
立即体验加入对比
语音识别

概述

语音识别

多语言语音转写及翻译的多模态大模型。本模型支持60秒以内的实时语音识别,适用于语音搜索、设备指令等场景。提供10个混合语种的高准确率识别服务,同时支持中英日韩互译,以其他6个语种翻译成中文或英文。

输入

音频

输出

文本

功能

前缀补全

您可在调用通义千问 API 时启用 Partial Mode,确保模型严格基于您的起始文本进行生成。查看文档

函数调用

您可以使用 函数调用 功能,通过引入外部工具,使得大模型可以与外部世界进行交互。查看文档

缓存

Context Cache 技术会缓存长上下文请求的公共前缀,减少推理时的重复计算,提升响应速度同时降低您的使用成本。查看文档

结构化输出

开启结构化输出功能可以确保大模型输出标准格式的 JSON 字符串。查看文档

批量任务

联网搜索

启用联网检索功能后,模型将基于实时检索数据进行回复。查看文档

微调

定价

  • 音频时长
    ¥0.00015每秒

速率限制

  • RPM每分钟请求数
    600

API 参考

获取 API Key
复制成功!
1234567891011121314151617181920212223242526272829303132333435
import requests
from http import HTTPStatus

import dashscope
from dashscope.audio.asr import *

# 若没有将API Key配置到环境变量中,需将your-api-key替换为自己的API Key
# dashscope.api_key = "your-api-key"

r = requests.get(
    "https://dashscope.oss-cn-beijing.aliyuncs.com/samples/audio/paraformer/hello_world_female2.wav"
)
with open("asr_example.wav", "wb") as f:
    f.write(r.content)

translator = TranslationRecognizerRealtime(
    model="gummy-chat-v1",
    format="wav",
    sample_rate=16000,
    translation_target_languages=["en"],
    translation_enabled=True,
    callback=None,
)
result = translator.call("asr_example.wav")
if not result.error_message:
    print("request id: ", result.request_id)
    print("transcription: ")
    for transcription_result in result.transcription_result_list:
        print(transcription_result.text)
    print("translation[en]: ")

    for translation_result in result.translation_result_list:
        print(translation_result.get_translation('en').text)
else:
    print("Error: ", result.error_message)