通义多模态向量

复制成功!
加入对比
向量

概述

向量

Tongyi-Embedding-Vision是基于LLM底座的视觉多模态表征模型,支持文本、图像、视频3种模态,具有以视觉为中心、全场景性能优异、高性价比的特点,适用于以图搜图、以文搜图、以文搜视频、以视频搜视频、以文搜文、以文搜图文等下游多样化任务场景。 2026-03-06版本在保留极致性价比优势的同时,基于Qwen3底座实现了效果与功能全面升级,包括全场景性能提升、多分辨率模式/多向量维度/多语言能力/融合向量等能力的支持。

输入

文本图像视频

输出

文本

功能

前缀补全

函数调用

缓存

结构化输出

批量任务

联网搜索

微调

定价

  • 图片输入
    ¥0.5/M tokens
  • 文本输入
    ¥0.5/M tokens

速率限制

  • RPM每分钟请求数
    1.20K
  • TPM每分钟 Token 数
    9.60M

API 参考

获取 API Key
复制成功!
1234567891011
import dashscope

text = "通用多模态表征模型示例"
input = [{'text': text}]
resp = dashscope.MultiModalEmbedding.call(
    model="tongyi-embedding-vision-plus-2026-03-06",
    input=input
)

print(resp)