通义多模态向量
复制成功!
向量
概述
向量
Tongyi-Embedding-Vision是基于LLM底座的视觉多模态表征模型,支持文本、图像、视频3种模态,具有以视觉为中心、全场景性能优异、高性价比的特点,适用于以图搜图、以文搜图、以文搜视频、以视频搜视频、以文搜文、以文搜图文等下游多样化任务场景。本模型(tongyi-embedding-vision-flash)是轻量化版本,具备极高性价比。 2026-03-06版本在保留极致性价比优势的同时,基于Qwen3底座实现了效果与功能全面升级,包括全场景性能提升、多分辨率模式/多向量维度/多语言能力/融合向量等能力的支持。
输入
文本图像视频
输出
文本
功能
前缀补全
函数调用
缓存
结构化输出
批量任务
联网搜索
微调
定价
- 图片输入¥0.15/M tokens
- 文本输入¥0.15/M tokens
速率限制
- RPM每分钟请求数1.20K
- TPM每分钟 Token 数9.60M
API 参考
获取 API Key复制成功!
1234567891011
import dashscope
text = "通用多模态表征模型示例"
input = [{'text': text}]
resp = dashscope.MultiModalEmbedding.call(
model="tongyi-embedding-vision-flash-2026-03-06",
input=input
)
print(resp)