通义多模态向量

复制成功!
加入对比
向量

概述

向量

Embedding-Vision是基于LLM底座的视觉多模态表征模型,具有以视觉为中心、领域性能优异(电商、 安防、相册/图库、自驾等)、高性价比的特点。兼容文本、图像、视频3种模态,可应用于以图搜图、以文搜图、以文搜视频,以视频搜视频等下游任务场景。本模型(tongyi-embedding-vision-flash)是轻量化版本,在视觉向量化上具备极高性价比。

输入

文本图像视频

输出

功能

前缀补全

函数调用

缓存

结构化输出

批量任务

联网搜索

微调

定价

  • 图片输入
    ¥0.15/M tokens
  • 文本输入
    ¥0.15/M tokens

速率限制

  • RPM每分钟请求数
    600
  • TPM每分钟 Token 数
    200K

API 参考

获取 API Key
复制成功!
1234567891011
import dashscope

text = "通用多模态表征模型示例"
input = [{'text': text}]
resp = dashscope.MultiModalEmbedding.call(
    model="tongyi-embedding-vision-flash",
    input=input
)

print(resp)