通义多模态向量

复制成功!
加入对比
向量

概述

向量

Embedding-Vision是基于LLM底座的视觉多模态表征模型,具有以视觉为中心、领域性能优异(电商、 安防、相册/图库、自驾等)、高性价比的特点。兼容文本、图像、视频3种模态,可应用于以图搜图、以文搜图、以文搜视频,以视频搜视频等下游任务场景。

输入

文本图像视频

输出

功能

前缀补全

您可在调用通义千问 API 时启用 Partial Mode,确保模型严格基于您的起始文本进行生成。查看文档

函数调用

您可以使用 函数调用 功能,通过引入外部工具,使得大模型可以与外部世界进行交互。查看文档

缓存

Context Cache 技术会缓存长上下文请求的公共前缀,减少推理时的重复计算,提升响应速度同时降低您的使用成本。查看文档

结构化输出

开启结构化输出功能可以确保大模型输出标准格式的 JSON 字符串。查看文档

批量任务

联网搜索

启用联网检索功能后,模型将基于实时检索数据进行回复。查看文档

微调

定价

  • 图片输入
    ¥0.5/M tokens
  • 文本输入
    ¥0.5/M tokens

速率限制

  • RPM每分钟请求数
    600
  • TPM每分钟 Token 数
    200K

API 参考

获取 API Key
复制成功!
1234567891011
import dashscope

text = "通用多模态表征模型示例"
input = [{'text': text}]
resp = dashscope.MultiModalEmbedding.call(
    model="tongyi-embedding-vision-plus",
    input=input
)

print(resp)