Qwen-VL-Embedding

复制成功!
立即体验加入对比

概述

基于Qwen3-VL底座训练的统一多模态向量模型,支持文本、图片、视频单模态/混合模态输入,输出统一表征向量,适用于跨模态检索、图搜、视频检索、图像聚类、复杂多模态信息检索、打标等场景

输入

文本图像

输出

功能

前缀补全

调用通义千问 API 时启用 Partial Mode,可让模型严格接续您提供的前缀文本进行生成。查看文档

函数调用

通过函数调用将大模型与外部工具和系统连接起来。查看文档

缓存

Context Cache 会缓存长上下文请求的公共前缀,减少重复计算、提升响应速度并降低成本。查看文档

结构化输出

结构化输出可确保模型返回符合预期格式的 JSON 字符串。查看文档

批量任务

异步批量处理请求,降低调用成本。查看文档

联网搜索

启用联网搜索后,模型可基于实时检索的数据进行回答。查看文档

微调

基于样本数据训练模型,使其更适配特定任务。查看文档

定价

  • 图片输入
    ¥1.8/M tokens
  • 文本输入
    ¥0.7/M tokens

速率限制与上下文

  • 最大输入
    32K
  • TPM每分钟 Token 数
    1M
  • RPM每分钟请求数
    2K

API 参考

调用API
复制成功!
1234567891011
import dashscope

text = "通用多模态表征模型示例"
input = [{'text': text}]
resp = dashscope.MultiModalEmbedding.call(
    model="qwen3-vl-embedding",
    input=input
)

print(resp)