DeepSeek

复制成功!
加入对比

概述

DeepSeek-V4.1-Flash 是 DeepSeek 全新架构系列中的轻量旗舰模型,以 552B 总参数 MoE 实现越级智能,在多项基准上超越包括 DeepSeek-V4-Pro 在内的主流旗舰模型。采用 Causal Encoder-Decoder 非对称架构,输入激活仅 8B、输出激活 16B,并具备原生多模态视觉理解能力。KV Cache 压缩至上一代 HBM 的 1/4、SSD 的 1/8,显著降低长上下文与 Agent 任务成本。支持 1M 上下文与 384K 最大输出,兼顾高吞吐、低延迟与极致性价比。

输入

文本图像

输出

文本

功能

前缀补全

调用通义千问 API 时启用 Partial Mode,可让模型严格接续您提供的前缀文本进行生成。查看文档

函数调用

通过函数调用将大模型与外部工具和系统连接起来。查看文档

缓存

Context Cache 会缓存长上下文请求的公共前缀,减少重复计算、提升响应速度并降低成本。查看文档

结构化输出

结构化输出可确保模型返回符合预期格式的 JSON 字符串。查看文档

批量任务

异步批量处理请求,降低调用成本。查看文档

联网搜索

启用联网搜索后,模型可基于实时检索的数据进行回答。查看文档

微调

基于样本数据训练模型,使其更适配特定任务。查看文档

定价

错峰时段指东八区22点至次日8点,此外为忙时
  • 输入
    ¥1/M tokens
  • 输出
    ¥4/M tokens
  • 输入(缓存命中)
    ¥0.1/M tokens

速率限制与上下文

  • 最大输入
    1M
  • 最大输出
    393K
  • 最大输入(思考模式)
    1M
  • 最大输出(思考模式)
    393K
  • 上下文
    1M
  • 最大思维链
    393K
  • TPM每分钟 Token 数
    1M

内置工具

代码解释器code_interpreterResponses API
网页抓取web_extractorResponses API
web_fetchweb_fetchAnthropic API
联网搜索web_searchResponses API
web_searchweb_searchAnthropic API

API 参考

调用API
复制成功!
123456789101112131415161718192021
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="deepseek-v4.1-flash",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "image_url", "image_url": {"url": "https://example.com/image.jpg"}},
                {"type": "text", "text": "请仅输出图像中的文本内容。"},
            ],
        }
    ],
)
print(completion.choices[0].message.content)