智谱GLM系列文本模型

复制成功!
加入对比

概述

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,以极致低成本架构实现超越 GLM-5.2 的更强智能。采用 320B 总参 / 18B 激活的稀疏+线性注意力混合架构,注意力计算量与 KV 缓存分别降低 3.01 倍和 4.44 倍。视觉能力原生融入 Coding 循环,可主动观察界面、渲染结果与交互反馈,跨代码、浏览器与图形界面协同完成任务。同时拓展至 Office、金融研究及专业文档场景,能自主拆解目标、调用工具并优化输出,交付 PPTX、PDF、DOCX、XLSX 等高质量成品。

输入

文本图像视频

输出

文本

功能

前缀补全

调用通义千问 API 时启用 Partial Mode,可让模型严格接续您提供的前缀文本进行生成。查看文档

函数调用

通过函数调用将大模型与外部工具和系统连接起来。查看文档

缓存

Context Cache 会缓存长上下文请求的公共前缀,减少重复计算、提升响应速度并降低成本。查看文档

结构化输出

结构化输出可确保模型返回符合预期格式的 JSON 字符串。查看文档

批量任务

异步批量处理请求,降低调用成本。查看文档

联网搜索

启用联网搜索后,模型可基于实时检索的数据进行回答。查看文档

微调

基于样本数据训练模型,使其更适配特定任务。查看文档

定价

  • 输入限时5折
    ¥0.8¥0.4
    /M tokens
  • 输出限时5折
    ¥2.8¥1.4
    /M tokens
  • 输入(缓存命中)限时5折
    ¥0.23¥0.115
    /M tokens

速率限制与上下文

  • 最大输入
    1M
  • 最大输出
    131K
  • 最大输入(思考模式)
    1M
  • 最大输出(思考模式)
    131K
  • 上下文
    1M
  • 最大思维链
    131K
  • TPM每分钟 Token 数
    3M
  • RPM每分钟请求数
    200

API 参考

调用API
复制成功!
1234567891011121314151617181920212223
from openai import OpenAI
import os

client = OpenAI(
    api_key="sk-xxx",  # 替换为你的百炼API Key
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="ZHIPU/GLM-5.3-Flash",
    messages=[{"role": "user", "content": "你是谁"}],
    extra_body={"enable_thinking": True, "reasoning_effort": "max"},
    stream=True,
)

for chunk in completion:
    if not chunk.choices:
        continue
    delta = chunk.choices[0].delta
    if hasattr(delta, "reasoning_content") and delta.reasoning_content:
        print(delta.reasoning_content, end="", flush=True)
    if hasattr(delta, "content") and delta.content:
        print(delta.content, end="", flush=True)