智谱GLM系列文本模型
复制成功!
概述
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,以极致低成本架构实现超越 GLM-5.2 的更强智能。采用 320B 总参 / 18B 激活的稀疏+线性注意力混合架构,注意力计算量与 KV 缓存分别降低 3.01 倍和 4.44 倍。视觉能力原生融入 Coding 循环,可主动观察界面、渲染结果与交互反馈,跨代码、浏览器与图形界面协同完成任务。同时拓展至 Office、金融研究及专业文档场景,能自主拆解目标、调用工具并优化输出,交付 PPTX、PDF、DOCX、XLSX 等高质量成品。
输入
文本图像视频
输出
文本
功能
定价
- 输入限时5折¥0.8¥0.4/M tokens
- 输出限时5折¥2.8¥1.4/M tokens
- 输入(缓存命中)限时5折¥0.23¥0.115/M tokens
速率限制与上下文
- 最大输入1M
- 最大输出131K
- 最大输入(思考模式)1M
- 最大输出(思考模式)131K
- 上下文1M
- 最大思维链131K
- TPM每分钟 Token 数3M
- RPM每分钟请求数200
API 参考
调用API复制成功!
1234567891011121314151617181920212223
from openai import OpenAI
import os
client = OpenAI(
api_key="sk-xxx", # 替换为你的百炼API Key
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
completion = client.chat.completions.create(
model="ZHIPU/GLM-5.3-Flash",
messages=[{"role": "user", "content": "你是谁"}],
extra_body={"enable_thinking": True, "reasoning_effort": "max"},
stream=True,
)
for chunk in completion:
if not chunk.choices:
continue
delta = chunk.choices[0].delta
if hasattr(delta, "reasoning_content") and delta.reasoning_content:
print(delta.reasoning_content, end="", flush=True)
if hasattr(delta, "content") and delta.content:
print(delta.content, end="", flush=True)