智谱GLM-5.3 · 高速官方价

GLM-5.3-FlashX

和 GLM-5.3-Flash 同一个模型,推理速度最高约 200 tokens/s,适合要求响应快的对话和编程助手。

「推理速度达 200 tokens/s,提供更快、更流畅的模型体验」— 智谱 官方介绍

去创建 Key
上下文窗口1M1,000,000 tokens
最大输出128K128,000 tokens
知识截止—官方未在价格页列出
推理档位
低高最高

价格

美元 / 百万 tokens,划线为官方当前标价。

在棉花糖 API

$0.2857输入 · 官方 $0.2857
$1.00输出 · 官方 $1.00
官方价
缓存读取$0.0814$0.0814

怎么调用

base_url 填 https://api.mallowapi.com/v1,model 填 GLM-5.3-FlashX。

# pip install openai
from openai import OpenAI

client = OpenAI(
    api_key="sk-你的密钥",
    base_url="https://api.mallowapi.com/v1",
)

resp = client.chat.completions.create(
    model="GLM-5.3-FlashX",
    messages=[{"role": "user", "content": "用一句话介绍你自己"}],
)
print(resp.choices[0].message.content)

    亮点

  • 速度约为 Flash 的 5 倍
  • 原生多模态,1M 上下文

    适合用来

  • 实时对话
  • 编程助手

同系列的其他模型

全部模型
智谱 · GLM-5.3官方价

GLM-5.3

智谱 GLM-5 系列旗舰:1M 上下文、最长 128K 输出,始终开启深度思考,适合复杂编程、长文档和多步任务。

1M 上下文128K 输出
输入$1.14$1.14
输出$4.00$4.00
缓存读取$0.2857$0.2857
详情与接入 →
智谱 · GLM-5.3官方价

GLM-5.3-Flash

GLM-5 系列首个原生多模态模型:能看图片、视频和文件,1M 上下文,价格低,适合量大的日常任务。

1M 上下文128K 输出
输入$0.1143$0.1143
输出$0.40$0.40
缓存读取$0.0329$0.0329
详情与接入 →
DeepSeek · DeepSeek-V4.1官方价

DeepSeek-V4.1-Flash

DeepSeek V4.1 Flash:1M 上下文、最长 384K 输出,默认开启思考,支持函数调用和 JSON 输出,空闲时段价格减半。

1M 上下文384K 输出
输入$0.1429$0.1429
输出$0.5714$0.5714
缓存读取$0.0029$0.0029
详情与接入 →

数据来源:docs.bigmodel.cn · finance.eastmoney.com,核对日期 2026-10-08。