智谱 · GLM-5.3官方价
GLM-5.3-FlashX
和 GLM-5.3-Flash 同一个模型,推理速度最高约 200 tokens/s,适合要求响应快的对话和编程助手。
1M 上下文128K 输出
输入$0.2857$0.2857
输出$1.00$1.00
缓存读取$0.0814$0.0814
智谱 GLM-5 系列旗舰:1M 上下文、最长 128K 输出,始终开启深度思考,适合复杂编程、长文档和多步任务。
「最新旗舰模型,编程体验提升 50%」— 智谱 官方介绍
美元 / 百万 tokens,划线为官方当前标价。
在棉花糖 API
base_url 填 https://api.mallowapi.com/v1,model 填 GLM-5.3。
# pip install openai
from openai import OpenAI
client = OpenAI(
api_key="sk-你的密钥",
base_url="https://api.mallowapi.com/v1",
)
resp = client.chat.completions.create(
model="GLM-5.3",
messages=[{"role": "user", "content": "用一句话介绍你自己"}],
)
print(resp.choices[0].message.content)curl https://api.mallowapi.com/v1/chat/completions \
-H "Authorization: Bearer sk-你的密钥" \
-H "Content-Type: application/json" \
-d '{"model": "GLM-5.3", "messages": [{"role": "user", "content": "你好"}]}'
和 GLM-5.3-Flash 同一个模型,推理速度最高约 200 tokens/s,适合要求响应快的对话和编程助手。
GLM-5 系列首个原生多模态模型:能看图片、视频和文件,1M 上下文,价格低,适合量大的日常任务。
DeepSeek V4.1 Flash:1M 上下文、最长 384K 输出,默认开启思考,支持函数调用和 JSON 输出,空闲时段价格减半。
数据来源:bigmodel.cn · docs.bigmodel.cn,核对日期 2026-10-08。