先把两个同名模型分开
这两周的报道里 GLM-5.3 和 GLM-5.3-Flash 经常被混着说,实际是两个模型: 先说 GLM-5.3:8 月 14 日发布,纯文本进出、没有视觉和音频通路,复用 GLM-5.2 的基座、收益全部来自后训练,定价每百万 token 输入 1.40 美元、输出 4.40 美元,提供 low/high/max 三档 effort,默认 max 且不再支持关闭思考。再说 GLM-5.3-Flash:8 月 26 日发布,原生多模态,用的是新训练的基座——混合稀疏与线性注意力架构、Manifold-Constrained Hyper-Connections、30T token 多模态预训练语料,官方称相比文本版 GLM-5.3 注意力计算约少 3.0 倍、KV 缓存约小 4.4 倍。 价格差了近十倍,能力维度也不同,引用时别互相替换。
便宜和开放是真的
MIT 许可证在这个参数量级上不常见——可以下载、微调、商用,没有额外限制。定价方面,列表价每百万 token 输入 0.15 美元、缓存输入 0.03 美元、输出 0.50 美元,另有五折促销(0.075/0.015/0.25)持续到 9 月 9 日;OpenRouter 上有 22 家供应商在提供服务。Z.ai 自报的成绩是 DeepSWE 63.4(GLM-5.2 为 46.2)、AutomationBench 48.8(对比 26.2),并称在其内部编码基准上与 Claude Opus 4.8 相差半分以内、价格约为十分之一——这些都是厂商自报数字,没有独立复现。 一个有意思的细节是发布方式:它先用「Ox Alpha」的匿名身份在 OpenCode 和 OpenRouter 上跑了一周才揭晓,据称由国产 AI 芯片承载。匿名先跑一周本质上是让社区在不知道厂商的前提下先做一轮盲评。
三条选型前要知道的限制
一,100 万上下文是输入上限,不是质量深度:架构上 max_position_embeddings 为 1,048,576,OpenRouter 标称可服务 1,310,720 token,但模型卡公布的长上下文评测只做到 30 万 token。也就是说超过 30 万之后的表现没有公开证据,别按 100 万去设计流程。 二,自托管门槛不低:FP8 权重约 306 GiB,需要用 SGLang、vLLM 或 TokenSpeed 做多卡服务。Unsloth 的动态 GGUF 能在 128 GB 机器上以 1–2 bit 跑,但 glm5_next 架构尚未进入 llama.cpp 主线,所以 Ollama 和 LM Studio 目前无法本地加载——想在笔记本上跑的可以先放弃这个念头。 三,促销价有到期日:9 月 9 日之后回到列表价,做成本测算时用 0.15/0.50 而不是促销价更稳妥。 对在选低成本多模态模型的团队,这一代值得进候选名单的理由是「MIT 权重 + 原生多模态 + 这个价位」的组合;但如果你的场景依赖超长上下文的实际质量,或者需要在单机上本地部署,现在还不是时候。
via: MarkTechPost:GLM-5.3-Flash、Z.AI 开发者文档、OpenRouter 模型页、VentureBeat(GLM-5.3)