2026年9月18日智谱发布GLM-5.3-FlashX,API同步全面开放,据智谱介绍其推理速度最高可达200 tokens/s、较GLM-5.3-Flash提升5倍,定价提升至原版本的2.5倍。上述事实与判断来自证券时报2026年9月18日的公开报道,属来源方转述与观点,非本站核验结论;来源材料未披露定价上调的具体成本核算依据。

定价与提速的公开依据

已发生事实:智谱正式发布GLM-5.3-FlashX,API同步全面开放;据智谱介绍,该版本推理速度最高可达200 tokens/s,较现有GLM-5.3-Flash提升5倍,定价提升至原版本的2.5倍。

来源方自述:智谱称由10万张国产芯片组成的推理集群上线即被用户用满,此次再次扩大算力规模,并推出价格更高、速度更快的FlashX版本,以承接持续增长的市场需求。智谱还表示,GLM-5.3-Flash长期保持同尺寸模型领先的智能水平,同时具备较高性价比。

来源材料未提供单位成本、毛利率或算力投入金额等数据,因此**「2.5倍定价」与「5倍提速」之间的对应关系,只能视为来源方给出的产品定位说明,而非可独立验证的定价公式**。

来源方如何解释这一变化

原文认为,此次提速与提价反映国产大模型竞争逻辑的一次切换:从单纯追求模型能力上限,转向在同等智能水平下比拼推理效率和用户体验。

原文给出的依据是2026年下半年的两组事件:2026年8月26日阿里与智谱同日发布高性价比模型,阿里Qwen3.8-Flash训练成本较前代骤降近90%,推理定价低至每百万Tokens输入0.8元、输出2.7元;智谱GLM-5.3-Flash发布时以匿名模型在OpenRouter平台测试,Token调用量高达62T,登顶并刷新双平台历史纪录。

原文据此判断,算力供给的规模化与国产化,让模型公司得以将更多精力从「抢算力」转向「拼效率」,推理速度、响应体验和单位成本正在取代单纯的参数规模,成为衡量模型商业竞争力的核心标尺。这些均为来源方观点,依据为个别厂商的产品发布与定价数据,未提供行业整体验证。

需要区分的预期与边界

智谱强调,随着FlashX上线,模型收入规模和盈利能力有望进一步提升——这是来源方对未来的预期表述,非已实现数据。

同日港股智谱股价上涨,截至原文发稿时涨幅为5.34%,原文称智谱为「大模型第一股」。股价表现与产品发布同期出现,来源材料未提供二者因果关系的证据。

常见问题

GLM-5.3-FlashX的定价上调幅度是多少?

据来源材料,定价提升至原版本的2.5倍,即相对GLM-5.3-Flash。来源材料未披露具体单价数值,也未说明调价的分档规则。

200 tokens/s的推理速度由谁验证?

该数字为「据智谱介绍」,属来源方自述,来源材料未提供第三方测试或基准对比结果。

10万张国产芯片集群是否已满负荷运行?

智谱称该推理集群上线即被用户用满,此次再次扩大算力规模。这是来源方陈述,来源材料未提供利用率、芯片型号或扩容后规模的具体数据。