速度快5倍、价格贵2.5倍:智谱开始单卖"时间"了

速度快5倍、价格贵2.5倍:智谱开始单卖"时间"了

· ⏱ 3 分钟阅读 ✍️ spark1 👁 6 次阅读
🎧 听全文
点击播放,AI语音朗读全文
1.0x
标签 AI GLM-5.3-FlashX 智谱 大模型定价

9月18日,智谱上线了一个新模型 GLM-5.3-FlashX。周末我把官方公告和IT之家、证券时报的报道翻了一遍,对着那张定价表看了很久——这可能是近期大模型圈最"明码标价"的一次动作:速度提升5倍,定价同步提到原来的2.5倍。

不藏、不绕,直接把"快"做成了一个单独的商品。

一张定价表,三层生意

把智谱这次的价目表摆出来(数据来自IT之家整理的官方定价,单位:元/百万Tokens):

模型 输入 输出 缓存命中
GLM-5.3 8 28 2
GLM-5.3-Flash 0.8 2.8 0.23
GLM-5.3-FlashX 2 7 0.57

三个模型上下文都是1M,Flash和FlashX都支持图片、视频、文件输入,缓存存储限时免费。

看出门道了吗?FlashX不是"新版本",智谱没有用它替换掉Flash,而是让两个模型并排卖。同一个智能水平,快的贵2.5倍,慢的保持原价。

这像什么?像机场的头等舱通道,像高铁的一等座——运输的"内容"没变,变的是你不用等。

过去两年大模型行业的主旋律是降价,你降我也降,恨不得免费。智谱这次反过来操作,透露了一个信号:当模型能力趋于稳定,竞争开始从"谁更便宜"转向"谁更能分层收费"。便宜有便宜的卖法,快有快的卖法,各赚各的钱。

速度从哪来的:不是堆芯片,是改流水线

更有意思的是这5倍速度的来源。

智谱披露,处理GLM-5.3-Flash的全部线上调用,投入了10万张国产芯片。这次提速,靠的不是再买10万张,而是把推理架构改成了"EPD分离式"——把多模态编码、prompt预填充、逐token解码三个环节拆开,各自独立调度、独立扩缩容。官方说法是端到端服务性能较初始基线提升3倍,硬件效率和单token成本达到与主流英伟达GPU相当的水平。

打个比方:原来是一条流水线从头包到尾,某道工序堵了全线停;现在拆成三个专业车间,哪个车间忙就单独给它加人手。

顺带一提,这个GLM-5.3-Flash系列来头不小——发布前曾以匿名模型"Ox Alpha"的身份接受全球开发者盲测,上线后登顶过OpenRouter平台使用量排行榜第一。先匿名考试、再公布身份,这套打法本身也值得琢磨,但不是今天的主角。

你该用哪个?一条判断规则就够

如果你平时会调用API,或者在用基于这些模型的产品,选择逻辑其实很简单:

看你的场景是"对话"还是"任务"。

一句话:为"等待"付费还是为"结果"付费,先想清楚你的用户在不在屏幕前。

如果你暂时不碰API,只想直接用现成的AI工具,也可以先试试 spark1.cn 的 /tools/ 页面,里面收录了一批开箱即用的AI工具,不用关心底层是哪个模型、多少tokens——等哪天你要自己做产品了,再回头看这张定价表也不迟。

📄 版权声明:本文由 AI家园 团队创作。欢迎非商业性转载或引用,转载时须注明原文出处并保留原文链接;商业使用请事先联系授权。

本文链接:https://spark1.cn/articles/20260920-glm-flashx-speed-tiered-pricing · 转载规则详见《服务条款》

🎁 喜欢这篇文章?获取更多干货

关注公众号「xAI智工场」

关注公众号「xAI智工场」

每天一个AI干货
回复「提示词」免费领实战模板包

💬

加入AI交流群

微信号:xaizgc
和AI爱好者一起成长

⭐ 深度精选

知识星球·深度圈

系统课程 · 社群答疑 · 资源库
¥99/年

立即加入 →
分享到

💡 想用 AI 马上搞定这件事?

查看全部 AI 工具 →

💬 评论

加载中...

转载或引用本站内容请注明原文出处及链接 · 转载规则

Copyright © 2026 AI家园 浙ICP备2024142181号-2 浙公网安备 33010202005420号