9月18日,智谱上线了一个新模型 GLM-5.3-FlashX。周末我把官方公告和IT之家、证券时报的报道翻了一遍,对着那张定价表看了很久——这可能是近期大模型圈最"明码标价"的一次动作:速度提升5倍,定价同步提到原来的2.5倍。
不藏、不绕,直接把"快"做成了一个单独的商品。
一张定价表,三层生意
把智谱这次的价目表摆出来(数据来自IT之家整理的官方定价,单位:元/百万Tokens):
| 模型 | 输入 | 输出 | 缓存命中 |
|---|---|---|---|
| GLM-5.3 | 8 | 28 | 2 |
| GLM-5.3-Flash | 0.8 | 2.8 | 0.23 |
| GLM-5.3-FlashX | 2 | 7 | 0.57 |
三个模型上下文都是1M,Flash和FlashX都支持图片、视频、文件输入,缓存存储限时免费。
看出门道了吗?FlashX不是"新版本",智谱没有用它替换掉Flash,而是让两个模型并排卖。同一个智能水平,快的贵2.5倍,慢的保持原价。
这像什么?像机场的头等舱通道,像高铁的一等座——运输的"内容"没变,变的是你不用等。
过去两年大模型行业的主旋律是降价,你降我也降,恨不得免费。智谱这次反过来操作,透露了一个信号:当模型能力趋于稳定,竞争开始从"谁更便宜"转向"谁更能分层收费"。便宜有便宜的卖法,快有快的卖法,各赚各的钱。
速度从哪来的:不是堆芯片,是改流水线
更有意思的是这5倍速度的来源。
智谱披露,处理GLM-5.3-Flash的全部线上调用,投入了10万张国产芯片。这次提速,靠的不是再买10万张,而是把推理架构改成了"EPD分离式"——把多模态编码、prompt预填充、逐token解码三个环节拆开,各自独立调度、独立扩缩容。官方说法是端到端服务性能较初始基线提升3倍,硬件效率和单token成本达到与主流英伟达GPU相当的水平。
打个比方:原来是一条流水线从头包到尾,某道工序堵了全线停;现在拆成三个专业车间,哪个车间忙就单独给它加人手。
顺带一提,这个GLM-5.3-Flash系列来头不小——发布前曾以匿名模型"Ox Alpha"的身份接受全球开发者盲测,上线后登顶过OpenRouter平台使用量排行榜第一。先匿名考试、再公布身份,这套打法本身也值得琢磨,但不是今天的主角。
你该用哪个?一条判断规则就够
如果你平时会调用API,或者在用基于这些模型的产品,选择逻辑其实很简单:
看你的场景是"对话"还是"任务"。
- 对话式、实时式场景——聊天、写代码时的即时补全、直播字幕、客服机器人——用户坐在屏幕前等,每一秒卡顿都是体验流失,这种场景FlashX的200 tokens/s(官方标称最高值)物有所值;
- 批处理、离线式场景——夜里跑数据清洗、批量生成摘要、定时任务——没人盯着屏幕,慢一点完全无所谓,Flash的0.8元输入单价能帮你把成本压到最低。
一句话:为"等待"付费还是为"结果"付费,先想清楚你的用户在不在屏幕前。
如果你暂时不碰API,只想直接用现成的AI工具,也可以先试试 spark1.cn 的 /tools/ 页面,里面收录了一批开箱即用的AI工具,不用关心底层是哪个模型、多少tokens——等哪天你要自己做产品了,再回头看这张定价表也不迟。
💬 评论