AI到底能便宜到什么程度?
8月26日晚上,阿里给出了一个新答案:每百万Tokens,输入1元,输出3元。(来源:新京报、新浪科技)
这是阿里发布并同步开源的新模型Qwen3.8-Flash的API定价。为了搞懂这件事,我把新京报、新浪科技、IT之家、凤凰网科技、网易科技的报道挨个翻了一遍,发现比价格更值得咂摸的,是这个价格背后的两个数字。
第一个数字:60亿
Qwen3.8-Flash的总参数是1250亿(125B),但每次计算只激活约60亿(6B)。(来源:IT之家、凤凰网科技)
有篇分析用了个很贴切的说法:125B的身体,6B的饭量。(来源:腾讯新闻)
传统的稠密模型是全员上班,算一次要过一遍全部参数;MoE(混合专家)架构相当于养了一个专家团,每次只喊相关的几位出来干活,账单按出勤算。总参数量决定模型"见过多少世面",激活参数量决定"算一次花多少钱"。(来源:腾讯新闻)
所以这次降价和过去两年的模型价格战不是一回事。以前不少低价是补贴战——先烧钱抢用户,账以后再说;这次的价格是架构层面算出来的,不是靠补贴硬撑。(来源:腾讯新闻)训练端也一样:官方称训练成本较上一代Qwen3.7-Plus骤降近90%,只用约九分之一的资源就完成了训练。(来源:新京报)
顺带一提,同一晚智谱也发布了匿名登顶海外平台的GLM-5.3-Flash并开源,官方称线上流量全部由国产芯片承载。(来源:第一财经、凤凰网)八月底的国产开源阵营,节奏快得让人喘不过气。
第二个数字:3%
性能上,官方称Qwen3.8-Flash超越Claude Opus 4.6、接近Opus 4.8;而价格,约为Opus 4.6的3%,最低是DeepSeek-V4-Flash价格的1/3。(来源:和讯网、新京报)
智能单价崩到这个位置,改变的不是"同样的用法便宜点",而是用法本身。
Tokens贵的时候,大家是"省着问":重要问题才舍得扔给AI,长文档先心疼费用。现在这个模型原生上下文262K,用YaRN可以扩展到1M,官方称在高缓存命中的长上下文场景可提速8倍以上。(来源:腾讯新闻、新京报)
这意味着一批以前"不划算"的用法,现在算得过账了:整本合同扔进去逐条审,一整年的会议纪要扔进去提炼结论,重复性的批量任务让它一轮一轮跑。过去卡住这些场景的,不是AI的能力,是账单。
还有个容易被忽略的落地入口:这个模型已首发上线"千问办公",标准模式内置,官方称可完成95%的日常办公任务。(来源:网易科技)对不碰API、不懂参数的人来说,就是打开即用。
现在就能做的两件事
第一,给任务分层。 日常产出(周报、摘要、初稿、翻译)交给便宜的快速模型,管够就行;关键交付(客户方案、对外文稿)再切强模型精修。今早我刚写过Fable 5的企业账单——7万家公司用真金白银验证了"多数任务够用就行",今晚这个价格,把"够用"的成本又砸下去一截。
第二,找一个长文档任务实测。 把一件你一直想扔给AI、又嫌"太长太贵"的事,这周真扔进去跑一遍,看看账单到底花多少。我平时在 spark1.cn/tools/ 归拢常用AI工具入口,打开即用,方便你几个模型横着比。
💬 评论