深夜十一点,你打开AI,问了一个问题。
0.5秒后,答案出现了。
你没有多想。但就在你按下发送键的那一瞬间,一张物理账单被点亮了——GPU开始满负荷计算,光模块里的激光开始闪烁,数据中心的电表开始跳动,液冷管道里的冷却液开始加速流动。
你问的每一个问题,都是一次真实的物理消耗。
而当14亿人开始提问,这些消耗汇成了一条河。
上周,这条河的流量是69万亿Token。
69万亿Token是什么概念
先看数字。
据同花顺深度研究援引OpenRouter平台数据(2026年8月10日,每日经济新闻报道),上周(8月3日至8月9日),OpenRouter平台AI大模型调用量达到69万亿Token,环比增长21.48%。
拆开看:中国模型贡献了34.25万亿Token,美国模型是9.17万亿。
中国是美国的3.7倍。而且,这已经是连续第十五周领先。
再看单个模型。DeepSeek-V4-Flash正式版7月31日上线,首周调用量冲到8.83万亿Token,一周暴涨570%,直接登顶平台第一。
570%是什么概念?一个模型,七天,调用量翻了将近七倍。
这不是缓慢爬坡,这是洪水过境。
排行榜里的三个信号
把这份榜单再拆细一点,能读出三个信号。
信号一:数量优势在拉大。
上周中国模型调用量环比增长21.76%,前十名里中国模型占了七个。美国模型周调用量9.17万亿Token,绝对值只有中国的四分之一左右,但环比暴增109.36%。同一周,GPT-5.6 Luna降价80%,自身调用量飙升128%——降价和放量,在时间上高度重合。
美国厂商在用价格换市场。这本身就说明:他们急了。
信号二:新版本创造增量。
DeepSeek-V4-Flash正式版首周8.83万亿Token登顶,旧版预览版同期下滑19%至5.88万亿。用户从旧版向新版迁移的速度极快。新版本发布当周,单模型占平台约13%的调用量——这里面有从旧版迁移的存量,不完全代表平台新增,但迁移速度本身就是信号:用户在用脚投票,谁好用就去谁那里。
信号三:集中度在快速提高。
前四名全是中国的:DeepSeek正式版、腾讯Hy3(8.05万亿,+67%)、DeepSeek预览版(5.88万亿)、小米MiMo-V2.5(5.39万亿)。而前一周还排第七的MiniMax M3和排第九的阶跃星辰Step 3.7 Flash,直接跌出了榜单。
存量用户在加速向头部集中。大模型排位赛,正在洗牌。
当然,追赶者不容小觑:GPT-5.6 Luna以4.43万亿Token(+128%)排第五,Gemini 3.6 Flash首次入榜就以2.33万亿Token(+446%)冲到第九。两家美国厂商增速极高。
这场竞赛,远没有结束。
每次AI回答,都是一张物理账单
69万亿Token,散户听起来像个天文数字。把它拆成物理账单,就清楚了。
当你在AI对话框里打一行字、点发送,背后分两步:输入处理和输出生成。
输入阶段,模型一次性"读完"你的问题,GPU效率高、成本低。输出阶段,模型逐字生成回答,每生成一个字就跑一次计算,GPU有效利用率远低于输入阶段。
所以,输出定价通常是输入的2到6倍。
这个过程,就是大模型的"推理"。
硬件消耗上,一条Token的推理要经过四个环节:GPU计算、光模块数据传输、服务器供电、数据中心散热。调用量增长,大致正相关于GPU算力需求、光模块带宽需求和机柜功耗需求——不是精确线性关系(算力调度优化和模型压缩能提升现有硬件利用率),但方向确定。
翻译成一句话:AI调用量每涨一截,芯片、光模块、服务器、电力的采购就跟着涨一截。
这就是为什么华尔街和A股都在盯着调用量数据。它不只是一个互联网指标,它是一张实体经济的订单。
1元和72倍:两条完全不同的路
再看价格。
根据图表引用的官网数据:DeepSeek-V4-Flash,输入每百万Token收费1元、输出2元,缓存命中低至0.02元。而美国厂商Anthropic的旗舰模型,输入10美元、输出50美元。按1美元约7.25元人民币换算,仅输入价格一端,后者约是前者的72倍。
同一项"回答问题"的服务,价格差出两个数量级。
这不是简单的"便宜更好"。背后是两条完全不同的路线:
中国厂商走"低单价+海量调用":把价格打到白菜价,让所有人都用得起,靠规模取胜。腾讯Hy3甚至在限免期内免费调用。
美国厂商走"高单价+深度绑定":Anthropic年支出超百万美元的企业客户超过1000家(据其公开信息)。客户一旦把模型嵌入自己的工作流,切换成本极高。卖的不是Token,是深度绑定。
两条路,谁对谁错,现在下结论还太早。
但对产业链来说,有一个关键洞察:无论1元还是72倍,它们消耗的光模块、服务器、电力,是同样的物理规格。
调用量的绝对值,比"谁赚钱更多"重要得多。
两年降了99%:一条谁都逃不掉的成本曲线
最后看一条更长的曲线。
斯坦福大学《2025人工智能指数报告》援引Epoch AI数据:达到GPT-3.5等效能力的模型,推理成本已经从2022年11月的每百万Token 20美元,降到2024年10月的0.07美元。
两年,降了超过99%。
成本下降,意味着行业规模缩小吗?
恰恰相反。
成本每降一个数量级,能负担得起AI的场景就扩大一个量级。以前只有写代码、写论文才舍得用的模型,现在客服自动回复、电商商品描述、游戏NPC对话都可以跑。
成本下降降低了使用门槛,是调用量增长的重要推动力。
用移动互联网做参照:2010年到2020年,全球移动数据流量增长了数百倍,同期每GB流量成本持续下降。大模型调用量的大致方向与之类似——成本下降与需求扩张同步发生。
这不是AI的冬天,这是AI的普及期。
和普通人的关系
说了这么多宏观数据,落到每个人身上,其实就三句话。
第一,AI正在变成自来水。
两年前,用一次顶级AI像打长途电话,要算计着省钱。今天,1元一百万Token,缓存命中2分钱。价格壁垒正在消失,就像当年流量从几块钱1MB降到不限量。
第二,用得早的人,正在积累复利。
榜单上那些迁移速度极快的用户,就是最早一批把AI嵌入日常工作流的人。他们不是技术专家,他们只是比别人早半年开始用。早半年,就是半年的熟练度差距。
第三,现在是最便宜的时候,也是最好的时候。
不用等AI变得完美。完美是迭代出来的,不是等出来的。你现在开始用,用的每一个月,模型都在变得更强、更便宜。
对普通人来说,这场69万亿Token的洪流里,最大的机会不是去猜哪只股票会涨,而是——先用起来。
AI家园(spark1.cn)上整合了四十多款免费AI工具,从写作、做PPT到读文档、查能力,不需要下载、不需要装环境,打开就能用。先用起来,你才能知道AI能帮你做什么。
时代的红利,从来不等人。但它会奖励那些先伸手的人。
🔧 免费试试AI能力检测,看看现在的大模型能做到什么程度→ https://spark1.cn/ai-capability-check(注册即送100积分,无需下载)
💬 你平时用AI最多的场景是什么?评论区聊聊,也许下一篇就写它。
📮 关注「xAI智工场」,每天一篇AI实操干货,让AI为每一件事服务。
本文数据引自同花顺深度研究(2026-08-11),原始数据来源:OpenRouter平台、每日经济新闻(2026-08-10)、Epoch AI/斯坦福大学《2025人工智能指数报告》、DeepSeek官网、Anthropic官网。本文不构成任何投资建议。
💬 评论