500万亿。这不是哪个国家的年度预算,而是今天中国每天消耗的推理Token数量——你每一次和AI聊天、让AI写周报、用AI修图,都在往这个数字里添砖加瓦。
9月17日,华为全联接大会2026在上海开幕,轮值董事长汪涛在主题演讲里报出了这个数字。当天我把证券时报、每经、第一财经、飞象网几家的报道凑齐读了一遍,把他演讲里的数字逐个整理下来,发现这场发布会真正讲的事,和"新芯片发布"的标题根本不是一回事。
先看纸面数字
昇腾960芯片研发进度超预期,性能翻番。其中960DT定档2027年一季度就绪——按华为去年公布的路线图,它原本要到2027年四季度才上市,等于提前了三个季度;960PR则定在2027年三季度,提前一个季度。后面还有昇腾970(2028年)、980(2029年),一年一代。
基于960芯片的Atlas 960超节点,是全球首款搭载NPO(近封装光学)技术的超节点:单个超节点4096卡规模,最大可提供8E FP8算力、1PB的HBM容量,能支撑10万亿参数级大模型的训练与推理。液冷版2027年三季度上市,风冷版提前到二季度。
而现役产品这边:昇腾910C超节点已部署超1000套、服务370多家客户,昇腾950超节点已进入规模商用。
为什么不拼单卡,偏要"把4096张卡焊成一台机器"
这是整场发布会最值得琢磨的地方。汪涛给了一组很实在的数据:训练十万亿级顶尖模型,10万卡集群已是标配,但传统8卡服务器组成的集群里,节点之间的通信要吃掉超过40%的训练时间——换句话说,卡有一半时间在"忙着互相传话",而不是算题。
华为马尔科夫实验室的仿真结果是:用4096卡的超节点搭10万卡集群,相比8卡服务器搭同样规模,MFU(模型浮点算力利用率)提升2.75倍。
打个比方:这就像划龙舟。8卡服务器是8条小龙舟各划各的,船与船之间还得不停喊话对齐;超节点是把4096个人装上同一条大船,跟着同一面鼓点划。单个人的力气没变,整体速度却完全不是一个量级。拼的从来不是蛮力,是组织效率。
这也解释了华为的路线为什么是"超节点+集群"加硬件变现,而不是喊"做出全球最强单卡"——单卡的制程受限,那就换到系统架构这个自己能做主的维度上竞争。
对普通人意味着什么
算力竞争是巨头的事,但算力的红利会落到每个人头上。汪涛演讲里的几个数字连起来看就明白了:中国每日推理Token已达约500万亿,2030年预计奔向百万万亿级;手机里的模型从2024年的3B长到今天的30B,还要走向100B级;智能体现在能按小时连续干活,2030年要按"月"接任务。
这些数字暴涨的另一面,是AI服务会越来越稳、越来越便宜——就像你不需要懂电网调度,也照样能随手开灯。1000多套超节点部署、CANN软件生态里外部开发者占比已达61%,说明这套"电网"不是PPT,是真在通电的。
你现在能做的两件事
一是选AI工具时,把"能不能长期稳定地跑"放在"新不新奇"前面——底座进入规模商用期的工具,才不会用两天就消失。我把平时筛过、按使用场景分好类的AI工具都放在 spark1.cn/tools/ 里,可以直接翻。
二是每天真的用AI干一件小事:写一封难开口的消息、整理一份乱糟糟的表格、把一个想法掰开问透。电网修得再大,灯还是要你自己按开关。
真正的从容,不是追上每一场发布会,而是这些轰隆隆的基础设施,最终都变成你手边随开随用的水电。
本文素材综合自证券时报、每日经济新闻、第一财经、飞象网等公开报道。
💬 评论