如果有人突然问你:GPT-6强,还是Meta的Muse Spark 1.3强?我建议你先别答,先看看手里的"成绩单"是哪天印的。今天知乎热榜上挂着这么一个问题:如何评价AA推出V4.2评分标准,GPT-6分数超过Muse Spark 1.3?我把新浪财经、凤凰网、虎嗅、中华网这一周涉及这个榜单的报道全部搜出来,逐篇对了一遍两家模型的前后两轮分数。越对越觉得,这不是"谁反超谁"的故事,是"尺子被换了"的故事。
先把两轮分数摆在一起
9月2日,Meta发布Muse Spark 1.3——五个月里的第四次迭代。据新浪财经报道,独立评测机构Artificial Analysis(就是知乎问题里说的"AA")给公开档1.3(xhigh)的智能指数打出61分,与GPT-5.6 Sol(max)、Grok 4.6(high)并列;面向合作伙伴的max档得62分,仅次于Claude Fable 5.1和Claude Opus 5。
五天后,榜变了。虎嗅梳理称,截至9月7日,Artificial Analysis最新综合榜单中,OpenAI的GPT-6 Astra与Claude Fable 5.1以53分并列第一。
注意这个细节:前一轮"第二梯队"是61分、62分,新一轮"第一梯队"却只有53分。不是模型集体变笨了,是刻度变了——这就是知乎问题里那个V4.2评分标准。像货币改面值,数字缩水,购买力没缩水。
为什么要换尺子?因为旧尺子被用坏了
旧的综合分正在失真。拿ARC-AGI-3这项测试来说,中华网援引公开报告:今年3月到8月,整个行业在这项基准上的得分从不到1%一路升到100%;GPT-6 Astra被广泛引用的99.9%,是在OpenAI定制测试框架下取得的,换标准框架只有62.7%。一场考试半年内从个位数飙到接近满分,它考的就不再是"模型多聪明",而是"测试工具写得多好"。
考题被刷穿,尺子自然要换。但对普通人来说,真正的问题是:榜单变得比手机换代还快,到底该信谁?
我的答案:综合分当汇率看,选型当记账过
综合分只值得"看一眼"。真要挑一个干活顺手的AI,我现在只翻两本账。
第一本:分项分。AA自己就把模型在智能体任务、科学推理等维度拆开了列。凤凰网报道里,Muse Spark 1.3(xhigh)在银行场景测试Tau3-Bench Banking得47%,max档以52%登顶;科学推理CritPt从前代的18%升到26%。这些数字远不如"综合分61"吸睛,但它们对应的是一件件具体的活。你的活是哪件,就看哪一项。
第二本:单任务成本。按AA的测算,Muse Spark 1.3(xhigh)在59分以上的模型里单任务成本最低,约0.55美元,同档对手约0.94至0.95美元;另一头,GPT-6 Astra虽然登顶,API定价却是每百万token输入10美元、输出50美元,是上一代GPT-5.6 Sol的2.5倍。同样是"第一梯队",一个走省钱路线,一个走烧钱路线——哪个适合你,取决于你拿它干什么、一天干多少次。
所以这次排名重排的另一层意思是:不是GPT-6"变强了"、Muse Spark"变弱了",而是尺子从"谁考得高"往"谁在新规则下干得了更多活"挪了一格。对真拿AI干活的人来说,这是好事。
下次刷到"登顶"截图,先做两个动作
一是核对评测版本号和日期——同一个模型,在V4.1和V4.2下可能是两个分数,跨版本的"反超"没有意义。二是跳过综合分,直接翻分项分和单任务价格,对照你自己的场景。
想自己上手验证的话,spark1.cn 的工具区(/tools/)按场景整理了常用AI工具,挑两个候选,喂同一个你真实要做的任务,比比谁交付的结果你更满意、花的钱更少。这份"体感榜",永远比任何机构的综合榜更合你的脚。
💬 评论