62.7分,还是99.9分——同一个模型,哪个才是真实成绩?
这不是脑筋急转弯,是GPT-6 Astra的真实遭遇。在ARC Prize官方的标准测试框架下,Astra考出62.7%,已是历史最高;可当OpenAI接入自家的Provider Adapter之后,同一套权重、同一组题目,得分直接飙到99.9%。中间差出的36个百分点,把整个AI评测圈问懵了。
知乎热榜这两天挂着一个问题:「如何看待GPT-6-Astra刷新信息学竞赛题复杂度记录?」「信息学竞赛记录」这个说法本身我没找到官方出处,但顺着往下查,我把新智元、量子位、36氪、中财网近两周的报道翻出来对了一遍——底下埋着一个比记录本身更有意思的事实:AI已经把考卷刷爆,出题人被迫重新出题了。
问题一:考卷到底被刷成了什么样?
先看两条硬数据。
9月3日OpenAI发布GPT-6 Astra后,它在ARC-AGI-3半私有测试集上拿下99.9%,并在96%的关卡中达到或超过人类的行动效率基准。OpenAI自己的用词是:已经完全「饱和」。
数学侧也一样。研究级测试FrontierMath的Tier 4,2025年7月11日刚推出时,榜单最高成绩只有大约5%;一年零两个月后,最后一道没被AI攻破的难题被Astra解掉,Epoch AI正式宣布Tier 4饱和。出题人之一、马凯特大学数学副教授Jay Pantone坦言:以往AI总爱找数值捷径,这一次,AI的解法和他本人的思路相当接近。
考卷刷到这个份上,出题人只能掀桌子重来。ARC Prize创始人François Chollet已披露下一代蓝图:ARC-AGI-4明年一季度登场,考持续学习;ARC-AGI-5完全围绕「发明」展开,被称作「人类最后考卷」。
问题二:为什么同一个模型能差出36分?
这是我觉得最该被普通人看懂的一层。
那36分的差距,来自一个叫harness的东西——测试脚手架。OpenAI的Provider Adapter能在多次调用之间保留模型的隐藏推理状态,让AI以更接近生产环境的方式干活。换句话说:考的已经不只是模型本身,而是「模型+怎么用模型」这个组合。
这不是孤例。Claude Opus同一套权重,在私有集上验证是30%,换上更好的harness后达到95.5%;英伟达的AVO甚至在公开演示集上拿到100%。于是争论的焦点,从「哪家模型更聪明」变成了「哪个考场更公平」。
这意味着什么?**跑分正在变成一种可以工程化的东西。**你以后看到任何「XX模型登顶第一」的新闻,第一反应不该是膜拜,而是问一句:在谁的考场、用什么姿势考的?
问题三:考卷失灵后,普通人怎么选AI工具?
我的答案是:自己出题。
别拿别人的考卷选自己的工具。把你每周最常干的三件活——写周报也好、整理资料也好、回客户消息也好——原封不动丢给候选工具跑一遍,看结果、看耗时、看你要返工多少。这是唯一对你公平的harness。
顺便说两个容易被忽略的参考维度。一是领域:前OpenAI研究副总裁Liam Fedus新创的Periodic Labs,用约1T参数的模型Neon、1300张H200,在X射线衍射分析这个硬核基准上以55.3%的成功率超过了Astra——专业数据喂养的小模型,能在自己的地盘赢过通用巨人。你的行业里,「懂行的小工具」可能比大牌更顶用。二是成本:中财网援引的数据显示,Astra单任务成本约0.82到3.26美元;而虎嗅一位作者实测,20美元/月的订阅,光做选题调研就把5小时用量额度跑见底了。能力再强,额度不够用也是白搭。
写在最后
Chollet有句话我记下了:「当AI的学习效率与人类再无客观测量差距时,那便是真正的AGI时刻。」考卷会一张张被刷爆,这个趋势谁也拦不住。但你的工作没有标准答案,也就不存在被刷爆一说。
会给自己出题的人,选工具时反而最从容。我把一批常用的AI写作工具收在 spark1.cn/ai-writer,下次别急着看跑分——带上你自己的真实任务,去试一圈再说。
💬 评论