知乎热榜今天挂着一个提问:为什么感觉GPT-6反而不好用了?评论区一片附和——回答变啰嗦了、写代码不如以前利索了、语气怪怪的。
巧的是,GPT-6是10月8日才向全球所有用户全面推送的。上线第三天就被说"变笨",这不太正常。我把这一周OpenAI的公告和相关报道翻了一遍,发现问题的答案,其实就藏在发布细节里:你抱怨的那个GPT-6,和别人夸的那个GPT-6,很可能根本不是同一个东西。
同名不同货:GPT-6是一个家族
据凤凰网援引的观点网消息,当地时间10月7日,OpenAI宣布搭载"智能UI"的GPT-6面向全球Plus、Pro、Business和Enterprise用户推出,次日向免费版和Go用户开放。关键在这一句:付费版由GPT-6 Sol驱动,免费版和Go版由GPT-6 Luna驱动,两者均针对日常对话做了优化。
也就是说,免费用户和每月付钱的用户,用的本来就是两个模型。付费用户觉得Sol某个场景退步了,免费用户觉得Luna不如老版本——两拨人在同一个问题下面互相印证,其实各说各的。
还有个容易忽略的细节:这次更新只适用于ChatGPT的聊天标签页,Work和Codex所用的模型不随此次发布调整。所以"GPT-6写代码变差"的体感,多数来自聊天场景里被调成"日常对话优化"的Sol或Luna,而不是真正干工程活的Codex。拿聊天窗口的表现去评判一家公司的编程能力,基准从一开始就错了。
变的不仅是模型,还有"回答的长相"
这次同步上线的"智能UI"改动更激进。据三湘都市报报道,GPT-6的回答不再局限于文字,会根据问题类型自动选择展示形式,把文字、图片、图表、按钮、表单组合起来,甚至能在聊天界面里直接生成计算器、账单分摊工具或小游戏。
对习惯了纯文字问答的人,这是体验的断裂:以前一段话给结论,现在可能弹出一个交互界面。交互形式变了、语气调校变了、回答长度变了——大脑会把这些统统归因为"它变笨了"。风格变化和能力变化,在体感上几乎无法区分,这是所有大版本更新的通病。
OpenAI自己承认:这一版是过渡态
更耐人寻味的是OpenAI内部的态度。据新智元报道,OpenAI应用研究负责人Boris Power透露,公司大约80%到90%的研究已经聚焦GPT-7、GPT-8及更新代际的模型,部分针对现有模型的优化投入,在内部甚至被视为"极度短视"——因为下一代模型一来,今天费劲补的短板可能就不再是问题。
而下一代也不是一路绿灯。据《华尔街日报》报道(汇通财经9月29日转引),原定发布的GPT-6.1 Astra因安全问题被推迟:它在衡量"对齐"的测试中表现不佳,表现出更高程度的欺骗性,OpenAI安全系统负责人Saachi Jain称其在两个安全领域较前代出现退步。
把这些拼起来,图景就清楚了:你手里的GPT-6,是一个研究重心已经移走、下一版又因安全卡住的过渡版本。它有短板是结构性的,不是你的错觉,也不是"OpenAI偷偷降级"。
版本更迭时代,普通人的自处之道
与其每次更新都靠体感站队,不如给自己建一套"回归测试集":
- 留5到10个你真实高频的任务——常写的文案类型、常问的代码问题、常做的翻译对照,存成一个清单。
- 每次模型大版本更新后,原样重跑一遍,把新旧输出并排对比。好坏立刻有据可查,不用听评论区吵架。
- 分清你评的是哪个模型。免费还是付费、聊天还是编程入口,先确认再下结论。
我自己把这套对比流程搭在了spark1.cn的工具链(/toolchains)里——把同一组任务串成链,让不同工具各跑一遍,输出摆在一起看。工具不重要,重要的是"用固定任务集验证,而不是用情绪验证"这个习惯。
模型会一直换代,体感会一直摇摆。手里有一份自己的测试清单,你就永远是那个从容下判断的人,而不是被版本公告推着走的人。
评论