9月中旬的同一周里,OpenAI Codex团队的工程师Tibo和Anthropic Claude Code团队的工程师Thariq Shihipar,在两档播客里说了两句意思完全相反的话。Tibo说:“随着模型进步,系统里的开发者消息会越来越短,Codex的Harness本身也会越来越轻。”Thariq的结论正好倒过来:“模型越强,Harness反而需要越来越复杂,因为你要让模型能够做更多事情。”
恰好这几天知乎上挂着一个问题:2026年下半年了,你认为Codex已经超越Claude Code了吗?我把两边近一周的报道和播客记录整理了一遍,越整理越觉得:这道“超越没超越”的题,从根上就问偏了——两家顶尖团队连“工具该长成什么样”都没达成共识,你拿什么尺子量谁超过了谁?
先认识一下“脚手架”
Harness这个词不好翻,姑且叫它“脚手架”:包在大模型外面的那整套控制系统——提示词、工具调用、上下文管理、行为规则。模型是工人,脚手架决定工人能在多高的楼上干多细的活。
两家吵的就是这脚手架该越搭越厚,还是越拆越薄。Tibo透露,Codex的Harness“通常会比模型领先一点”:模型有潜力但发挥不稳时,先用额外指令给它加“拐杖”;等模型能力追上来,这些临时补丁就会被直接删掉。团队加新功能前先问一句——这个问题该脚手架解决,还是等下一版模型自己解决?Anthropic的逻辑相反:Agent开始承担更长时间、更高自主度的任务,模型越强,能做的事越多,需要的支撑系统反而越复杂。
这不是口水仗,是两条产品哲学。而哲学分歧,跑分表量不出来。
跑分为什么回答不了“谁更强”
两个现实原因。
第一,强项根本不重叠。掘金9月11日发过一篇实测横评,把GitHub Copilot、Cursor、Claude Code拉进同一批测试活儿里跑:写用例骨架、补断言和边界、读懂陌生仓库、生成mock与测试数据、修flaky用例——五个环节里三款工具各占几格,强项几乎不重叠。作者的结论很直白:硬要排个“谁最强”,反而会选错。(顺带一提,那篇文章引用的统计口径称约九成开发者已离不开Agent类工具,其中Claude Code以39%的使用率居首——单一来源,当趋势看就好。)
第二,尺子本身会被悄悄改。9月上旬Claude Code闹了一场“暗中降智”风波:开发者argofowl翻更新日志发现,自2.1.237版本起,用户手动设定的“high”推理强度被悄悄映射到原本对应“low”档位的数值10,且这个变更没写进任何版本说明。工程团队回应说这只是后端API的临时配置实验,用户感知不到差异;但博主Chubby随后实测指出Opus5模型多项任务性能回落,相关负责人承认存在阶段性波动,把修复排进了最高优先级。
你看,你上个月用的和你今天用的,可能都不是同一个工具。谈“超越”的前提是尺子稳定,而这行的尺子随时在变。
答案藏在你的用法里
再看两家这个月各自在忙什么,路线分歧就更清楚了。据36氪、凤凰网9月12日报道,OpenAI一天发布Agents API、GPT-Live-1 API、Data agent、ChatGPT for Financial Services四张牌,把Codex背后那套让Agent持续工作、调用工具、管理上下文的能力抽出来打包成云端API——报道的标题起得很传神:“OpenAI把Codex拆开卖了”。从2025年4月开源CLI,到一个月后云端版上线,再到10月的SDK,Codex一路被拆成零件,目标是当所有开发者的水电煤。
Claude Code那边走的是另一条路。网易、腾讯9月9日的报道里,Anthropic联合创始人Ben Mann介绍:Claude Code出自一支约20人的Labs实验团队,项目成功率只有20%—30%,产品发布约半年后年化收入到了10亿美元级别。把一件事做深、做成单品爆款,是Anthropic的打法。
所以普通人的选择题不是“A还是B谁更强”,而是“我的活该派给谁”。抄作业的方法:把你日常要交给AI的工作拆成几个环节,像那篇横评一样,每个环节拿一两个工具试跑一次,谁在这段活上顺手就派给谁。另外记住版本黑箱的教训——大版本更新后,先拿一个你熟悉的老任务跑一遍,确认质量没掉再深度依赖;重要工作手上永远留一条备用路径。
工具会一直换,榜单会一直变,但你按自己的用法挑出来的那把“拐杖”,才是真正让你从容的东西。顺手的小工具,我在 spark1.cn 的 /tools/ 和 /toolchains 里也整理了一些,可以慢慢挑。
本文素材综合自腾讯新闻、36氪、凤凰网科技、网易科技、掘金、PHP中文网等公开报道与播客内容。
💬 评论