今天下午翻知乎热榜,一条新上榜的话题让我停下来把新智元、36氪几家的报道完整扒了一遍。不是因为标题夸张,而是里面的数字实在太具体:10个Claude Sonnet 5.5,连续工作15个小时,互相发送1270条消息,写出17895行Lean代码,最终证明了一道悬置122年的数学物理难题——汤姆逊问题N=7的情形。
先把题目说人话。1904年,发现电子的物理学家J.J.汤姆逊提出一个看似简单的问题:把N个电子扔到一个球面上,它们互相排斥,怎么站位才能让总能量最低?这就是汤姆逊问题。听着像中学几何,实际上过去122年里,人类只严格证明了寥寥几个情形——2、3、4、6、12个点靠对称性解决,5个点拖到2013年才由数学家Richard Schwartz借助计算机证完,8个点是今年9月18日刚被三位数学家挂上arXiv的。而7,一直卡在中间空着。
超级计算机的数值模拟早就跑出了答案:五个电子在赤道、两个在南北极的"五角双锥"构型。但模拟跑一万次也不是证明——只要逻辑上没有绝对闭环,就永远不能排除某个隐蔽角落里藏着能量更低的"幽灵构型"。
这次十个Claude给出的,是一个通过了Lean内核和独立验证内核nanoda双重检验的形式化证明。报道里有个细节特别有说服力:把证明里的一个整数改掉,nanoda立刻报错。也就是说,这份证明不是"看起来对",而是"改一个数字都活不下来"。
为什么是这次,为什么是这种方式
扒完几家报道,我觉得真正的分水岭不在模型变聪明了多少,而在这套打法凑齐了三块拼图。
第一块是多智能体。报道描述得很直白:没有人类介入,没有预设分工,十个Claude自己建群、自己吵架、自己选算法、自己合并代码。"吵架"其实是关键——多个AI互相质疑对方的推导,等价于给证明过程内置了一轮又一轮的同行评审。一个AI容易在自信中犯错,十个AI互相找茬,错误很难蒙混过关。
第二块是形式化语言。Lean是一种数学证明可以被机器逐行检查的编程语言。AI用自然语言写证明,人类得逐句审;AI用Lean写证明,机器直接判对错。这一步把"验证AI"的成本从人天级降到了秒级。
第三块是独立验证器。Lean内核之外还有一个独立的nanoda内核做交叉检查,两套系统互不共享实现,同时被骗过的概率极低。
三块拼在一起,本质是一件事:给AI的产出配上了一个它糊弄不过去的裁判。AI做研究最大的障碍从来不是"想不出",而是"想出来的东西没人敢信"。裁判一到位,信任问题就变成了工程问题。
这套思路,普通人的工作里马上能用
你不用会Lean,也不用养十个Claude,但"给AI配裁判"这个思路可以原样搬进日常工作:
一是让AI产出"可核对"的东西。写方案时别只要结论,要求AI同时给出每个数据的出处清单,你抽查两三条,质量立刻可控。
二是用对抗自查。让AI写完后,换一个角色提示它"你现在是挑毛病的审稿人,找出这份稿子里三个最站不住脚的地方"。同一个模型,换个立场,经常能自己揪出自己的错。
三是拆任务给"小团队"。复杂活儿别指望一次对话搞定,把调研、初稿、审校拆成几轮,每轮只干一件事——这就是十个Claude那套协作的平民版。
我在自己的AI家园 spark1.cn 的 /toolchains 里把这些环节串成了工具链,调研、写作、校对各走各的节点,本质也是同一个道理:与其求一个全能的AI,不如搭一条互相检查的流水线。
数学界的这道百年难题被翻开新的一页,对普通人来说不是"AI要取代谁"的警报,而是一份现成的作业范本——AI的可靠性不靠运气,靠你给它设计的验证机制。学会给自己配裁判,你也能从容地把AI用在真正要紧的事上。
本文素材综合自新智元、36氪、网易科技等公开报道。
💬 评论