2018年,学术期刊《自然》公布年度"影响世界的十大科学人物",一位95后中国小伙排在第一位:曹原。他发现两层石墨烯以约1.1°的"魔角"堆叠能产生超导效应,一口气在《自然》连发两篇论文,学界称之为"魔角石墨烯"(来源:南方plus)。
八年过去,这位前谷歌DeepMind科学家,如今是AI for Science创业公司Unreasonable Labs的联合创始人。而他最新的判断冲上了知乎热榜:AI4S最难的是"验证"——不是让AI提出想法,而是证明AI提出的想法是对的。
AI生成得越快,人越尴尬
曹原的判断不是孤例。今年8月,谷歌的Jeff Dean宣布离职,带着一批高管创立Discovery Loop公司,同样做AI for Science;OpenAI宣布其模型Astra推导出了10道人类长期悬而未决的数学难题;Anthropic未发布的科研版Claude,把黎曼猜想的相关零点下界从41.6%推进到67.2%(来源:硅谷101、36氪)。
AI已经在推进科学前沿。但同一场访谈里也不回避一个尴尬:AI自进化、形成研发闭环的同时,"人的角色,稍显尴尬"。
尴尬在哪?中国工程院院士李国杰给过一组数据:新材料领域,AI筛选出数十万种稳定候选材料,最终实验验证的匹配率仅0.19%(来源:腾讯新闻)。
也就是说,AI能以指数级速度批量生产"看似合理"的假说,而人类的实验验证能力只能线性增长——一边是高铁,一边是慢车道,剪刀差越拉越大。更麻烦的是,李国杰指出:AI幻觉常常被误判为重大科学发现。
为什么验证比生成难?
生成假说,对AI是"开卷考试":它几乎读过全世界的论文,把已有的概念拼成新组合,看起来都像那么回事。验证却是"闭卷考试":每一个结论都要经得起实验、数据和同行评议,任何一环站不住脚,前面全部作废。
九章云极首席科学家缪旭把这叫做"信任赤字":大模型天生是概率性的,"漏掉前提、偷换定义、长推理积累微小错误",在严肃的理论验证面前就像黑箱(来源:天极网)。
国家超算互联网最近的大会上,专家把科研范式的转变说得更直白:从"人类试错"转向"AI预测+验证+人类判断"——AI4S真正的瓶颈不是生成,而是验证(来源:腾讯新闻)。这也是为什么Jeff Dean、曹原这批顶尖科学家纷纷在此刻下场:谁能把"验证"这一环补上,谁就握住了AI做科学的下一个入口。
这个瓶颈,其实是你我的日常
你可能觉得:我又不是科学家,AI4S跟我有什么关系?
其实"验证瓶颈"是每一个用AI的普通人每天都在撞上的事。AI三秒写出一份方案,你不确定里面的数据是不是真的;AI一本正经地回答健康问题,那可能是它当场编的。当AI变得人人都会"生成",稀缺的能力就从"提问"变成了"验证"。
我从这几篇报道和访谈里整理出一段"反向验证提示词",AI给你答案之后,别急着采纳,把这段话丢回去:
这个结论依据了哪些具体信源?请逐条列出。上面的内容里,哪些是已验证的事实,哪些是你的推测?请分开标注。现在请你站在质疑者的立场,指出这份回答里至少两个漏洞。
最后一句最管用:AI特别擅长挑毛病,让它"攻击"自己的答案,不少幻觉会当场现形。遇到签合同、看病、投资这类要紧事,再把同一个问题丢给另外一两个AI,交叉对照答案。spark1.cn/tools 聚合了主流AI工具,多个模型一起做交叉验证,比只听一家之言靠谱得多。
写在最后
AI能证明数学题了,科学家没有失业,反而是"验证"成了最稀缺的能力。对普通人也一样:AI负责生成,你负责验证——先用好验证的人,才是真正会用AI的人。
💬 评论