华潮新闻网
科技

OpenAI10道数学难题新解公布 Astra24小时内复现5道

来源:华潮新闻网
OpenAI10道数学难题新解公布 Astra24小时内复现5道

新智元报道

10项数学难题,24小时反转。

这个周末,OpenAI与Anthropic两大AI巨头在数学最前沿狭路相逢。

8月1日,OpenAI研究员Sébastien Bubeck公开宣称,其未发布的下一代主力模型Astra一举证明了10项前沿数学成果,并同步放出10份Lean证书及逐题思路复盘。

这10个问题绝非泛泛之谈。

其主要结论至少十年无人推动,不少搁置数十年,实打实的开放难题。

虽非数学界最深奥的未解之谜,但个个都是难啃的硬骨头。

Epoch AI旗下FrontierMath负责人Elliot Glazer直言:单是「非索菲克群」这一篇,就足以入选数学界公认的顶级期刊Annals of Mathematics。

这10道难题抛出,AI圈瞬间沸腾,有人当场高呼「数学奇点已至」。

Anthropic反应迅速,立刻接招。

不到24小时,研究员Levent Alpöge在Bubeck帖子下留言:「我用Fable完成了一半。」

随后他补充说明,自己解决的是OpenAI榜单上的第4、5、6、7、8项,共计5项。

实验环境方面,Levent强调条件纯净:完全自主运行、通用提示词、全程断网。为防止OpenAI解法泄露进上下文,他还特意增设防护层。

目前,Levent尚未上传Fable的完整证明细节,但他表示会后续公布。

若此结果获证实,事件性质便发生转变:

OpenAI凭借未发布模型Astra抢得的首发先机,保鲜期仅余24小时。而紧追不舍的Fable,是Anthropic早已公开、公众均可调用的模型。

一项「数学首发」

保质期仅剩24小时

网友Chubby转帖称:「公开可用的Fable,复现了Astra一半成果。」

评论区有人调侃:这么看来,OpenAI莫非只抢了个首发?

过往,一项数学成果的优先权之争,往往以年计。

谁先构思、谁先证出、谁先发表,其间隔着漫长的投稿、审稿与修改周期。

如今,Astra尚未正式发布,其公布的成果仅在24小时内,便被一个公开模型追平半数。

首发的含金量依旧,但保质期大幅缩水。

不少网友已高喊「数学奇点」,两家AI巨头也咬得死紧。

2000美元背后

还有更贵的账

OpenAI还抛出一个数字:找到这10项解法,成本不足2000美元。

据研究员Noam Brown解释,该数据对应寻找这些解法所需的token量,并按Sol API价格折算得出。

换言之,这仅是成功跑出10个解法那一刻的边际推理成本。

此外,还包括Astra本身的训练研发费用、那些试错未果的问题成本、人类将论证整理成249页论文的工时、每个证明形式化为Lean的成本,以及最终外部数学家审查的费用。

Noam自己也承认,团队曾尝试其他重大问题,但未成功,千禧年大奖难题无一拿下。

即便如此,2000美元仍将AI解出一道前沿难题的边际成本压至地板价。

有人甚至调侃,OpenAI明天是否会再公布10项数学突破,或下周一次性发布100项。

从「互相刷榜」到「互相验货」

Fable去重做Astra同一批题目,此事比普通刷榜有趣得多。

刷榜测试的是已知答案:题目与标准答案皆已摆好,比拼的是分数高低。

而在无网络、防泄漏条件下,两个模型各自独立抵达同一前沿结论,测试的则是完全不同的维度:结果是否可靠,能否被独立复现。

这更像同行评审。

Levent目前仅在X上「作出声明」,并未放出那5项证明的PDF、提示词、完整运行日志、token成本或Lean证书。

网友Haider质疑:即便属实,为何要用Fable复现Astra,而非直接拿它去解新的开放问题?

事实上,Fable并非只会蹭Astra热度,它也具备解题能力。

7月,Levent曾用Fable给出Jacobian猜想的三维反例,事后有人专门撰写了一份7页的代数验证材料,确认该显式映射确实推翻了三维及更高维的猜想。

绝大多数人看不懂的成果

谁来验收

这10项成果究竟有多重要,绝大多数人难以判断。

Ethan Mollick一语道破:对地球上几乎所有人而言,这不仅超出能力范围,更超出理解范畴。我们只能相信专业数学家告知我们其分量。

代码、图片、聊天,普通人尚能亲手体验AI强项所在。

但非索菲克群的存在、Connes刚性猜想的反例、量子平行重复定理,这些只有极少数专家能读懂。

AI能力越向科学前沿延伸,公众能依靠的便不再是亲身体验,而是一条长长的信任链。这种「连惊叹都无从惊叹」的状态,正越来越多地在各领域中同时上演。

数学家Thomas Bloom提醒,这些成果依托于上百年积累的数学理论及数学家亲手搭建的形式化系统,将其简单描述为「AI取代了数学家」并不诚实。

他提出的衡量标准是:这份证明,是否向我们揭示了关于该问题的新东西?

因此真正的问题浮现:当AI能以低成本批量生产前沿数学证明,我们究竟该用什么来衡量其成果?

答案或许不在产出端,而在验收端:一份证明能否被读懂、被核对、被判定分量,才最终决定其真实价值。

最稀缺的能力,正从「做出证明」转向「看懂并验收证明」。

当AI一夜之间便能证出十道难题,真正的考验才刚刚开始:证明造得越快,我们的验证,还能追上吗?

参考资料:

编辑:元宇

秒追ASI

相关推荐