科技

OpenAI强力新模型!GPT-6一天攻破5道至今未解数学难题

0
Please log in or register to do it.
阅读量:1

科技前沿

GPT-6攻克5道未解数学难题:AGI时代的锚点,还是一场昂贵的算力奇观?

2026年09月07日 · 萌头条编辑部

OpenAI强力新模型!GPT-6一天攻破5道至今未解数学难
▲ 图片来源:AI生成 (Seedream)

当GPT-6 Astra成为68道人类未解数学难题中唯一交出有效答卷的大模型,我们面对的究竟是AGI时代真正的地平线,还是一场被精密包装的算力豪赌?

一场连“开卷”都没法作弊的极限测试

FrontierMath Erdős基准测试设计得相当聪明,它几乎堵死了一切投机取巧的路径。全部68道题目都选自人类至今悬而未决的Erdős数学难题,这些题没有标准答案公开发表,训练语料想“背答案”都无从下手;同时标准评测要求模型必须输出Lean形式化证明,再由底层内核自动逐行核验——想靠“语感”蒙混过关基本是天方夜谭。在这样的苛刻约束下,GPT-5.6、Claude Fable 5.1等四款主流大模型全部得0分,而GPT-6 Astra成为全场唯一给出有效答卷的选手。

更让人心头一紧的是那5道题的分量。1931年解离集猜想,来自18岁Erdős口中“人生第一个正经问题”;极值图论里赫赫有名的Erdős-Sós猜想,更是让几代顶尖数学家折戟沉沙。GPT-6 Astra不仅在标准环节解决2道,还在放宽算力预算的追加实验中再破3道,其中既有构造反例推翻旧猜想,也有完整证明新命题。以一个AI系统的身份向这类开放性难题发起真正的学术冲击,确实是史无前例的一幕。

“AGI时代已经到来”的宣告,为何仍显得太急?

不过,这份漂亮答卷背后藏着一个很难被忽视的细节:五道题全部尝试合计消耗超22万美元算力,标准测试本身约2万美元,按照300美元一次、3%成功率逆向推算,解出一道重要开放问题的期望成本大约在1万美元。这种依赖十万级GPU堆叠、配合前代模型做监督训练而成的解题机器,本质上更像是一场巨型“数值碰撞”实验——和Erdős当年喝着咖啡四处奔走、靠灵感串联起无数分支的数学人生,路径截然不同。

更值得警惕的是,数学研究从来就不只是“做对题目”。当前基准只考察模型能否在给定前提下推出结论,却完全不关心它有没有能力提出好的新问题。回溯数学史,每一次真正的范式跃迁几乎都始于一个此前无人问过的“好问题”,而图灵测试意义上的AGI,也绝不应狭窄到只剩下解题高手这一种面孔。把一次算力供给充沛后的解题成绩,直接等同于“AGI时代到来”,多少有些营销话术大过学术叙事的嫌疑。

63道未解难题,像一面照妖镜

论文作者也坦承了模型的软肋:它可能明明已经推演出了正确思路,却无法顺利转换成Lean形式化证明,最终只能被判定为无效。这说明当前所谓“证明能力”其实被困在严苛的形式语法框架之中,AI的理解力和它在符号层面的表达之间仍有明显断层。真正的人类数学思考伴随着不断试错、向他人解释、接受质疑和修正的有机过程——这些非线性动作,恰恰是GPT-6还远未具备的品质。

回到那个最冰冷的数字:68道难题里,GPT-6解开5道,剩下63道依然纹丝不动。即便把这次表现换算成比例,也只是不到8%的局部突破,距离“全面攻克高阶数学”的说法还隔着好几条马里亚纳海沟。与其替OpenAI反复宣称“AGI元年”,不如把GPT-6 Astra这次亮相理解成一次有建设性、却也极具局限性的试水——它证明了大算力能把AI推到人类专家级思考的门口,却还没有真正拿到打开那扇门的钥匙。数学这座没有天花板的迷宫,才刚刚点亮第一盏灯。

— END —

萌头条编辑部原创发布 · 转载请注明出处

全国首款仿生医疗机器人发布:短裙护士装造型亮相
韩路3.3万元装了台电脑 一对内存就花了近9千元
您必须 登录 后才能评论。