搜索能力——你得在海量可能路径里找到真正能走通的那一条;
创造性跳跃——很多关键突破,靠的不是机械穷举,而是突然换了一种看世界的方式。
更关键的是,数学有一个其他领域都不具备的优势:客观可验证。
一道数学定理,对就是对,错就是错。每一步推导都必须逻辑自洽,每一个结论都可以被形式化验证工具(如Lean或Coq)机械检查。在这里,AI存在什么「看起来挺像回事但其实是幻觉」的可能性。
早在1956年那场标志着人工智慧诞生的达特茅斯会议上,计算机科学的先驱们定下的第一个具有里程碑意义的目标,就是让机器证明《数学原理》中的基础定理。在学术界的鄙视链里,数学始终站在认知智力的最顶端,它没有模糊语义,不容许模棱两可。如果一个AI能证明定理,那它距离真正的通用人工智慧(AGI)就只剩一层窗户纸了。
也正因如此,数学在AI认知评估里,一直被视作最硬核的试金石。
达里奥作为AI领域专家当然知道这个道理。
他几乎可以想像,当「Mythos独立证明了数学定理」这个新闻登上头版时,全世界会是什么反应。
普通人会震撼:「AI已经比人类还聪明了!」
投资者会亢奋:「AGI时代真的要来了!」
学术界会激辩:「这是否意味着数学家即将失业?」
而无论是哪种反应,最终都会转化为同一个结论:Anthropic,就是人类通往AGI的唯一入口。
……
两天后,一支由三十名数学博士和五位教授组成的特别团队,被悄然安置在了Anthropic总部的办公室里。
对外,这里的代号是普罗米修斯,盗火的神。
对内,达里奥给他们的指令只有一句话:「用Mythos解数学题。解得越难越好。」
……
接下来的两周里,普罗米修斯团队开始了疯狂的「AI炼丹」。
过程远没有公开宣传的那样光鲜。
事实上,真正的工作流程是这样的:数学博士们先选定目标问题,然后由人工介入,一步步给Mythos提供方向性提示。有时候是直接告诉模型「试试从XXX方向切入「,有时候是在模型卡壳后手动给出关键引理。Mythos则负责暴力穷举中间步骤,用海量算力去填补人类指明方向后的脏活累活。
一个定理的解决,往往需要反覆试错几百次,消耗数千美元的算力,耗时一到两周。
然后,团队会把最终的完整证明重新输入模型,做一次复训。训练完成后,再用一个全新的对话窗口向Mythos重新提问同一个问题。
这一次,Mythos当然能「独立」给出完美解答。
因为答案已经被喂进去了。
本质上,这就像是老师把标准答案给学生背了一遍,然后在全班面前当场考他,学生张口就来,旁观者自然觉得这学生是天才。
但任何一个冷静的人只要稍微想一想,就能发现一个致命的逻辑漏洞。
如果Mythos真的具备了自主解决研究级数学问题的能力,那为什么不同时开一千个对话窗口,让它并行攻击一千个未解问题?以Anthropic的算力规模,这完全做得到。真有这种能力的话,每周应该有几百篇成果像下饺子一样往外蹦才对。
可最终的产出呢?
两周时间,五六个成果。
这个产出效率,恰恰说明了真实的工作模式:不是AI在自主思考,而是人类数学家在手把手引导,AI在做暴力计算。
五六个成果,对应的是五六位数学博士各自花了两周时间死磕出来的方向。
这才是真相。
……