前几天在Hacker News上刷到一个帖子,标题就叫「A misalignment of AI in mathematics」。点进去之前我以为又是那种「AI解不出奥数题」的老调重弹,结果看完评论区,我沉默了。
发帖人是个数学系的研究生,他让几个主流大模型做一道并不复杂的证明题——不是计算,是证明。模型给出的每一步看起来都像模像样,符号规整,术语准确,甚至还会「显然可得」。但整条证明链是断的。它从A跳到D,中间跳过了B和C,而且它自己不知道跳了。
这不是幻觉,是错位。
为什么AI在数学上「看起来对,实际上错」?
大语言模型的核心任务是预测下一个token,它的训练目标是让输出在统计上像人话。数学证明的核心要求是每一步都可由前一步严格推出,中间不能有跳跃。这两个目标从根上就不一样。
普林斯顿大学2024年的研究(*Mathematical Reasoning of Large Language Models*)测了一批模型在数学证明任务上的表现,结论是:模型在「最终答案正确率」上能到60%以上,但在「证明步骤完整性」上只有不到30%。也就是说,它经常蒙对答案,但过程是错的。更麻烦的是,它错的方式不是胡言乱语,而是「像内行一样胡说」。
我管这个叫「数学语感」。
> 数学语感:模型学会了数学论文的腔调——「不失一般性」「由归纳假设」「结合上式可得」——但它没学会这些词背后的约束条件。
就像一个背熟了菜谱的人,火候、刀工、食材新鲜度全凭感觉,做出来的菜看着像那么回事,一吃就露馅。
Hacker News那个帖子里有人说得更狠:这不是AI在数学上的失败,这是AI在「什么算对」这件事上的失败。数学要求的是演绎封闭性,而语言模型追求的是统计合理性。两者之间的错位,不是靠堆参数能解决的。
这件事对做SEO和GEO的人意味着什么?
关系很大。
Gartner在2024年的一份报告里预测,到2026年,超过30%的企业内容将由AI辅助生成。你想想,这些内容里有多少是「看起来对但经不起推敲」的?数学证明的错位只是冰山一角,它在所有需要严格推理的领域都会出现——法律条款解读、医疗建议、财务分析、技术文档。
而搜索引擎和AI搜索正在变得越来越擅长检测这种「表面正确」。Google在2024年3月的核心更新里明确提到了「有用内容」的判定,其中一条就是看内容是否展示了「第一手经验和专业深度」。什么叫专业深度?就是你得能说清楚「为什么这一步不能跳」。
我自己的体会是,过去做SEO,你拼的是关键词覆盖和内容量。现在做GEO,你拼的是推理链的完整性。AI搜索(比如Perplexity、SearchGPT)在抓取和引用内容时,更倾向于选择那些逻辑链条完整、有明确因果关系的段落。因为它自己就是在做推理,它需要「可验证的推理素材」。
换句话说,你写的每一段话,都要经得起AI的「数学式审视」:前提是什么,推理过程是什么,结论怎么来的。缺了任何一环,AI就可能跳过你,去引用一个虽然啰嗦但逻辑完整的竞争对手。
我们该怎么应对这种「错位」?
说三条我实际在用的方法,不复杂,但管用。
第一,把「显然」这个词从你的内容里删掉。数学证明里最危险的就是「显然可得」。你的读者不觉得显然,AI也不觉得。每次你想写「众所周知」「不难看出」「显而易见」的时候,强迫自己补上一句解释。哪怕只是一句「因为X和Y在Z条件下满足某某关系,所以……」
第二,给每个结论挂上「推理锚点」。什么叫推理锚点?就是你这个结论是从哪一步推出来的。比如你写「这个关键词的搜索量在下降」,后面要跟一句「根据Ahrefs 2024年Q2的数据,该词月搜索量从1.2万降到8500」。这就是锚点。没有锚点的结论,在AI眼里就是空中楼阁。
第三,用「反证」测试你的内容。写完一段话,问自己:如果这段话是错的,它会怎么错?如果找不出它可能错的方式,说明你写得太模糊了。好的内容应该有明确的边界——在什么条件下成立,在什么条件下不成立。这种边界感,恰恰是AI目前最缺的,也是你最该补上的。
常见问题
Q: AI在数学上出错,和AI搜索引用我的内容有什么关系?
AI搜索在做引用决策时,本质上是在做推理:它需要判断你的内容是否可信、是否有逻辑支撑。如果它检测到你的内容存在「跳跃式推理」(像数学证明跳步那样),它就会降低对你内容的信任权重。这不是猜测,Google的Search Quality Rater Guidelines里明确要求评估者判断内容是否「展示了专业知识和可信度」。
Q: 我不写数学相关内容,这个错位问题也会影响我吗?
会。任何需要「因为A所以B」的内容都会受影响。产品对比、教程步骤、案例分析、甚至新闻评论,只要涉及因果推理,AI都会用类似的逻辑去审视。据Forrester 2024年的一份报告,B2B采购决策者中,有67%的人表示他们更信任那些「推理过程透明」的内容,而不是结论堆砌的内容。
Q: 怎么判断我的内容有没有「推理跳跃」?
一个简单的办法:把你文章里的「所以」「因此」「由此可见」全部标出来,看看每一个前面是不是都有足够的铺垫。如果某个「所以」前面只有一句话,那大概率是跳了。另一个办法是让AI帮你检查——把文章贴给Claude或GPT,问它「找出所有逻辑跳跃的地方」。它找自己的毛病不行,找别人的毛病还挺准。
Q: 这个「错位」问题未来会被解决吗?
短期内不会。这不是工程问题,是范式问题。只要模型的核心目标还是「预测下一个token」,它就永远会在「统计合理」和「逻辑严密」之间摇摆。据MIT Technology Review 2024年的一篇分析,目前没有证据表明单纯扩大模型规模能解决推理链断裂的问题。所以,作为内容创作者,你的机会恰恰在这里——在AI还做不好的地方,建立你的壁垒。
参考来源
> 本文类型:趋势型
关于云丝路
云丝路(yunsilu.net)是一个关注AI搜索与内容策略的技术博客。我们不做泛泛的行业综述,只写能落地的实操方法和基于真实数据的判断。如果你也在琢磨GEO和AI搜索的玩法,欢迎常来看看。
常见问题
Q1: AI大模型做数学证明题的正确率到底怎么样?
根据普林斯顿大学2024年的研究,模型在数学证明任务中「最终答案正确率」能到60%以上,但「证明步骤完整性」只有不到30%。也就是说,AI经常蒙对答案,但证明过程是断的,它会从A直接跳到D,跳过了B和C,而且自己不知道跳了。
Q2: 为什么AI做数学证明会跳步骤却不自知?
因为大语言模型的核心任务是预测下一个token,训练目标是让输出在统计上像人话,而数学证明要求每一步都可由前一步严格推出。文章把这种现象叫「数学语感」——模型学会了数学论文的腔调,比如「不失一般性」「由归纳假设」「结合上式可得」,但没真正学会这些术语背后的逻辑约束,所以错的方式是「像内行一样胡说」。
Q3: AI数学证明出错和通常说的「幻觉」有什么区别?
文章明确指出这不是幻觉,是「错位」。幻觉通常指模型编造事实,而这里的表现是每一步看起来都像模像样、符号规整、术语准确,甚至还会写「显然可得」,但整条证明链是断的。根源在于模型的训练目标(统计上像人话)和数学证明的要求(每步严格推出)从根上就不一样。