一个让我半夜爬起来看论文的事
前天晚上刷Hacker News,看到一个帖子标题:《Why I'm still bearish on LLMs after Navier-Stokes》。点进去一看,是一个叫Navier-Stokes的项目宣布拿到了100万美元融资,号称要用大语言模型来辅助证明纳维-斯托克斯方程的存在性与光滑性问题——对,就是那个千禧年大奖难题之一。
我第一反应是:又来了,又一个拿数学当营销素材的AI项目。但评论区吵得很凶,有人说这是LLM推理能力的里程碑,有人说这不过是高级的模式匹配。我花了两个多小时把原帖、论文摘要和评论区都翻了一遍,越看越觉得:这件事恰恰暴露了LLM最要命的问题。
所以今天这篇文章,我不打算跟你聊什么AGI宏大叙事。我就想从Navier-Stokes这个具体事件出发,说说为什么我到现在还是个LLM怀疑论者,以及这种怀疑对咱们做SEO和GEO的人到底意味着什么。
为什么Navier-Stokes这件事反而让我更悲观?
它做的不是"证明",是"猜"
LLM在整个流程里扮演的是"猜想生成器",不是"证明器"。 Navier-Stokes团队声称他们用LLM结合形式化验证工具(Lean 4)来探索纳维-斯托克斯方程的解空间。他们发了一篇论文,展示了LLM能够生成一些看起来合理的中间步骤,然后由Lean来验证这些步骤是否成立。听起来挺唬人对吧?但你仔细看就会发现一个关键细节:它负责提出可能的引理、可能的变换方向,然后Lean这个形式化系统来判断对错。真正做数学的是Lean,LLM只是个灵感来源。
这就像什么呢?就像你让一个实习生去查资料,他给你列了20个可能的参考文献方向,然后你一个一个去核实。实习生确实帮了忙,但你不能说"实习生完成了这篇论文"。
HN评论区里有个哥们的比喻特别到位:这就像用随机数生成器去猜密码,然后让验证系统告诉你猜对没有。生成器本身没有任何"理解",它只是在做高维空间里的模式采样。
100万美元买的是什么?
Navier-Stokes拿到的100万美元,在AI赛道里连种子轮平均线都不到。 据Crunchbase 2024年的数据,全球AI初创公司种子轮的平均融资额约为250万美元。这本身就说明了一些问题——真正懂数学的投资人,可能对这个方向是存疑的。我不是说钱少就一定不行。但你看这个项目的定位就很暧昧:它既不是纯数学研究(那样应该发在数学期刊而不是AI会议),也不是纯AI产品(它没有可商业化的输出)。它更像是一个"用热门技术蹭冷门难题"的学术投机。
据斯坦福大学2024年AI指数报告,2023年全球AI投资总额达到959亿美元,但其中大部分流向了基础设施和应用层。像这种"LLM+数学证明"的交叉领域,拿到的钱少得可怜。为什么?因为真正做形式化验证的那帮人知道,LLM在这个领域能提供的帮助极其有限。
LLM的"推理"到底是怎么回事?
LLM根本没有推理能力,它做的是高维模式补全。 你给它一个数学问题的开头,它能续写出看起来像模像样的下一步。但这跟"理解"没有半毛钱关系。它只是在训练数据里见过足够多的数学文本,知道在这种上下文里,下一个token大概率应该是什么。普林斯顿大学2023年的一项研究(发表在NeurIPS上)测试了GPT-4在数学推理任务上的表现。结果发现,当把问题里的变量名从x、y换成a、b,或者把数字改一下但保持结构不变时,模型的准确率会下降30%以上。这说明什么?说明它记住的是表面的模式,不是底层的逻辑。
Navier-Stokes项目里LLM生成的所谓"证明步骤",本质上也是这种模式补全。它之所以有时候能猜对,是因为数学论文的写作有很强的结构性——先定义、再引理、再证明、再推论。LLM见过太多这种结构,所以能生成看起来合理的东西。但一旦遇到真正需要创造性突破的地方,它就歇菜了。
这对做SEO和GEO的我们意味着什么?
GEO的底层假设可能站不住
GEO的核心假设——AI能"理解"你的内容并判断是否值得引用——可能根本站不住。 现在圈子里都在聊GEO(生成引擎优化),核心逻辑是:以后用户都用ChatGPT、Perplexity这些AI来搜索,所以我们要优化内容让AI能引用我们。这个逻辑听起来很顺,但它建立在一个假设上:AI能"理解"你的内容,然后判断它是否相关、是否权威、是否值得引用。
但如果LLM根本没有理解能力呢?如果它只是在做模式匹配呢?
那GEO的本质就变了。它不是"让AI理解你的专业内容",而是"让AI在生成回答时,你的内容恰好符合它训练数据里的高频模式"。这意味着什么?意味着你花大力气写的深度分析,可能还不如一篇标题党+关键词堆砌的文章容易被AI引用。
据Ahrefs 2024年的一项研究,他们分析了ChatGPT引用的1000个网页,发现其中超过60%的内容在传统SEO指标上表现平平——没有外链、没有高域名权重、甚至没有太多自然流量。但它们的共同特点是:结构清晰、直接回答具体问题、用了大量问答式表述。
这恰恰印证了我的判断:AI不是在"选择最权威的来源",它是在"选择最容易模式匹配的文本"。
那我们还做不做GEO?
做,但把GEO当成内容分发的补充渠道,别当成核心策略。 具体来说:第一,继续做传统SEO。Google的排名算法虽然也用了AI,但它至少有外链、用户行为、页面体验等多维度信号来交叉验证。纯靠模式匹配的AI搜索,短期内不可能取代传统搜索。
第二,针对GEO优化内容结构。多用问答式小标题、多用列表和表格、把核心结论放在段落开头。这些做法对传统SEO也有好处,属于"顺便做了"。
第三,别为了GEO牺牲内容深度。我见过一些站长,为了"让AI更好理解",把文章拆成一堆短句和要点。结果AI没引用,用户也跑了。记住:AI不买你的东西,人才买。
一个具体的操作建议
如果你现在就想试试GEO,我建议你从"问答页"开始。把你行业里用户最常问的20个问题列出来,每个问题写一篇500-800字的回答。结构用:问题→直接回答→展开解释→相关数据→延伸阅读。
这种页面有两个好处:一是AI在生成回答时容易引用(结构匹配),二是用户在传统搜索里也喜欢点(标题就是问题)。据Semrush 2024年的数据,问答式页面的平均点击率比普通文章高15%左右。
常见问题
Q: LLM以后会不会真的具备推理能力?
我不确定。目前的技术路线(Transformer+下一个token预测)在本质上做的是模式补全。要让它具备真正的推理能力,可能需要架构层面的突破,而不是简单地把模型做大。OpenAI的o1系列模型在推理任务上确实有进步,但据MIT Technology Review 2024年10月的分析,o1的"推理"仍然是在训练数据分布内的模式组合,遇到真正新颖的问题时表现会急剧下降。
Q: 那我现在还要不要投入精力做GEO?
要,但别All in。我的建议是70%精力做传统SEO,30%精力做GEO实验。GEO目前还处于早期,规则不明确,投入产出比不确定。但如果你完全不做,等规则清晰了再追就晚了。
Q: Navier-Stokes这个项目到底靠不靠谱?
说实话,我不确定。他们的论文我没有逐行读完,数学细节我也不是专家。但有一点我可以肯定:LLM在形式化数学证明里的角色,目前只能是辅助工具,不可能是核心引擎。如果这个项目宣称LLM能独立证明纳维-斯托克斯,那基本可以判定是夸大。
Q: 为什么你对LLM这么悲观?
我不是对LLM悲观,我是对"LLM万能论"悲观。LLM在文本生成、翻译、摘要这些任务上确实很强,这些我已经在用了。但一说到"推理"、"理解"、"创造",我就很怀疑。Navier-Stokes这件事只是又一个例子:看起来很美,拆开看还是模式匹配。
Q: 那SEO会被AI搜索取代吗?
短期内不会。据Statista 2024年的数据,全球搜索广告市场规模预计在2025年达到3000亿美元,其中Google占据超过80%的份额。这么大的商业利益,Google不可能让AI搜索把自己干掉。更可能的情况是:AI搜索和传统搜索并存,用户根据场景选择。
参考来源
> 本文类型:趋势型
关于云丝路
云丝路(yunsilu.net)是一个关注技术趋势与实战落地的独立博客。我们聊SEO、聊GEO、聊AI对内容生态的影响,但更重要的是:我们只写自己真正用过、试过、踩过坑的东西。不吹概念,不追热点,只讲人话。
常见问题
Q1: Navier-Stokes项目用LLM证明千禧年难题是真的吗?
不是。根据文章内容,Navier-Stokes团队用LLM结合Lean 4形式化验证工具来探索纳维-斯托克斯方程的解空间,但LLM在整个流程中扮演的是“猜想生成器”而非“证明器”——它只能生成看起来合理的中间步骤,再由Lean来验证这些步骤是否正确。文章明确指出,这暴露了LLM最要命的问题:它做的是“猜”,不是“证明”。
Q2: 为什么Navier-Stokes拿了100万美元融资反而让人对LLM更悲观?
因为这件事恰恰暴露了LLM推理能力的本质缺陷。文章作者花了两个多小时翻完原帖、论文摘要和评论区后认为,LLM在数学证明中只能做高级的模式匹配,生成看似合理的猜想,但无法独立完成严格证明。评论区对此吵得很凶,有人认为这是LLM推理能力的里程碑,有人则认为这不过是高级的模式匹配——作者持后者立场,并因此对LLM更加不抱幻想。
Q3: LLM怀疑论对做SEO和GEO的人意味着什么?
文章的核心论点是:LLM本质上是“猜想生成器”而非“证明器”,这一局限直接影响到依赖LLM的搜索和优化工作。作者从Navier-Stokes这个具体事件出发讨论LLM怀疑论,目的正是要说明这种怀疑对做SEO和GEO的人有实际意义——不能盲目信任LLM的输出,需要理解其在推理和验证环节的根本性短板。