昨天在 Hacker News 上刷到一篇论文,标题叫 *An empirical study of harness design for coding agents*,普林斯顿和几家机构联合发的。我本来想扫两眼就关,结果越看越精神——这帮人干了一件特别朴素但没人系统干过的事:把同一个模型塞进不同的"马具"里,看它在 coding 任务上的表现能差多少。
结论挺扎心的。模型还是那个模型,权重一个没动,但通过率能从 40% 出头飙到 70% 多。差在哪?差在你给它配了什么工具、怎么编排它的思考步骤、什么时候让它停下来检查。
我盯着这个结论想了很久。我们做 SEO 和 GEO 的人,这两年花了大量时间研究"怎么写提示词让 AI 引用我的内容",但可能一直忽略了一个更底层的问题——你面对的那个 AI,它自己也是被一套"马具"驾驭着的。你写的提示词,只是它马具里最外面那一层皮。
为什么同一个模型换个"马具",通过率能差出 30 个百分点?
同一个底层模型,权重完全没动,仅仅换一套马具配置,任务通过率就能差出 30 多个百分点。它测的是 coding agent,不是聊天机器人。所谓 coding agent,就是你给它一个任务比如"把这个 bug 修了",它自己去读代码、改文件、跑测试、看报错、再改,循环往复直到搞定或放弃。
"马具"(harness)这个词用得很准。它指的不是模型本身,而是包裹在模型外面的那一整套东西:系统提示词怎么写、给不给它搜索工具、允不允许它执行命令、它每步输出后有没有一个"检查员"角色来验证、失败几次后是重试还是换策略。
研究者设计了多套不同的马具配置,跑同一批任务,用同一个底层模型。结果最好和最差的配置之间,任务通过率差了 30 多个百分点。
这个数字什么概念?据 Stanford HAI 2024 年的 AI Index 报告,过去两年里,同等规模模型在标准 coding 基准上的提升幅度,一年也就 10 到 20 个百分点。换句话说,光是调整马具设计带来的收益,可能比换一个更大更新的模型还猛。
我自己的判断是,这个结论其实揭开了一个行业里大家心知肚明但不太愿意明说的真相:过去一年多,很多所谓"新模型编程能力大幅提升"的宣传,里面掺杂了不少马具优化的功劳。模型确实在进步,但配套的 agent 框架、工具调用协议、错误恢复机制的进步,可能贡献了不亚于模型本身的增量。
这对我们做 GEO 的人意味着什么?意味着当你试图"优化内容让 AI 引用"的时候,你实际上是在跟一套复杂的马具系统博弈,而不是在跟一个裸模型对话。
马具设计的核心矛盾:让它自己跑,还是每一步都盯着?
马具设计没有"哪种更好"的统一答案,效果取决于任务类型。论文里我觉得最有意思的一个发现,是关于"自主性"的。
研究者对比了两种极端马具:一种是"放手型",给 agent 一个任务后基本不干预,让它自己规划、自己执行、自己判断成功与否;另一种是"保姆型",每一步都要求它输出思考过程,每改一个文件就要求它跑一次测试,失败了就强制它分析原因再继续。
你猜哪种效果好?
答案是:看任务类型。
对于那种边界清晰、验证标准明确的任务,比如"让这个测试通过",保姆型马具明显更好。因为每一步都有反馈,agent 不容易跑偏。对于那种需要探索、需要理解大范围代码库的任务,比如"找出这个性能瓶颈在哪",放手型反而更好,因为保姆型马具的频繁打断会让它丢失全局视野。
这个发现直接打破了很多团队做 agent 产品时的默认假设——"管得越细效果越好"或者"越自主越先进",都是错的。
我联想到 GEO 领域一个类似的现象。现在市面上有很多"AI 内容优化"工具,它们的逻辑就是保姆型的:帮你检查关键词密度、帮你调整段落结构、帮你加 FAQ 区块。但据 Ahrefs 在 2024 年做的一项关于 AI 搜索引用的研究,被 AI 引用的内容里,有相当一部分并不符合传统 SEO 的"优化标准"——它们的结构可能很松散,但信息密度和独特性很高。
这说明什么?说明 AI 在决定引用谁的时候,它内部的"马具"可能更偏向放手型——它要的是能帮它把问题解决掉的信息,而不是格式最漂亮的信息。
写提示词这件事,可能被我们想复杂了
提示词的长度和详细程度,跟最终效果之间没有稳定的正相关。论文里还有一个细节我反复看了几遍。
研究者尝试了多种系统提示词的写法,从极简的"你是一个编程助手"到极详细的"你需要遵循以下 15 条规则"。结果发现,提示词的长度和详细程度,跟最终效果之间没有稳定的正相关。
有些简短提示词配上好的工具编排,效果远超冗长提示词配差工具。
这个结论如果成立,那对 GEO 从业者来说是个挺大的冲击。因为现在大量 GEO 教程和工具的核心卖点,就是教你"怎么写提示词让 AI 引用你"、"怎么在内容里埋钩子"。这些东西有没有用?可能有。但它的天花板可能很低,因为提示词只是马具最外层的那张皮。
真正决定 AI 会不会用你的内容的,是更底层的东西:你的内容在它的检索工具里排第几、它的验证工具觉得你的信息可不可靠、它的规划工具判断你的内容能不能帮它完成任务。
据 Gartner 在 2024 年发布的一份关于生成式 AI 搜索的预测报告,到 2026 年,传统搜索引擎的搜索量将下降 25%。这个数字被引用得很多,但我觉得更值得关注的是它背后的逻辑:当 AI 自己成为信息的中转站,内容被引用的规则就彻底变了。
你不再是在跟一个排序算法博弈,你是在跟一整套 agent 马具博弈。
对网站主来说,现在能做什么?
说点实在的。
第一,别再把精力全花在"怎么让 ChatGPT 提到我"这种黑盒测试上了。那东西不可控、不可测、不可复现。把同样的时间花在提升内容的"可验证性"上。什么叫可验证性?就是你的内容里有没有具体的数据、有没有可查的来源、有没有明确的结论。agent 的马具里如果有验证环节,它会更倾向引用那些它能验证的东西。
第二,重新审视你的内容结构。不是让你去堆 FAQ 区块,而是让你的内容更容易被"拆解"和"重组"。agent 解决一个复杂任务时,它需要的是能直接拿来用的信息模块,而不是一篇需要从头读到尾的长文。据普林斯顿大学在 2024 年发表的一项关于 AI 生成内容引用的研究,结构清晰、观点明确的内容被 AI 引用的概率,比结构松散的内容高出约 40%。
第三,关注你的内容在垂直领域的"工具化"程度。如果你的内容能被 agent 当成一个工具来用——比如一个计算器、一个对照表、一个决策树——它被调用的概率会远高于一篇纯叙述文章。这是马具设计研究给我们的最大启发:工具比提示词重要,编排比内容本身重要。
常见问题
Q: 这篇论文说的"harness"到底指什么?跟提示词有什么区别?
> Harness(马具)在 AI agent 语境里,指的是包裹在模型外面的整套运行框架,包括工具配置、调用方式、步骤衔接、错误恢复和验证环节。
提示词只是其中一小部分。论文的核心发现是,这些"外围"设计对最终效果的影响,可能比模型本身还大。
Q: 这个研究对 GEO 优化具体有什么指导意义?
最大的意义是让你把注意力从"怎么写提示词"转移到"怎么让内容可被 agent 调用"。具体来说:内容要有可验证的数据和来源,结构要模块化方便拆解,最好能工具化(表格、决策树、计算逻辑)。这些比关键词密度和 FAQ 数量重要得多。
Q: 同一个模型换马具差 30 个百分点,这个数据可靠吗?
这是论文里的实验数据,具体数字在不同任务集上有波动。但"马具设计显著影响 agent 表现"这个结论,跟业界多个团队的实践经验是一致的。需要说明的是,这个 30 个百分点是在特定任务集上测出来的,不能简单外推到所有场景。
Q: 做 SEO 的人现在转 GEO,最应该补的是什么能力?
我觉得是"理解 agent 怎么工作"的能力。传统 SEO 你只需要理解爬虫和排序算法。GEO 你需要理解 agent 的任务规划、工具调用、结果验证这一整套流程。据 Forrester 在 2024 年的一份关于 AI 搜索对流量影响的报告,到 2025 年,约有 30% 的企业网站流量将来自 AI 驱动的搜索和推荐系统。不理解 agent 的马具设计,就很难在这个流量结构里找到自己的位置。
参考来源
> 本文类型:趋势型
关于云丝路:云丝路(yunsilu.net)关注 AI 时代的内容策略与搜索变化,写一些自己觉得有用、别人可能也觉得有用的东西。不保证每篇都对,但保证每篇都是自己琢磨过的。
常见问题
Q1: 同一个大模型不做微调,只换 coding agent 的工具和流程,任务通过率能差多少?
根据普林斯顿等机构联合发表的论文 *An empirical study of harness design for coding agents*,模型权重完全没动,仅更换“马具”配置(给什么工具、怎么编排思考步骤、何时停下来检查),coding 任务的通过率就能从 40% 出头提升到 70% 多,差距超过 30 个百分点。这说明在 coding agent 场景里,马具设计对最终效果的影响可能不小于模型本身。
Q2: 论文里的“harness(马具)”具体指什么?和写提示词有什么区别?
在这篇论文里,“马具”指的是模型之外的一整套运行配置:包括给它配哪些工具、如何编排它的思考与执行步骤、什么时候让它停下来检查等。提示词只是这套马具里最外面的一层皮,真正决定 agent 表现的是工具、流程和控制策略的整体设计,而不是单靠提示词优化。
Q3: 做 SEO/GEO 的人为什么要关注 coding agent 的“马具”研究?
因为用户面对的 AI 本身也是被一套“马具”驾驭着的——你写的提示词只是它马具里最外层的一部分。这篇论文用 coding agent 证明:同一个模型换一套工具与流程编排,通过率能差 30 多个百分点,这意味着做 GEO 时只研究“怎么写提示词让 AI 引用我的内容”可能忽略了更底层的马具层影响。