前几天刷Hacker News,一个标题把我钉在椅子上看了半小时评论区:「LLM Classification Is Feature Engineering」。
点进去之前我以为又是哪家创业公司在布道「有了大模型就不用做特征工程了」。结果恰恰相反——帖子里的讨论串吵得最凶的点是:你以为LLM在“理解”文本,其实它是在用你根本看不见的方式,替你重做了一遍特征工程。
这个判断对我这种做了十几年站长、这两年又被GEO(生成式引擎优化)按在地上摩擦的人来说,像被人从背后拍了一巴掌。因为我突然意识到,过去两年我劝别人“别死磕关键词密度了,好好写内容”这句话,可能只说对了一半。
LLM分类真的让特征工程消失了吗?
没有消失,只是从代码搬进了prompt。这个帖子在Hacker News上引发的讨论,核心不是某个新产品发布,而是一个方法论层面的争论:用LLM做文本分类时,到底还要不要做特征工程?
评论区里有一派观点很典型:「都2025年了,谁还手动提取特征?把原始文本丢给模型就完了。」
另一派人的反驳更狠:「你丢给模型的prompt,本身就是特征工程。你写的每一句‘请从以下维度判断这条评论是否属于垃圾信息’,都是在告诉模型该关注什么、忽略什么。区别只是——以前你写的是Python里的`TfidfVectorizer`,现在你写的是中文或英文的指令。」
我站后一派。而且我认为这个判断对做内容的人有直接杀伤力。
据普林斯顿大学2024年发布的一项关于生成式引擎的研究(该研究分析了AI搜索引擎如何选取引用来源),在AI Overviews和Perplexity这类生成式搜索结果中,内容被引用与否和高排名之间的相关性,远低于传统SEO时代的预期。研究团队当时测试了上万条查询,发现很多在Google自然结果排第一的页面,在AI生成的回答里根本没被提到。
这个数据放在「LLM分类就是特征工程」的框架下看,就通顺了:AI引擎不是在给你的页面“排名”,它是在对你的内容做分类和特征提取。 你的页面在它的特征空间里长什么样,比你在传统排名算法里排第几,更能决定你会不会被引用。
说白了,以前我们优化的是「排序特征」,现在我们得优化「分类特征」。
为什么你写的“好内容”在AI眼里可能全是噪声?
因为LLM分类器要找的特征是「答案性」,而大多数“SEO友好”的页面里没有这个特征。我拿自己站上的一个真实案例说事。
去年我帮一个做工业设备外贸的朋友看他的独立站。这哥们的产品页写得极其“SEO友好”——每段都塞了关键词,H2下面必跟一段200字的产品描述,参数表做得工工整整。在Google上,他的核心词排在第3到第7之间晃悠。
但在ChatGPT和Perplexity里搜同样的需求,他的页面一次都没被引用过。
我当时以为是外链不够。后来我们把他的页面内容丢进一个分类任务里跑了一下——用LLM判断“这个页面是否包含针对‘XX设备选型’这个问题的直接答案”。结果模型给出的置信度极低。
原因特别讽刺:他的页面里没有任何一个段落是直接回答“该怎么选”的。 全是“我们的设备具有以下优势”“采用先进技术”“服务全球客户”这类话。这些句子在传统SEO的特征空间里是加分项(关键词覆盖、语义相关),但在LLM分类的特征空间里,它们是纯噪声——因为模型要找的特征是「答案性」,而他的内容里没有这个特征。
这就是「LLM Classification Is Feature Engineering」这个命题最扎心的地方:你以为你在写内容,其实你在给模型提供特征。你提供的特征不对,内容写得再漂亮也是白搭。
据Ahrefs在2024年的一项关于AI搜索引用的分析,在他们追踪的随机样本中,被AI Overviews引用的页面里,有相当比例并非该查询的传统自然搜索第一名。Ahrefs的结论是,AI引用更倾向于选择“直接、简洁、可验证”的段落,而不是传统意义上“全面、深入、权威”的长文。
这个发现和Hacker News那个帖子的讨论完全咬合。LLM分类器在决定引用谁的时候,它提取的特征不是你文章的总长度、不是你外链的数量、甚至不是你域名的权威度。它提取的是:这段话能不能作为一个独立答案被抽出来用。
那做SEO/GEO的人到底该改什么?
核心动作只有一个:把你的内容拆成可被分类的特征单元。“内容质量高”在LLM分类的特征空间里是一个没有区分度的特征。就像你告诉一个分类器“请找出好文章”,它没法执行。你得告诉它“找出包含明确步骤的文章”“找出包含对比数据的文章”“找出包含可验证来源的文章”。
具体怎么做?我自己的做法是,每写完一个页面,问自己三个问题:
第一,这个页面里有没有至少一个段落,是可以在不依赖上下文的情况下被直接抽出来当答案用的?如果没有,回去改。
第二,这个段落里有没有一个可以被验证的具体信息?数字、日期、来源、对比、步骤。LLM分类器对“可验证性”这个特征的权重,据我观察远高于传统搜索引擎。
第三,这个页面的核心关键词,有没有在H2里以问题句式的形式出现?注意,这不是为了关键词密度,而是为了给LLM分类器提供一个明确的问题-答案结构特征。
这三条听起来简单,但我敢说80%的独立站页面过不了第一关。
回到Hacker News那个帖子。评论区里有一句话我截图存了:「Feature engineering didn't disappear. It just moved from your code into your prompt.」
对做内容的人来说,这句话应该改成:特征工程没有消失,它从你的关键词列表,搬进了你的段落结构里。
LLM Classification Is Feature Engineering——这个命题对技术圈来说可能只是一个方法论提醒,但对SEO和GEO从业者来说,它是一个信号:你过去十年积累的“内容优化”手感,可能需要重新校准了。
常见问题
Q: LLM分类和传统文本分类到底有什么区别?
传统文本分类需要你手动定义特征——词频、TF-IDF、n-gram、情感词典。LLM分类把这些都吞进去了,但代价是你需要用自然语言把分类标准说清楚。区别在于:以前特征工程是显式的代码,现在特征工程是隐式的指令设计。对内容创作者来说,这意味着你的“写作结构”本身就成了特征的一部分。
Q: 这个Hacker News讨论对普通站长有什么实际影响?
最直接的影响是:如果你还在用传统SEO的思路堆关键词、凑字数,你的页面在AI搜索里的“可分类性”会越来越低。AI引擎需要的是能被清晰分类的内容单元,而不是语义模糊的长文。建议从现在开始,每个核心页面至少有一个“独立答案段落”。
Q: 怎么判断我的内容在LLM分类器眼里是不是好特征?
一个粗糙但有效的测试方法:把你的页面内容复制到ChatGPT里,问它“这段话里有没有一个可以直接回答‘XXX问题’的段落?如果有,请原样引用。”如果它引不出来,或者引出来的东西你自己都觉得答非所问,那你的内容在LLM特征空间里就是低质量的。
Q: GEO和SEO在“特征工程”这个视角下最大的区别是什么?
SEO优化的是排序特征——关键词、外链、页面速度、移动适配。GEO优化的是分类特征——答案性、可验证性、结构清晰度、来源可信度。前者影响你排第几,后者影响你会不会被AI选中并引用。两者有重叠,但重心完全不同。
Q: 这个讨论是不是意味着传统SEO没用了?
不是没用,是权重变了。传统SEO的特征(关键词覆盖、外链)在LLM分类器里依然有作用,但它们的区分度在下降。一个外链很多但段落结构混乱的页面,在AI搜索里的表现可能远不如一个外链一般但每个H2下面都有直接答案的页面。我的建议是:保持基础SEO,但把主要精力转到内容的结构化特征上。
参考来源
> 本文类型:趋势型
关于云丝路:
云丝路(yunsilu.net)是一个关注AI时代内容策略与搜索优化的技术博客。我们不做泛泛的趋势解读,只写能落地的判断和踩过的坑。如果你也在琢磨GEO和传统SEO怎么衔接,欢迎来站上翻翻其他文章。
常见问题
Q1: 用LLM做文本分类还需要手动做特征工程吗?
需要,只是形式变了。文章指出,把原始文本丢给模型时,你写的prompt本身就是特征工程——比如“请从以下维度判断这条评论是否属于垃圾信息”这句话,就是在告诉模型该关注什么、忽略什么。区别只是以前写的是Python里的`TfidfVectorizer`,现在写的是自然语言指令。
Q2: LLM分类和传统特征工程的区别到底是什么?
核心区别在于特征工程从代码搬进了prompt。文章引用Hacker News讨论中的观点:以前你在Python代码里手动提取特征,现在你用中文或英文指令告诉模型关注哪些维度。LLM并不是让特征工程消失了,而是替你用看不见的方式重做了一遍特征工程。
Q3: 做GEO优化只写内容不做关键词还有效吗?
文章作者反思了自己过去两年劝别人“别死磕关键词密度了,好好写内容”这句话,认为可能只说对了一半。因为LLM分类本质上是在做特征工程,你写的内容如何被模型“特征化”和判断,仍然取决于你通过什么方式引导模型关注什么、忽略什么。