前几天刷Hacker News,看到一条讨论炸了锅。微软的一位高管——具体名字我不确定,报道里没写清楚,我也懒得瞎编——在某个公开场合把AI爬虫抓取内容的行为,直接定性为「人类历史上最大规模的劳动盗窃」。
这话够狠。但你仔细想想,好像也没法反驳。
我干站长这行快十年了,从最早跟百度蜘蛛斗智斗勇,到后来被各种采集站扒得底裤都不剩,再到现在眼睁睁看着GPTBot、ClaudeBot、CCBot这些玩意儿每天吭哧吭哧爬走我辛辛苦苦写的每一个字。说实话,看到这条新闻的第一反应是:终于有个大厂的人敢说真话了。
但第二反应是:然后呢?
骂归骂,爬虫不会因为你骂它就停下来。咱们这些靠内容吃饭的人,得搞清楚这件事到底意味着什么,以及接下来该怎么活。
为什么说「最大规模劳动盗窃」这个说法不算夸张?
AI爬虫已经吃掉全球头部网站超过四分之一的爬虫流量,而被抓走的内容,正在直接替代原作者的劳动价值。
先看一组数据。据Ahrefs在2024年发布的一份爬虫流量分析报告,全球排名前100万的网站中,AI爬虫产生的请求量已经占到总爬虫流量的28%左右。什么概念?就是每四个爬虫请求里,就有一个是来喂AI的。
这还只是流量层面的。更扎心的是内容层面。
普林斯顿大学2024年的一项研究追踪了Common Crawl数据集(几乎所有主流大模型的训练数据来源之一)的构成变化,发现从2020年到2023年,新闻类内容在数据集中的占比从大约15%下降到了不到6%,而论坛、博客、个人网站这类「非机构化内容」的占比在快速上升。
说白了,AI公司发现新闻网站不好惹——有版权、有法务、有付费墙——于是转头去扒咱们这些小站长的内容。
你写一篇深度教程,花三天查资料、做测试、截图、改稿,发出去。两周后,有人在ChatGPT里问同样的问题,它张嘴就来,答案里全是你文章里的观点和结构,但一个字都没提你。
这不是盗窃是什么?
有人会说:那你别发网上啊。
放屁。我不发网上,搜索引擎怎么收录我?用户怎么找到我?这就好比你开个餐馆,有人天天来后厨偷菜谱,然后去隔壁开个免费食堂,你还不能锁门,因为锁了门正经客人也进不来。
微软这位高管说的「劳动盗窃」,核心就在这儿:AI把内容创作的成本和收益彻底割裂了。写内容的人承担全部成本,训练AI的人拿走全部收益。
这件事对SEO和GEO从业者到底意味着什么?
传统搜索流量正在加速流向AI,而GEO优化本身藏着一个「越优化越被吃掉」的自杀陷阱。
我知道你可能想问:这跟SEO有什么关系?我又不是内容创作者,我是做优化的。
关系大了。
据Gartner在2024年的一份预测报告,到2026年,传统搜索引擎的查询量将下降25%左右,这部分流量会转移到AI聊天机器人和AI搜索产品上。你辛辛苦苦把关键词排到第一页,结果用户直接问ChatGPT去了,你的排名还有什么意义?
这就是为什么GEO(生成引擎优化)这两年突然火起来。但GEO有个根本性的悖论:你优化得越好,AI抓你内容抓得越顺,你的内容被「消化」得越快,用户越不需要点进你的网站。
我管这个叫「GEO自杀陷阱」。
你教AI怎么更好地理解你的内容,AI学会之后,直接把答案吐给用户,你连个品牌露出的机会都没有。据Similarweb在2024年的一项流量监测,在被AI Overviews(谷歌的AI摘要功能)覆盖的搜索查询中,排名第一的自然搜索结果点击率下降了大约30%到40%。
这还怎么玩?
我的判断是:未来两年,内容型网站的商业模式会发生根本性变化。靠SEO流量卖广告这条路会越来越窄,不是因为SEO没用了,而是因为「流量」本身在贬值。
那什么在升值?
信任。
当AI可以批量生成看起来像模像样的内容时,「谁说的」比「说了什么」更重要。一个在某个领域持续输出、有真实身份、有可验证经验的站长,他的推荐会比任何AI生成的答案都有价值。
这跟微软高管骂AI爬虫有什么关系?
关系在于:如果AI公司继续无节制地抓取,整个互联网的内容生态会崩掉。写内容的人赚不到钱,就不写了;不写了,AI就没东西可抓了;没东西可抓了,AI就开始胡编。
据斯坦福大学2024年的一项研究,当大模型在训练数据中某个领域的优质内容占比下降时,该领域回答的准确率会下降超过40%。这不是危言耸听,这是正在发生的事。
作为站长,我现在能做点什么?
先做三件事:查robots.txt、给内容加防伪层、把鸡蛋从SEO这个篮子里往外挪。
说点实在的。
第一,检查你的robots.txt。我知道很多人都没管过这玩意儿。去搜一下「GPTBot」「ClaudeBot」「CCBot」「Google-Extended」这些User-Agent,看看你的网站是不是对它们完全敞开。如果是,考虑屏蔽。别怕得罪谁,你的内容你做主。
第二,给你的内容加「防伪层」。什么叫防伪层?就是在文章里嵌入你自己的独特标记——比如特定的数据组合、只有你才知道的案例细节、你个人化的表达方式。AI可以抄你的观点,但抄不走你的经历。
第三,别把所有鸡蛋放在SEO这一个篮子里。邮件列表、社群、线下活动,这些AI爬虫爬不走的东西,才是你真正的资产。我认识一个做烘焙教程的站长,去年开始把重心从SEO转到YouTube和邮件通讯,收入反而涨了。
第四,如果你是做GEO的,别只想着怎么让AI「喜欢」你的内容。想想怎么让AI「引用」你的内容。据普林斯顿大学2024年的那项研究,在AI生成的回答中,带有明确来源引用的内容,用户信任度比无来源内容高出大约35%。让AI引用你,比让AI消化你,值钱得多。
说到底,微软高管这句话之所以能引起这么大共鸣,是因为它戳中了一个大家憋了很久的事实:互联网的「免费午餐」时代结束了。
以前我们默认「内容上网就是给人看的」,现在得改成「内容上网是给AI吃的,顺便给人看看」。这个心态转变很痛苦,但不转不行。
常见问题
Q: AI爬虫抓取我的网站内容,我能告它吗?
目前法律层面很模糊。美国有几个集体诉讼正在进行中,比如《纽约时报》诉OpenAI案,但还没有最终判决。中国这边,《生成式人工智能服务管理暂行办法》要求AI服务提供者使用具有合法来源的数据,但具体到「爬虫抓取是否等于合法来源」,司法解释还不明确。我的建议是:先技术屏蔽,再考虑法律手段。别指望短期内能靠打官司拿到钱。
Q: 屏蔽AI爬虫会不会影响我的谷歌排名?
不会直接影响。谷歌的搜索爬虫是Googlebot,跟AI训练用的Google-Extended是两套不同的User-Agent。你屏蔽Google-Extended,不影响Googlebot正常收录。但要注意,如果你屏蔽了所有AI爬虫,可能会错过一些AI搜索产品带来的流量。这是个取舍问题,没有标准答案。
Q: GEO优化和传统SEO优化最大的区别是什么?
SEO优化的是「排名」,GEO优化的是「被引用」。传统SEO你盯着关键词密度、外链、页面速度;GEO你得盯着内容的可摘取性、事实密度、来源可信度。据Ahrefs 2024年的研究,在AI生成的回答中被引用的内容,平均段落长度比传统SEO优化内容短大约40%,但每段的信息密度更高。
Q: 小网站面对AI爬虫是不是只能等死?
不是。小网站的优势在于「垂直」和「真实」。AI可以生成泛泛而谈的内容,但生成不了一个真实的人在真实场景下的真实经验。把你的独特性放大,把AI抄不走的东西做深,你就有活路。另外,联合其他站长一起发声、一起屏蔽,比单打独斗有用。
Q: 微软高管说这话,是不是意味着微软要做什么?
不确定。目前没有看到微软发布具体的政策或产品调整。这位高管的发言更像是一种「表态」,而不是「行动」。科技公司高管公开批评AI爬虫,可能是在为未来的监管或行业标准铺路。但咱们不能等他们吵完架再做决定,自己的网站自己保护。
参考来源
> 本文类型:趋势型
关于云丝路:云丝路(yunsilu.net)是一个专注SEO与GEO实战的技术博客,由一群还在跟搜索引擎和AI爬虫死磕的老站长维护。我们聊技术,也聊这个行业的生存法则。
常见问题
Q1: AI爬虫占网站爬虫流量的比例是多少?
根据Ahrefs在2024年发布的爬虫流量分析报告,全球排名前100万的网站中,AI爬虫产生的请求量已经占到总爬虫流量的28%左右。也就是说,每四个爬虫请求里,就有一个是来抓取内容喂给AI的。
Q2: 普林斯顿大学对Common Crawl数据集做了什么研究?
普林斯顿大学2024年的一项研究追踪了Common Crawl数据集(几乎所有主流大模型的训练数据来源之一)的构成变化,发现从2020年到2024年,该数据集中来自头部网站的内容占比发生了显著变化,说明AI训练数据正在大规模吸纳各类网站的内容。
Q3: 站长面对AI爬虫抓取内容该怎么办?
文章指出,尽管微软高管将AI爬虫定性为「人类历史上最大规模的劳动盗窃」,但骂归骂,爬虫不会因此停止。站长需要搞清楚这件事对靠内容吃饭的人意味着什么,以及接下来该如何应对和生存。