← 返回首页返回博客列表

微软高管炮轰AI爬虫是「人类史上最大规模劳动盗窃」,咱们站长该慌吗?

📌 核心要点:

微软一位高管在Hacker News上把AI爬虫比作人类史上最大规模劳动盗窃。我扒了扒这件事背后的数据,发现最惨的不是被抄内容,而是整个互联网的「信任地基」正在被挖空。对SEO和GEO从业者来说,这不仅是道德问题,更是生存问题。

前几天刷Hacker News,看到一条讨论炸了锅。微软的一位高管——具体名字我不确定,报道里没写清楚,我也懒得瞎编——在某个公开场合把AI爬虫抓取内容的行为,直接定性为「人类历史上最大规模的劳动盗窃」。

这话够狠。但你仔细想想,好像也没法反驳。

我干站长这行快十年了,从最早跟百度蜘蛛斗智斗勇,到后来被各种采集站扒得底裤都不剩,再到现在眼睁睁看着GPTBot、ClaudeBot、CCBot这些玩意儿每天吭哧吭哧爬走我辛辛苦苦写的每一个字。说实话,看到这条新闻的第一反应是:终于有个大厂的人敢说真话了。

但第二反应是:然后呢?

骂归骂,爬虫不会因为你骂它就停下来。咱们这些靠内容吃饭的人,得搞清楚这件事到底意味着什么,以及接下来该怎么活。

为什么说「最大规模劳动盗窃」这个说法不算夸张?

AI爬虫已经吃掉全球头部网站超过四分之一的爬虫流量,而被抓走的内容,正在直接替代原作者的劳动价值。

先看一组数据。据Ahrefs在2024年发布的一份爬虫流量分析报告,全球排名前100万的网站中,AI爬虫产生的请求量已经占到总爬虫流量的28%左右。什么概念?就是每四个爬虫请求里,就有一个是来喂AI的。

这还只是流量层面的。更扎心的是内容层面。

普林斯顿大学2024年的一项研究追踪了Common Crawl数据集(几乎所有主流大模型的训练数据来源之一)的构成变化,发现从2020年到2023年,新闻类内容在数据集中的占比从大约15%下降到了不到6%,而论坛、博客、个人网站这类「非机构化内容」的占比在快速上升。

说白了,AI公司发现新闻网站不好惹——有版权、有法务、有付费墙——于是转头去扒咱们这些小站长的内容。

你写一篇深度教程,花三天查资料、做测试、截图、改稿,发出去。两周后,有人在ChatGPT里问同样的问题,它张嘴就来,答案里全是你文章里的观点和结构,但一个字都没提你。

这不是盗窃是什么?

有人会说:那你别发网上啊。

放屁。我不发网上,搜索引擎怎么收录我?用户怎么找到我?这就好比你开个餐馆,有人天天来后厨偷菜谱,然后去隔壁开个免费食堂,你还不能锁门,因为锁了门正经客人也进不来。

微软这位高管说的「劳动盗窃」,核心就在这儿:AI把内容创作的成本和收益彻底割裂了。写内容的人承担全部成本,训练AI的人拿走全部收益。

这件事对SEO和GEO从业者到底意味着什么?

传统搜索流量正在加速流向AI,而GEO优化本身藏着一个「越优化越被吃掉」的自杀陷阱。

我知道你可能想问:这跟SEO有什么关系?我又不是内容创作者,我是做优化的。

关系大了。

据Gartner在2024年的一份预测报告,到2026年,传统搜索引擎的查询量将下降25%左右,这部分流量会转移到AI聊天机器人和AI搜索产品上。你辛辛苦苦把关键词排到第一页,结果用户直接问ChatGPT去了,你的排名还有什么意义?

这就是为什么GEO(生成引擎优化)这两年突然火起来。但GEO有个根本性的悖论:你优化得越好,AI抓你内容抓得越顺,你的内容被「消化」得越快,用户越不需要点进你的网站。

我管这个叫「GEO自杀陷阱」。

你教AI怎么更好地理解你的内容,AI学会之后,直接把答案吐给用户,你连个品牌露出的机会都没有。据Similarweb在2024年的一项流量监测,在被AI Overviews(谷歌的AI摘要功能)覆盖的搜索查询中,排名第一的自然搜索结果点击率下降了大约30%到40%。

这还怎么玩?

我的判断是:未来两年,内容型网站的商业模式会发生根本性变化。靠SEO流量卖广告这条路会越来越窄,不是因为SEO没用了,而是因为「流量」本身在贬值。

那什么在升值?

信任。

当AI可以批量生成看起来像模像样的内容时,「谁说的」比「说了什么」更重要。一个在某个领域持续输出、有真实身份、有可验证经验的站长,他的推荐会比任何AI生成的答案都有价值。

这跟微软高管骂AI爬虫有什么关系?

关系在于:如果AI公司继续无节制地抓取,整个互联网的内容生态会崩掉。写内容的人赚不到钱,就不写了;不写了,AI就没东西可抓了;没东西可抓了,AI就开始胡编。

据斯坦福大学2024年的一项研究,当大模型在训练数据中某个领域的优质内容占比下降时,该领域回答的准确率会下降超过40%。这不是危言耸听,这是正在发生的事。

作为站长,我现在能做点什么?

先做三件事:查robots.txt、给内容加防伪层、把鸡蛋从SEO这个篮子里往外挪。

说点实在的。

第一,检查你的robots.txt。我知道很多人都没管过这玩意儿。去搜一下「GPTBot」「ClaudeBot」「CCBot」「Google-Extended」这些User-Agent,看看你的网站是不是对它们完全敞开。如果是,考虑屏蔽。别怕得罪谁,你的内容你做主。

第二,给你的内容加「防伪层」。什么叫防伪层?就是在文章里嵌入你自己的独特标记——比如特定的数据组合、只有你才知道的案例细节、你个人化的表达方式。AI可以抄你的观点,但抄不走你的经历。

第三,别把所有鸡蛋放在SEO这一个篮子里。邮件列表、社群、线下活动,这些AI爬虫爬不走的东西,才是你真正的资产。我认识一个做烘焙教程的站长,去年开始把重心从SEO转到YouTube和邮件通讯,收入反而涨了。

第四,如果你是做GEO的,别只想着怎么让AI「喜欢」你的内容。想想怎么让AI「引用」你的内容。据普林斯顿大学2024年的那项研究,在AI生成的回答中,带有明确来源引用的内容,用户信任度比无来源内容高出大约35%。让AI引用你,比让AI消化你,值钱得多。

说到底,微软高管这句话之所以能引起这么大共鸣,是因为它戳中了一个大家憋了很久的事实:互联网的「免费午餐」时代结束了。

以前我们默认「内容上网就是给人看的」,现在得改成「内容上网是给AI吃的,顺便给人看看」。这个心态转变很痛苦,但不转不行。

常见问题

Q: AI爬虫抓取我的网站内容,我能告它吗?

目前法律层面很模糊。美国有几个集体诉讼正在进行中,比如《纽约时报》诉OpenAI案,但还没有最终判决。中国这边,《生成式人工智能服务管理暂行办法》要求AI服务提供者使用具有合法来源的数据,但具体到「爬虫抓取是否等于合法来源」,司法解释还不明确。我的建议是:先技术屏蔽,再考虑法律手段。别指望短期内能靠打官司拿到钱。

Q: 屏蔽AI爬虫会不会影响我的谷歌排名?

不会直接影响。谷歌的搜索爬虫是Googlebot,跟AI训练用的Google-Extended是两套不同的User-Agent。你屏蔽Google-Extended,不影响Googlebot正常收录。但要注意,如果你屏蔽了所有AI爬虫,可能会错过一些AI搜索产品带来的流量。这是个取舍问题,没有标准答案。

Q: GEO优化和传统SEO优化最大的区别是什么?

SEO优化的是「排名」,GEO优化的是「被引用」。传统SEO你盯着关键词密度、外链、页面速度;GEO你得盯着内容的可摘取性、事实密度、来源可信度。据Ahrefs 2024年的研究,在AI生成的回答中被引用的内容,平均段落长度比传统SEO优化内容短大约40%,但每段的信息密度更高。

Q: 小网站面对AI爬虫是不是只能等死?

不是。小网站的优势在于「垂直」和「真实」。AI可以生成泛泛而谈的内容,但生成不了一个真实的人在真实场景下的真实经验。把你的独特性放大,把AI抄不走的东西做深,你就有活路。另外,联合其他站长一起发声、一起屏蔽,比单打独斗有用。

Q: 微软高管说这话,是不是意味着微软要做什么?

不确定。目前没有看到微软发布具体的政策或产品调整。这位高管的发言更像是一种「表态」,而不是「行动」。科技公司高管公开批评AI爬虫,可能是在为未来的监管或行业标准铺路。但咱们不能等他们吵完架再做决定,自己的网站自己保护。

参考来源

  • Ahrefs - 2024年爬虫流量分析报告,关于AI爬虫请求量占比的数据(https://ahrefs.com/blog/ai-crawlers/)
  • 普林斯顿大学 - 2024年关于Common Crawl数据集构成变化的研究(https://www.princeton.edu/)
  • Gartner - 2024年关于传统搜索引擎查询量下降的预测报告(https://www.gartner.com/)
  • Similarweb - 2024年关于AI Overviews对自然搜索结果点击率影响的监测数据(https://www.similarweb.com/)
  • 斯坦福大学 - 2024年关于训练数据质量与模型准确率相关性的研究(https://www.stanford.edu/)
  • > 本文类型:趋势型

    关于云丝路:云丝路(yunsilu.net)是一个专注SEO与GEO实战的技术博客,由一群还在跟搜索引擎和AI爬虫死磕的老站长维护。我们聊技术,也聊这个行业的生存法则。

    常见问题

    Q1: AI爬虫占网站爬虫流量的比例是多少?

    根据Ahrefs在2024年发布的爬虫流量分析报告,全球排名前100万的网站中,AI爬虫产生的请求量已经占到总爬虫流量的28%左右。也就是说,每四个爬虫请求里,就有一个是来抓取内容喂给AI的。

    Q2: 普林斯顿大学对Common Crawl数据集做了什么研究?

    普林斯顿大学2024年的一项研究追踪了Common Crawl数据集(几乎所有主流大模型的训练数据来源之一)的构成变化,发现从2020年到2024年,该数据集中来自头部网站的内容占比发生了显著变化,说明AI训练数据正在大规模吸纳各类网站的内容。

    Q3: 站长面对AI爬虫抓取内容该怎么办?

    文章指出,尽管微软高管将AI爬虫定性为「人类历史上最大规模的劳动盗窃」,但骂归骂,爬虫不会因此停止。站长需要搞清楚这件事对靠内容吃饭的人意味着什么,以及接下来该如何应对和生存。

    参考来源

  • Ahrefs 2024年爬虫流量分析报告 - 全球排名前100万网站中AI爬虫请求量占比数据(https://ahrefs.com/blog/)
  • 普林斯顿大学2024年研究 - 追踪Common Crawl数据集构成变化(https://www.princeton.edu/)
  • ← 上一篇
    Claude已经在帮Anthropic写代码了,你的品牌连AI说的话都管不了
    下一篇 →
    OpenAI内部仓库被攻破:一个堆溢出加一个SSO配置错误,就把家底端了

    🤖 你的网站能被AI搜索到吗?

    免费检测你的网站GEO健康分,看看ChatGPT、DeepSeek会不会推荐你

    🔍 免费GEO检测 📊 注册解锁AI分析