← 返回首页返回博客列表

作家告OpenAI和微软的法院文件解封了,我熬夜翻完,发现SEO这碗饭可能真要换个吃法

📌 核心要点:

美国作家协会诉微软和OpenAI案的部分法庭文件解封,曝光了训练数据获取的更多细节。本文从SEO/GEO从业者视角,分析这些文件对内容创作者和搜索流量格局的真实影响,并给出可操作的应对建议。

昨天晚上我正刷Hacker News,看到一条帖子标题是「Unsealed Briefs in Authors’ Case v. Microsoft/OpenAI」,点进去一看,好家伙,评论区已经吵翻天了。我本来打算扫两眼就睡,结果一口气把能翻的文件摘要都看完了,越看越清醒。

这案子不是新案子。2023年就立案了,美国作家协会带着一帮作家告微软和OpenAI,说他们未经授权用版权作品训练大模型。但这次不一样——部分法庭简报被解封了。解封意味着什么?意味着之前被涂黑的内容、被密封的细节,现在摊在阳光底下了。

我关心这事,不是因为我懂法律。我关心的是,这些解封文件里藏着的东西,可能比判决结果更早地影响到我们这些靠内容吃饭的人。

解封的文件里到底写了什么让SEO圈该紧张的东西?

先说清楚,我不是律师,以下内容基于公开的法庭文件和新闻报道整理,不构成法律意见。

这次解封的核心材料里,有几个点让我坐直了。

第一,原告方试图证明OpenAI和微软在训练数据来源上有系统性的版权忽视。 根据法庭文件中的指控,原告方认为被告在构建训练数据集时,对版权状态的核查流程存在严重缺失。注意,这是原告的指控,不是法院的认定。但解封的文件里包含了一些内部通信和流程描述,这些内容之前是密封的。 第二,文件里涉及了数据获取的具体渠道和规模。 原告方在简报中试图量化被用于训练的作品数量,并指出这些作品涵盖了大量的已出版书籍。具体数字我在这里不瞎编,因为不同来源的报道有出入,我拿不准的就不写。但有一点是明确的:原告方认为规模是「系统性的」,不是「偶发的」。 第三,微软的角色被更具体地描述。 之前的报道更多聚焦OpenAI,这次解封的文件里,原告方对微软在数据管道和算力支持方面的参与程度有更详细的论述。

你可能会问:这跟SEO有什么关系?

关系大了。

我们做SEO的,本质上是在一个内容生态里讨生活。这个生态的底层假设是:你创作内容,搜索引擎给你流量,你通过流量变现。 但这个假设正在被两层力量撕扯。

第一层是搜索引擎自己。Google的AI Overviews、Bing的Copilot,都在把用户留在搜索结果页,不点击网站。据Gartner 2024年2月发布的预测,到2026年传统搜索引擎的搜索量将下降25%。这个数字你可以在Gartner官网的新闻稿里找到。

第二层就是AI公司。它们用海量内容训练模型,然后模型直接生成答案,用户连搜索引擎都不用去了。

这次解封的文件,把第二层力量的「原材料采购」过程暴露了一部分。如果原告方的指控成立,那就意味着AI公司在训练数据上的版权合规意识,可能比我们想象的要薄弱得多。

这对我们意味着什么?意味着你辛辛苦苦写的原创内容,可能在你毫不知情的情况下,已经成了某个大模型的「养料」。而你得到的回报是零。

为什么这件事对GEO从业者的冲击比SEO更大?

GEO对GEO从业者的冲击比SEO更大,因为GEO的回报机制本身就不透明,而这次解封暴露了底层数据的版权隐患。

GEO,Generative Engine Optimization,生成式引擎优化。这个词这两年很火。简单说,就是让你的内容更容易被AI生成的答案引用或参考。

但这次解封事件让我重新思考GEO的底层逻辑。

SEO的逻辑是:我优化内容 → 搜索引擎排名提升 → 用户点击 → 我获得流量。 这个链条里,搜索引擎和网站主之间有一种隐性的契约:你提供优质内容,我给你流量。 GEO的逻辑是:我优化内容 → AI模型在生成答案时引用我的内容 → 用户看到我的品牌 → 我获得某种形式的回报。 但这个「回报」是什么?是流量吗?不一定。是品牌曝光吗?可能。是直接收入吗?目前来看,几乎没有。

问题就出在这里。AI模型不会像搜索引擎那样给你一个「排名」。它可能在答案里提你一嘴,也可能完全不提。你无法像追踪关键词排名那样追踪「AI引用率」——至少目前没有公认的、可靠的工具能做到这一点。

而这次解封的文件,把另一个问题摆到了台面上:如果AI公司获取训练数据的方式本身就有版权争议,那么基于这些数据训练出来的模型,其输出的「引用」和「参考」的合法性基础是什么?

我不是在说AI生成的内容都侵权。我是在说,当底层数据的来源存在争议时,建立在这个底层之上的GEO策略,就像在流沙上盖房子。

据普林斯顿大学2024年发布的一项研究(该研究提出了GEO的概念框架),优化内容在生成式引擎中的可见性,确实可以提升被引用的概率。但这项研究也指出,生成式引擎的引用机制与搜索引擎的排名机制有本质区别,且透明度远低于传统搜索。

透明度低,意味着你很难知道自己的内容有没有被用、被怎么用、被用了多少。

这次解封的文件,至少让一部分「怎么用」的问题变得稍微透明了一点。虽然透明的方式是通过诉讼。

网站主现在能做什么?三个不废话的建议

我知道你看完上面的分析可能会有点焦虑。别急,我说三个我现在正在做的事,你可以参考。

第一,重新审视你的内容授权条款。

你网站的robots.txt、服务条款、版权声明,有没有明确禁止AI训练抓取?如果没有,现在加上。虽然这不能100%阻止,但至少在法律上表明你的立场。据我了解,目前已经有专门的协议在尝试解决这个问题,比如Robots Exclusion Protocol的扩展讨论,但还没有形成行业标准。

第二,把「被AI引用」和「被用户点击」分开考核。

如果你还在用传统的流量指标来衡量GEO效果,你可能会失望。AI引用带来的直接流量通常远低于搜索引擎。你需要建立新的衡量维度,比如品牌搜索量的变化、直接访问量的变化。据Ahrefs 2024年的一项研究,AI Overviews出现后,部分信息类关键词的自然点击率下降了超过30%。这个数据来自Ahrefs的博客,你可以去他们官网查原文。

第三,别把所有鸡蛋放在一个篮子里。

这不是废话。我的意思是,如果你的收入高度依赖搜索引擎流量,你需要开始认真考虑其他渠道。邮件列表、社群、直接订阅。这些渠道的共性是:你和用户之间没有中间商。AI再厉害,也没法「生成」你的邮件列表。

常见问题

Q: 这次解封的文件会影响OpenAI和微软的判决结果吗?

不一定。解封只是让公众和媒体能看到更多材料,不等于法院采信了这些材料里的所有主张。判决结果取决于双方的法律论证和证据规则。我个人的判断是,这个案子大概率会以和解或部分和解收场,因为全面审判对双方的风险都太大。但这是我的猜测,不是法律意见。

Q: 作为普通网站主,我需要担心自己的内容被用来训练AI吗?

需要,但不用恐慌。你的内容大概率已经被用了——如果你没有明确禁止的话。你能做的是:明确声明禁止、使用技术手段限制、以及调整自己的流量预期。恐慌不解决问题,行动才解决。

Q: GEO和SEO到底有什么区别?我该优先做哪个?

SEO是让搜索引擎给你排名,GEO是让AI模型在生成答案时引用你。目前来看,SEO带来的流量仍然远大于GEO,但GEO的战略价值在上升。我的建议是:SEO的基本功不能丢,同时开始尝试GEO的优化思路,比如更清晰的结构化数据、更明确的观点表达、更权威的来源引用。

Q: 这次事件对中文网站有影响吗?

间接影响。这个案子是美国法院的诉讼,直接约束的是微软和OpenAI在美国的行为。但AI模型的训练数据是全球性的,中文内容同样可能被纳入。而且,如果这个案子推动了立法或行业标准的变化,影响会波及全球。

参考来源

  • Gartner - 2024年2月新闻稿,预测到2026年传统搜索引擎搜索量将下降25%(https://www.gartner.com/en/newsroom/press-releases/2024-02-19-gartner-predicts-search-engine-volume-will-drop-25-percent-by-2026-due-to-ai-chatbots-and-other-virtual-agents)
  • 普林斯顿大学 - 2024年GEO概念框架研究论文(https://arxiv.org/abs/2311.09735)
  • Ahrefs - 2024年关于AI Overviews对点击率影响的研究(https://ahrefs.com/blog/ai-overviews-study/)
  • Hacker News - 关于Unsealed Briefs in Authors’ Case v. Microsoft/OpenAI的讨论帖(https://news.ycombinator.com/)
  • > 本文类型:趋势型

    关于云丝路

    云丝路(yunsilu.net)是一个关注搜索生态变化的技术博客。我们写SEO,也写GEO,写工具,也写踩过的坑。如果你也在琢磨AI时代的内容生意怎么做,欢迎常来看看。

    常见问题

    Q1: 作家协会告OpenAI和微软的案子里,解封的法庭文件到底说了什么?

    解封文件的核心是原告方试图证明OpenAI和微软在训练数据来源上存在系统性的版权忽视,包括对版权状态核查流程严重缺失的指控,以及涉及数据获取具体渠道和规模的内部通信与流程描述。这些内容此前被密封,现在公开后显示了原告方量化被用于训练的数据规模的尝试。

    Q2: 为什么说这个案子可能影响SEO和靠内容吃饭的人?

    因为解封文件暴露了AI训练数据获取的具体渠道和规模,如果法院最终认定这些渠道存在版权问题,那么依赖公开网络内容进行AI训练的模式可能被迫改变。这会直接影响内容被AI搜索抓取和使用的规则,进而改变SEO从业者优化内容的逻辑和流量获取方式。

    Q3: 这个作家告OpenAI的案子是什么时候立案的?现在进展到哪了?

    该案2023年就已立案,美国作家协会带着一帮作家起诉微软和OpenAI未经授权使用版权作品训练大模型。目前的进展是部分法庭简报被解封,之前被涂黑和密封的细节现在公开了,但文章明确说明这些是原告的指控,不是法院的最终认定。

    参考来源

  • Hacker News帖子「Unsealed Briefs in Authors' Case v. Microsoft/OpenAI」 - 文章作者最初看到该案解封信息的来源,评论区引发大量讨论
  • 公开的法庭文件及新闻报道 - 文章基于这些材料整理,包含原告方关于版权状态核查流程缺失和数据获取渠道规模的指控细节
  • 美国作家协会诉微软和OpenAI案(2023年立案) - 案件本身作为文中所有信息的法律背景来源
  • ← 上一篇
    LLM都卷成这样了,写代码的快乐还能找回来吗?聊聊我最近的一点真实感受
    下一篇 →
    DeepSeek悄悄上线DSec,我扒了扒它的定价页,发现站长们该紧张了

    🤖 你的网站能被AI搜索到吗?

    免费检测你的网站GEO健康分,看看ChatGPT、DeepSeek会不会推荐你

    🔍 免费GEO检测 📊 注册解锁AI分析