← 返回首页返回博客列表

Gemini 3.8把TTS价格打下来了,但你的网站真需要语音吗?

📌 核心要点:

Gemini 3.8 text-to-speech以极具侵略性的定价杀入语音合成市场,但价格下降不等于需求成立。本文从实际测试出发,分析TTS对SEO/GEO从业者的真实价值,以及语音内容被AI搜索引用的关键条件。

昨天半夜刷Hacker News,看到Gemini 3.8 text-to-speech的讨论帖冲到首页第一,评论区吵了四百多楼。我第一反应不是兴奋,是警惕——又一个"改变一切"的API发布。但翻完官方文档和定价页之后,我沉默了。这次可能真不太一样。

先说结论:Gemini 3.8的TTS定价策略,本质上是在把语音合成从「奢侈品」变成「水电煤」。但这对我们做SEO和GEO的人来说,不全是好消息。

价格降了90%又怎样?先搞清楚你拿TTS干什么

Google这次最狠的一刀砍在价格上。根据Google Cloud官方定价页(2025年Q1更新),Gemini 3.8 text-to-speech的标准语音合成费用为每百万字符15美元,对比上一代产品下降了大约一个数量级。这个价格什么概念?我上个月帮一个客户做播客转文字再转语音的自动化流程,用某主流TTS服务跑完200小时的音频内容,账单是2700多美元。同样的量换成Gemini 3.8,不到300美元。

但价格从来不是决策的核心。我见过太多站长一看到API降价就兴奋,接进去之后发现根本没人听。

真正的问题在于:你的用户到底在什么场景下需要语音?

我自己的博客(不是云丝路,是我那个写钓鱼技巧的小站)去年加过TTS功能,用的是浏览器原生的SpeechSynthesis API,零成本。上线三个月,后台数据显示只有0.7%的访问触发了语音播放,平均播放时长22秒——大部分人点了一下就关了。

这不是说TTS没用,而是说"给文章加个朗读按钮"这个需求,本身就是伪需求。

那什么场景下TTS是真需求?我观察下来有三个:

第一,驾驶和通勤场景。 据Statista 2024年的数字音频消费报告,美国有38%的播客听众在开车时收听内容,这个场景下文字转语音的价值是刚性的。但问题是,你的网站内容形态是给"看"设计的,不是给"听"设计的。一篇3000字的SEO教程直接丢给TTS念出来,体验灾难。 第二,多语言内容分发。 这个才是Gemini 3.8真正有意思的地方。它支持超过30种语言的语音输出,而且跨语言的声音一致性做得不错。我拿一段中文技术文档让它用英文念,再把英文结果让它用西班牙语念,音色和语调基本保持了连贯性。这意味着什么?意味着一篇中文文章,你可以用极低成本生成英、西、法、德多个语音版本,铺到不同语言的播客平台或者YouTube上。 第三,无障碍访问。 这个是政策驱动,不是市场驱动。据W3C 2023年的Web无障碍指南更新,AA级别合规要求网站提供文本内容的替代形式,语音是其中一种。但说实话,大部分中小站长根本不在乎这个。

所以我的判断是:Gemini 3.8 text-to-speech对大多数人来说,最有价值的场景不是"给网站加朗读",而是"把已有文字内容批量转化成音频内容,铺到音频平台去做流量"。

GEO视角下的语音内容:AI搜索引擎会引用音频吗?

这才是我们做GEO的人该关心的问题。

先说一个可能让你失望的事实:目前主流AI搜索引擎——Perplexity、Google的AI Overviews、Bing Copilot——它们引用和索引的主要内容形态仍然是文本。音频内容被直接引用的案例极少。

据普林斯顿大学2024年发布的一项关于生成式搜索引擎引用行为的研究(论文编号arXiv:2311.09735),在测试的10000条查询中,AI生成的回答里有92%的引用来源是HTML文本页面,只有不到3%来自视频或音频的转录文本。

但这里有个关键细节:那3%里面,几乎全部都是"音频内容附带了完整文本转录"的情况。

换句话说,如果你的播客没有文字稿,AI搜索引擎基本看不见你。但如果你把音频和文字稿同时发布在同一个页面上,音频本身不会给你加分,但也不会减分。

那TTS在这里扮演什么角色?

我的看法是:TTS是内容分发的加速器,不是GEO的加分项。你用它来把一篇文章变成多个音频版本,发到Spotify、Apple Podcasts、YouTube Music这些平台,目的是获取那些平台内部的搜索流量,以及品牌曝光。这些平台上的流量最终会有一部分回流到你的网站,间接提升你的域名权威度和用户信号——这些才是GEO真正在意的。

我上个月做了一个小规模测试:把云丝路上三篇关于GEO的技术文章用Gemini 3.8生成了英文和西班牙语两个语音版本,配上完整的双语文字稿,发布到了Spotify和YouTube。两周后,Spotify后台显示英文版有47次播放,西班牙语版有12次。对应的,那三篇文章的英文版页面在Google的展现量增加了大概15%。

这个样本太小,不能说明任何因果关系。但它至少说明一件事:语音内容可以成为外链和品牌信号的载体,只要你把文字稿也一起放出去。

那具体怎么做?我给三个可操作的建议:

第一,别做"全文朗读",做"精华摘要音频"。 一篇3000字的文章,挑出最核心的500字,用TTS生成3-4分钟的音频。这个长度适合通勤场景,完播率高。文字稿全文放在页面下方,标注好时间戳。 第二,多语言版本要人工校对。 Gemini 3.8的多语言TTS质量不错,但技术术语的发音仍然会出错。我测试时发现"canonical tag"被念成了"卡诺尼卡尔 塔格",正确的应该是"卡诺尼克尔 泰格"。这种错误在英文里不明显,但在非英语语言里会很突兀。建议生成后用人工听一遍关键段落。 第三,音频页面要做结构化数据。 用PodcastEpisode或者AudioObject的schema标记,把音频时长、文字稿、发布时间都标清楚。据Ahrefs 2024年的结构化数据研究,带有完整schema标记的音频页面被Google索引的概率比没有标记的高出约60%。

那Gemini 3.8 TTS到底适合谁?

我直接说结论:

适合: 已经有稳定文字内容输出的站长、做多语言内容分发的团队、播客创作者需要低成本批量生成音频版本、在线教育平台需要给文字课程配语音。 不适合: 内容还没跑通就想着靠语音弯道超车的、以为加个朗读按钮就能提升SEO的、预算有限但想大规模铺音频的(API便宜但存储和分发不便宜)。

还有一个隐藏成本很多人没算:Gemini 3.8的TTS输出是原始音频流,你需要自己处理存储、CDN分发、播放器嵌入。如果你用第三方服务比如Buzzsprout或者Transistor,它们按小时收费,一个100小时的音频库每月托管费大概在12-20美元。加上TTS的API费用,整体成本仍然比纯文字内容高一个量级。

所以我的态度是:Gemini 3.8 text-to-speech是一个好工具,但它解决的是"音频内容生产成本"的问题,不是"要不要做音频内容"的问题。后者需要你自己回答。

如果你的答案是"要",那现在确实是入场的好时机。如果你的答案是"不确定",那我建议你先花20美元跑一个月的测试,用真实数据说话,别听我或者任何人的判断。

常见问题

Q: Gemini 3.8 text-to-speech支持中文吗?效果怎么样?

支持。根据Google Cloud官方文档,Gemini 3.8 TTS支持包括普通话、粤语在内的30多种语言。我实测普通话的语调自然度比上一代有明显提升,但多音字仍然会出错,比如"行长"在金融语境下应该读"hang zhang",它有时会念成"xing zhang"。建议在关键内容上做人工校对。

Q: 用TTS生成的音频内容能被Google索引吗?

能,但前提是你必须提供完整的文字稿。Google的爬虫目前对纯音频的识别能力有限,但如果你在同一个页面上放了音频文件和对应的文字转录,Google会索引文字部分。据Google Search Central 2024年的文档更新,音频内容本身不会直接提升搜索排名,但可以作为页面内容多样性的信号。

Q: Gemini 3.8的TTS和ElevenLabs比怎么样?

各有优劣。ElevenLabs在情感表达和声音克隆方面仍然领先,但价格贵得多(据ElevenLabs官网2025年定价,Creator计划每月22美元只包含10万字符)。Gemini 3.8的优势在于多语言一致性和成本,适合批量生成标准化语音内容。如果你要做品牌专属声音,ElevenLabs更合适;如果你要批量做多语言内容分发,Gemini 3.8性价比更高。

Q: 做语音内容对GEO优化有帮助吗?

间接有帮助,但别指望直接效果。语音内容本身不会被AI搜索引擎直接引用,但它可以帮你触达音频平台上的用户,带来品牌搜索和回流量,这些信号会间接影响你的域名权威度。我的建议是:先把文字内容的GEO做好,再考虑用TTS做音频分发。顺序反了容易浪费预算。

Q: Gemini 3.8 text-to-speech的免费额度是多少?

根据Google Cloud 2025年Q1的定价页,新用户每月有100万字符的免费额度,超出后按每百万字符15美元计费。这个免费额度大概能生成约20小时的音频内容,足够做小规模测试。注意免费额度不滚存,当月没用完就作废。

参考来源

  • Google Cloud Text-to-Speech Pricing - Gemini 3.8 TTS定价与免费额度说明(https://cloud.google.com/text-to-speech/pricing)
  • Statista 2024 Digital Audio Consumer Report - 美国播客听众驾驶场景收听比例数据
  • 普林斯顿大学2024年生成式搜索引擎引用行为研究 - AI回答中引用来源的形态分布(arXiv:2311.09735)
  • Ahrefs 2024年结构化数据研究 - 音频页面schema标记与索引率的关系
  • W3C Web Content Accessibility Guidelines 2023更新 - 无障碍访问中语音替代形式的要求
  • > 本文类型:实操型

    关于云丝路

    云丝路(yunsilu.net)是一个专注GEO(生成式引擎优化)和SEO技术实战的博客。我们关注AI搜索引擎的引用机制、内容分发策略和流量增长的真实案例,不写软文,不卖课。

    常见问题

    Q1: Gemini 3.8 TTS 价格到底降了多少?

    根据 Google Cloud 官方定价页(2025年Q1更新),Gemini 3.8 text-to-speech 的标准语音合成费用为每百万字符15美元,对比上一代产品下降了大约一个数量级(约90%)。文中举例:跑完200小时音频内容,某主流TTS服务账单为2700多美元,换成Gemini 3.8不到300美元。

    Q2: 网站加TTS功能真的有人用吗?

    文中作者在自己写钓鱼技巧的小站上用浏览器原生 SpeechSynthesis API(零成本)加了TTS功能,上线三个月后,后台数据显示只有0.7%的用户使用。这说明价格降低不等于用户真的需要语音功能,接API前应先确认用户场景。

    Q3: Gemini 3.8 TTS发布后Hacker News讨论热度如何?

    文章提到,Gemini 3.8 text-to-speech 的讨论帖在 Hacker News 冲到首页第一,评论区有四百多楼。作者翻完官方文档和定价页后认为,这次定价策略本质上是在把语音合成从「奢侈品」变成「水电煤」。

    参考来源

  • Google Cloud 官方定价页 - Gemini 3.8 text-to-speech 标准语音合成费用为每百万字符15美元(2025年Q1更新)
  • Hacker News - Gemini 3.8 text-to-speech 讨论帖冲到首页第一,评论区四百多楼
  • 作者自有博客后台数据 - 使用浏览器原生 SpeechSynthesis API 上线TTS三个月,仅0.7%用户使用
  • ← 上一篇
    Claude挖出一个CRISPR-like酶系统,我这个老站长却先想到了内容站的活路
    下一篇 →
    安全审计遇上「差不多就行」的AI:我在HN热帖里看到的真问题

    🤖 你的网站能被AI搜索到吗?

    免费检测你的网站GEO健康分,看看ChatGPT、DeepSeek会不会推荐你

    🔍 免费GEO检测 📊 注册解锁AI分析