8月28日,腾讯混元团队发布了Hy4 preview并同步开源。一周后,这个总参数770B、激活参数49B的MoE大模型,以14.7万亿Token的周调用量登顶OpenRouter全球第一,环比增长379%。
中国AI大模型的整体调用量已经连续19周超过美国,稳居全球首位。而在这份榜单的前五名中,有四款是中国模型:Hy4 preview、GPT-5.6 Luna、智谱GLM-5.3 Flash、DeepSeek V4 Flash。
做GEO的人,不应该只看个热闹。这组数据背后,有三个信号值得认真拆解。
信号一:国产大模型的实际渗透速度,远超预期
14.7万亿Token是什么概念?简单说,这相当于全球开发者在一周内用Hy4处理了海量的代码、文档、问答和Agent任务。而且这不是实验室数据,是真实的API调用量——有人在用它干活。
更值得注意的是,Hy4从发布到登顶只用了一周。这种渗透速度意味着:国产大模型已经不是"备选",而是很多团队的首选。
对GEO业务来说,这直接影响两个事情:第一,你的AI内容生产引擎接入哪家模型,决定了内容质量和成本;第二,你帮客户监测"AI怎么看你的品牌",需要覆盖的模型列表越来越长了。
信号二:模型能力趋同,策略选择比模型选择更重要
腾讯内部组织了163名专家,在203个工程任务上做了盲测。结果:Hy4均分2.99/4.00,GLM-5.3是2.92,Kimi K3是2.94。注意,这是腾讯自己的专家、评自己的任务——即便这样,Hy4对GLM-5.3的胜率也只有46.8%,对Kimi K3的胜率是51.2%。
换句话说,头部模型之间的能力差距已经缩小到了"噪音"级别。
这意味着什么?对GEO从业者来说,押注单一模型的风险越来越大。你今天用DeepSeek写的内容,和用Hy4、GLM写的内容,质量差异可能没你想象的大。真正拉开差距的,不是选哪个模型,而是你的提示词工程、知识注入策略和内容后处理流程。
这也正是我们做YunSilk AI Visibility Score时坚持多模型监测的原因——不是某一个AI说了算,而是你的品牌在多个AI回答中的表现综合决定了你的"AI可见性"。
信号三:推理成本持续下降,自动化内容生产的ROI正在翻正
Hy4的API定价:输入6元/百万Token,输出18元/百万Token。对比GPT-5.6 Luna的海外定价,便宜了一个量级。9月1日,腾讯还推出了轻量版,把1.5TB的模型权重压缩到214GB,本地部署门槛进一步降低。
对做GEO自动化内容生产的人来说,这组数字很关键:
- 一篇800字的GEO优化文章,用Hy4生成大约消耗2000-3000 Token输入 + 1500 Token输出
- 成本约0.015元/篇(不到2分钱)
- 加上模型调用费和后处理,综合成本在0.05-0.1元/篇
当生产成本降到这个水平,规模化生产就不再是"能不能做"的问题,而是"怎么做好"的问题。
9月7日更新:Hy4又优化了
就在今天(9月7日),腾讯混元和WorkBuddy联合团队发布了优化公告:针对用户反馈的"复杂任务长思考、过度自我验证"问题做了专项修复,在不损失效果的前提下,显著降低了任务轮次和Token消耗。
这个迭代速度也说明了一件事:模型不是发完就完了,后续的优化节奏会越来越快。对GEO从业者来说,你的模型策略也需要跟着迭代,不能一成不变。
写在最后
Hy4登顶不只是一个模型的成功,它反映的是一个趋势:AI基础设施正在以前所未有的速度普及。对GEO行业来说,这不是威胁,而是机会——当AI的渗透率越来越高,"品牌在AI回答中的可见性"就从一个新概念变成了一个刚需。
问题是:你准备好了吗?