← 返回首页返回博客列表

开源大模型核爆周:K3登顶代码榜首 + V4百万上下文屠价,AI竞争进入下半场

📌 核心要点:

2026年7月,Kimi K3以2.8万亿参数登顶全球代码竞技场第一,DeepSeek V4将百万token上下文打入全系标配并引入峰谷定价。两大开源模型的双重冲击正在彻底改写AI竞争格局。

开源AI在2026年7月经历了一场前所未有的地震级事件。7月17日,月之暗面发布Kimi K3——2.8万亿参数的全球最大开源模型,在伯克利前端代码竞技场以1679分登顶全球第一;7月底,DeepSeek V4正式版蓄势待发,将百万token上下文打入全系标配,同时引入峰谷定价机制,将推理成本压至行业最低。两大模型的双重冲击,正在彻底改写AI竞争的底层逻辑。

Kimi K3:开源模型首次登顶代码竞技场

核心规格

Kimi K3采用混合专家(MoE)架构,总参数量2.8万亿,拥有896个专家(每次激活16个),原生支持视觉理解,上下文窗口达到100万token。

在核心基准测试中的表现:

架构创新:KDA + AttnRes

K3的底层能力建立在两项自研架构之上:

KDA混合线性注意力:打破了传统Transformer在长序列处理上的二次方计算瓶颈,百万token解码速度提升6.3倍。这意味着K3在处理超长上下文时不再是"能用",而是"快用"。

注意力残差(AttnRes):在传统残差连接基础上增加跨层信息保留机制,训练效率提升25%,解决了深层网络信息丢失的长期痛点。这项创新的共同第一作者之一是年仅17岁的研究者陈广宇,其方案与业内知名研究者苏剑林、张宇并列——这一事实本身也说明AI研究的门槛正在被重新定义。

长程编码:AI自主工作的范式转移

K3最引人注目的能力是长程编码(Long-Horizon Coding)。官方演示中,K3连续48小时自主运行,独立完成了一款45纳米芯片的全流程设计——从架构到验证,全程无人工干预。这不是简单的代码补全,而是AI Agent从"问答工具"进化为"自主工作者"的关键跃迁。

对于开发者而言,这意味着你可以将一个完整的项目需求交给K3,它能在极少人工监督下持续工作数小时甚至数天,自动完成代码编写、测试、调试和文档生成的全流程。

开源与定价

完整权重计划于2026年7月27日前开放下载。API定价策略清晰:

需注意:由于算力过载,月之暗面已于7月19日暂停C端新用户订阅,现有算力资源全部优先保障存量会员。但API通道和开源权重不受影响。

DeepSeek V4:百万上下文成为标配

双版本架构

DeepSeek V4推出两个版本,覆盖从旗舰到轻量的全场景需求:

参数V4-ProV4-Flash
总参数量1.6T284B
激活参数量49B13B
上下文长度1M tokens1M tokens
MoE Expert1 shared + 384 routed1 shared + 256 routed
推理计算量(vs V3.2)27%10%
KV缓存占用(vs V3.2)10%7%
训练数据量33T tokens32T tokens

一个直观的对比:V4-Pro在1M上下文下的单token推理计算量仅为前代的27%,KV缓存压缩至10%。百万token上下文从"技术奇点"变成了"可承担的工程现实"。

三大架构突破

1. mHC流形约束超连接——让万亿参数模型"不崩"

传统残差连接自何恺明2016年提出以来几乎未经大改。当模型深度突破千亿参数,传统残差在信号传递稳定性上暴露出明显短板。

V4的解法:将通道混合矩阵约束到双随机矩阵的流形(Birkhoff polytope)——即矩阵每行、每列之和均为1。这一约束带来两个数学保证:

这不是某个benchmark的0.5%提升,而是为整个架构的规模化奠定稳定地基——让1.6T参数的模型能稳定训练完成。

2. CSA/HCA混合注意力——百万上下文的效率核心

V4采用两种注意力层交替叠加,分别承担不同职能:

CSA的信息处理四步走:原始序列→KV压缩(每m个token压缩为1个)→Lightning Indexer+Top-K选择→Core Attention计算→Grouped Output Projection。这种设计让模型在保持对全局信息感知的同时,大幅降低计算开销。

3. 国产算力深度适配——从英伟达到昇腾的迁移启动

V4首次在官方技术报告中明确验证了华为昇腾NPU双平台表现。V4选用的FP4精度格式,恰好是华为昇腾950芯片原生支持的精度。DeepSeek表示,下半年昇腾950超节点批量上市后,V4-Pro价格将大幅下调。

华为同日发文确认:"昇腾一直同步支持DeepSeek系列模型,本次通过双方芯模技术紧密协同,实现昇腾超节点全系列产品支持DeepSeek-V4系列模型。"

这标志着从英伟达CUDA生态向华为CANN框架的迁移正式启动,对国产算力产业链的深远影响不可低估。

峰谷定价:AI推理进入精细化运营时代

V4正式版首次引入峰谷定价机制,这是AI推理服务从"一口价"向"精细化运营"转变的标志性事件:

版本输出(平峰)输出(高峰)缓存命中输入
V4-Pro$0.87/M$1.74/M$0.435/M
V4-Flash$0.28/M$0.56/M$0.0028/M

对比Claude Fable 5百万输出$50,V4-Flash平峰价仅为对方的1/178。即使加上了峰谷计价器,DeepSeek依然是那个"价格屠夫"。

旧模型切换时间表

7月24日起,deepseek-chatdeepseek-reasoner两个旧模型名正式下线,分别自动对应V4-Flash的非思考模式和思考模式。开发者无需修改代码,但需注意定价策略的变化。

行业格局分析:开源进入"军备竞赛"阶段

三个关键信号

信号一:开源模型首次在单项能力上超越最贵闭源模型

K3在前端代码竞技场超越Fable 5,打破了"闭源一定更强"的行业共识。这证明开源路线不是追赶,而是可以局部超越。对整个开源社区而言,这是一针强心剂。

信号二:推理成本进入"边际递减"时代

V4的CSA/HCA架构让1M上下文的推理成本降至传统方案的1/10。当百万token推理成本从$50降到$0.28,AI的边际使用成本趋近于零。这将彻底改变企业的AI部署决策——原本因成本太高而搁置的批量处理、全量分析、长文档理解等场景,现在变得经济可行。

信号三:竞争维度正在升级

从单纯的参数规模竞争,转向"性价比×上下文长度×Agent能力×开源生态"的多维竞争。K3在Agent能力上突出,V4在成本效率上碾压,各自占据不同生态位。而阿里Qwen3.8-Max的2.4万亿参数预览版也已上线,三家国产大模型在同一周内同时发力,这在AI历史上前所未有。

对企业和开发者的实际影响

实测数据参考

根据已放出灰度测试权限的开发者反馈:

展望:竞争才刚刚开始

2026年7月这一周,可能是AI开源史上的分水岭。当2.8万亿参数模型开源、百万上下文成为标配、推理成本降至此前的1/100,AI应用的门槛正在被彻底拆除。

下一轮竞争焦点将不再是"谁的模型更大",而是"谁能让AI更便宜、更稳定、更自主地完成实际工作"。在这个维度上,K3和V4只是开始。

值得关注的时间节点:

开源AI的下半场,才刚刚开球。

🤖 你的网站能被AI搜索到吗?

免费检测你的网站GEO健康分,看看ChatGPT、DeepSeek会不会推荐你

🔍 免费GEO检测 📊 注册解锁AI分析