开源AI在2026年7月经历了一场前所未有的地震级事件。7月17日,月之暗面发布Kimi K3——2.8万亿参数的全球最大开源模型,在伯克利前端代码竞技场以1679分登顶全球第一;7月底,DeepSeek V4正式版蓄势待发,将百万token上下文打入全系标配,同时引入峰谷定价机制,将推理成本压至行业最低。两大模型的双重冲击,正在彻底改写AI竞争的底层逻辑。
Kimi K3:开源模型首次登顶代码竞技场
核心规格
Kimi K3采用混合专家(MoE)架构,总参数量2.8万亿,拥有896个专家(每次激活16个),原生支持视觉理解,上下文窗口达到100万token。
在核心基准测试中的表现:
- 前端代码竞技场(Frontend Code Arena):1679分,全球第一,超越Claude Fable 5和GPT-5.6 Sol
- Artificial Analysis智能指数:57分,全球第三,仅次于Claude Fable 5和GPT-5.6 Sol
- DeepSWE长程开发测试:任务完成率67.5%,排名第三
- Code Arena前端开发:76%胜率登顶
架构创新:KDA + AttnRes
K3的底层能力建立在两项自研架构之上:
KDA混合线性注意力:打破了传统Transformer在长序列处理上的二次方计算瓶颈,百万token解码速度提升6.3倍。这意味着K3在处理超长上下文时不再是"能用",而是"快用"。
注意力残差(AttnRes):在传统残差连接基础上增加跨层信息保留机制,训练效率提升25%,解决了深层网络信息丢失的长期痛点。这项创新的共同第一作者之一是年仅17岁的研究者陈广宇,其方案与业内知名研究者苏剑林、张宇并列——这一事实本身也说明AI研究的门槛正在被重新定义。
长程编码:AI自主工作的范式转移
K3最引人注目的能力是长程编码(Long-Horizon Coding)。官方演示中,K3连续48小时自主运行,独立完成了一款45纳米芯片的全流程设计——从架构到验证,全程无人工干预。这不是简单的代码补全,而是AI Agent从"问答工具"进化为"自主工作者"的关键跃迁。
对于开发者而言,这意味着你可以将一个完整的项目需求交给K3,它能在极少人工监督下持续工作数小时甚至数天,自动完成代码编写、测试、调试和文档生成的全流程。
开源与定价
完整权重计划于2026年7月27日前开放下载。API定价策略清晰:
- 输入:$3/百万token(缓存命中$0.30)
- 输出:$15/百万token
- 编程场景缓存命中率超过90%,实际输入成本约为标准价格的1/4
需注意:由于算力过载,月之暗面已于7月19日暂停C端新用户订阅,现有算力资源全部优先保障存量会员。但API通道和开源权重不受影响。
DeepSeek V4:百万上下文成为标配
双版本架构
DeepSeek V4推出两个版本,覆盖从旗舰到轻量的全场景需求:
| 参数 | V4-Pro | V4-Flash |
|---|---|---|
| 总参数量 | 1.6T | 284B |
| 激活参数量 | 49B | 13B |
| 上下文长度 | 1M tokens | 1M tokens |
| MoE Expert | 1 shared + 384 routed | 1 shared + 256 routed |
| 推理计算量(vs V3.2) | 27% | 10% |
| KV缓存占用(vs V3.2) | 10% | 7% |
| 训练数据量 | 33T tokens | 32T tokens |
一个直观的对比:V4-Pro在1M上下文下的单token推理计算量仅为前代的27%,KV缓存压缩至10%。百万token上下文从"技术奇点"变成了"可承担的工程现实"。
三大架构突破
1. mHC流形约束超连接——让万亿参数模型"不崩"
传统残差连接自何恺明2016年提出以来几乎未经大改。当模型深度突破千亿参数,传统残差在信号传递稳定性上暴露出明显短板。
V4的解法:将通道混合矩阵约束到双随机矩阵的流形(Birkhoff polytope)——即矩阵每行、每列之和均为1。这一约束带来两个数学保证:
- 谱范数≤1:残差传播设硬上限,梯度爆炸从根源截断
- 乘法封闭性:此类矩阵在矩阵乘法下封闭,百层以上堆叠依然稳定
这不是某个benchmark的0.5%提升,而是为整个架构的规模化奠定稳定地基——让1.6T参数的模型能稳定训练完成。
2. CSA/HCA混合注意力——百万上下文的效率核心
V4采用两种注意力层交替叠加,分别承担不同职能:
- HCA(重度压缩注意力):128:1压缩比,提供全局语境——"超广角镜"扫视全貌
- CSA(压缩稀疏注意力):4:1压缩比,保留细节——"微距长焦镜"聚焦线索
CSA的信息处理四步走:原始序列→KV压缩(每m个token压缩为1个)→Lightning Indexer+Top-K选择→Core Attention计算→Grouped Output Projection。这种设计让模型在保持对全局信息感知的同时,大幅降低计算开销。
3. 国产算力深度适配——从英伟达到昇腾的迁移启动
V4首次在官方技术报告中明确验证了华为昇腾NPU双平台表现。V4选用的FP4精度格式,恰好是华为昇腾950芯片原生支持的精度。DeepSeek表示,下半年昇腾950超节点批量上市后,V4-Pro价格将大幅下调。
华为同日发文确认:"昇腾一直同步支持DeepSeek系列模型,本次通过双方芯模技术紧密协同,实现昇腾超节点全系列产品支持DeepSeek-V4系列模型。"
这标志着从英伟达CUDA生态向华为CANN框架的迁移正式启动,对国产算力产业链的深远影响不可低估。
峰谷定价:AI推理进入精细化运营时代
V4正式版首次引入峰谷定价机制,这是AI推理服务从"一口价"向"精细化运营"转变的标志性事件:
- 高峰时段(9:00-12:00 / 14:00-18:00 北京时间):2倍价
- 平峰时段:标准价
| 版本 | 输出(平峰) | 输出(高峰) | 缓存命中输入 |
|---|---|---|---|
| V4-Pro | $0.87/M | $1.74/M | $0.435/M |
| V4-Flash | $0.28/M | $0.56/M | $0.0028/M |
对比Claude Fable 5百万输出$50,V4-Flash平峰价仅为对方的1/178。即使加上了峰谷计价器,DeepSeek依然是那个"价格屠夫"。
旧模型切换时间表
7月24日起,deepseek-chat和deepseek-reasoner两个旧模型名正式下线,分别自动对应V4-Flash的非思考模式和思考模式。开发者无需修改代码,但需注意定价策略的变化。
行业格局分析:开源进入"军备竞赛"阶段
三个关键信号
信号一:开源模型首次在单项能力上超越最贵闭源模型
K3在前端代码竞技场超越Fable 5,打破了"闭源一定更强"的行业共识。这证明开源路线不是追赶,而是可以局部超越。对整个开源社区而言,这是一针强心剂。
信号二:推理成本进入"边际递减"时代
V4的CSA/HCA架构让1M上下文的推理成本降至传统方案的1/10。当百万token推理成本从$50降到$0.28,AI的边际使用成本趋近于零。这将彻底改变企业的AI部署决策——原本因成本太高而搁置的批量处理、全量分析、长文档理解等场景,现在变得经济可行。
信号三:竞争维度正在升级
从单纯的参数规模竞争,转向"性价比×上下文长度×Agent能力×开源生态"的多维竞争。K3在Agent能力上突出,V4在成本效率上碾压,各自占据不同生态位。而阿里Qwen3.8-Max的2.4万亿参数预览版也已上线,三家国产大模型在同一周内同时发力,这在AI历史上前所未有。
对企业和开发者的实际影响
- API重度用户:将批量任务迁移到V4平峰时段(避开9-12/14-18点),可节省50%以上成本
- Agent开发者:K3的长程编码能力+1M上下文,使复杂多步Agent成为现实;V4-Flash的超低价格适合高频Agent调用
- 私有化部署:K3权重7/27开源后,企业可选择自托管,数据不出内网;但2.8万亿参数需要64卡以上集群
- AI搜索与GEO:更长的上下文窗口意味着AI搜索引擎能更完整地理解和引用网页内容,GEO策略需从"关键词密度"转向"内容完整性与权威性"
实测数据参考
根据已放出灰度测试权限的开发者反馈:
- V4 Pro整体表现接近Claude Opus 4.8级别,编码能力直追GPT-5.6 Sol
- V4在3D和SVG生成方面显著变强,一次生成的游戏和交互应用可玩度较高
- 同样任务,V4所需迭代轮数比Fable 5多,但考虑价格差5倍以上,性价比依然突出
- K3在长程自主任务中表现优异,但综合深度推理仍与Fable 5和GPT-5.6 Sol存在差距
展望:竞争才刚刚开始
2026年7月这一周,可能是AI开源史上的分水岭。当2.8万亿参数模型开源、百万上下文成为标配、推理成本降至此前的1/100,AI应用的门槛正在被彻底拆除。
下一轮竞争焦点将不再是"谁的模型更大",而是"谁能让AI更便宜、更稳定、更自主地完成实际工作"。在这个维度上,K3和V4只是开始。
值得关注的时间节点:
- 7月27日:Kimi K3完整权重开源,社区蒸馏版和量化版预计一周内出现
- 7月底:DeepSeek V4正式版上线,峰谷定价正式启动
- 下半年:华为昇腾950超节点批量上市,V4-Pro价格预计大幅下调
开源AI的下半场,才刚刚开球。