2026-05-07 — views
DeepSeek V4、Kimi K2.6、GLM-5.1、MiniMax M2.7:前沿级编码模型,成本仅 1/5 至 1/25
中国 4 个实验室在 12 天内发布前沿级编码模型。GLM-5.1(MIT 许可证)在 SWE-Bench Pro 上以 58.4% 与 Kimi K2.6 持平。成本差距为西方 API 的 5-25 倍。
2026 年 4 月底的 12 天窗口期内,中国 4 个实验室发布了在代理编码基准测试中达到大致相同能力上限的开放权重编码模型 — 但成本仅为西方前沿 API 等价模型的 1/5 到 1/25。
四个模型
DeepSeek V4 Pro(DeepSeek AI)— 总参数 1.6 万亿,每前向传递激活 490 亿,MoE 架构。Apache 2.0 许可证。组内通用推理基准登顶;SWE-Bench 上略低于编码专攻型。
Kimi K2.6(Moonshot AI)— SWE-Bench Verified 80.2%,SWE-Bench Pro 58.6%。本队列中最高代理编码得分,在代码编辑任务上与 Claude 3.7 Sonnet 竞争。商用许可证;提供托管 API。
GLM-5.1(Z.AI / Zhipu)— 754B MoE,MIT 许可证。SWE-Bench Pro 58.4% — 与 K2.6 统计同分。MIT 许可证是头条:这是真正宽松条款下的前沿级开放权重。全精度运行需 8×H100;量化版在消费级集群上运行。
MiniMax M2.7(MiniMax)— 100 亿激活参数(来自更大的 MoE),SWE-Bench Pro 56.2%。最具计算效率的条目:以一部分计算预算实现接近前沿的编码质量。
成本差距
托管 API 上,GLM-5.1 和 DeepSeek V4 Flash 定价约为每百万输入 token $0.10–0.30,相比可比的西方前沿模型 $3–15。对于推理密集型工作负载 — 代码审查、多文件代理循环、并行测试生成 — 经济性发生实质性转变。
对市场的意义
12 天同步窗口看起来是有意为之。总体而言,这些发布对西方供应商在编码模型层面施加降价压力。模式呼应 2024 年末 Qwen-2.5 和 DeepSeek-V3 发生的事:开放权重能力对等在 60-90 天内强制 API 降价。预计 2026 年下半年类似的重新定价周期。
从业者注记
对于生产代理编码工作负载:在切换前对你实际任务分布运行 GLM-5.1 基准 — SWE-Bench Verified 是标准化测试,不是你的代码库。MIT 许可证对构建嵌入编码代理的产品最重要(无使用限制,无服务条款风险)。对于在 DGX Spark 或类似集群上自托管,现在与托管前沿模型的能力差距已缩小这么多,GLM-5.1 的量化变体值得评估。
来源
- DeepSeek is back among leading open-weights models with V4 — Artificial Analysis ↗
- The late-April 2026 Chinese LLM stack — dev.to ↗
- Best Chinese LLM benchmarks — BenchLM ↗