D
V4DeepSeek
深度求索 · DeepSeek
合并通用与推理两条技术线,按任务难度自适应“思考强度”,以极低推理成本著称。
突出强项代码 80.6% SWE-bench Verified · 成本控制
按实验室分类,覆盖通用基座、推理代码、多模态与智能体方向,数据截至 2026 年年中。
合并通用与推理两条技术线,按任务难度自适应“思考强度”,以极低推理成本著称。
全球部署最广的国产开源模型家族,覆盖 0.6B–235B+ 多尺寸,多语言与多模态能力最全。
面向“自主智能体编程”打造,K3 为迄今最大的开源权重模型之一,专攻长程多步骤编码。
2026 年首个登陆港交所的国产 AI 实验室,GLM-5 系列主要在华为昇腾算力上训练。
以更小激活参数量匹敌更大模型,多模态生成(图像 / 3D / 视频)与“世界模型”能力突出。
国内调用量领先,API 价格最低,多模态与消费级产品体验强,是“成本地板”的设定者。
全球 LMArena 前十,日均 API 调用 15 亿次,广泛落地搜索、企业与产业场景。
长上下文与多模态能力强,2026 年随智谱之后登陆港交所,正推进 2.7T 参数模型。
高效推理与多模态并重,Flash 系列以更低成本提供接近旗舰的能力,调用量位居前列。
唯一在国产软硬件栈上训练的前沿模型,强调算力自主可控与行业大模型落地。
各旗舰模型的公开代码基准成绩(2026 年),用于横向参考。
| 模型 | 基准 | 成绩 | |
|---|---|---|---|
| DeepSeek V4 (Pro-Max) | SWE-bench Verified | 80.6% | |
| Qwen 3.6-27B | SWE-bench Verified | 77.2% | |
| Kimi K3 | SWE-bench Verified | 76.8% | |
| Doubao-Seed 2.0 Pro | SWE-bench Verified | 76.5% | |
| 腾讯混元 Hy3 | SWE-bench Verified | 74.4% | |
| 智谱 GLM-5.2 | SWE-bench Pro(更难) | 62.1 |