开源大模型进入”逼宫”时代
2026年6-7月,开源大模型领域进入白热化阶段。Top开源模型能力普遍达到GPT-4水平,部分benchmark甚至超越GPT-5.4。在这个背景下,阿里巴巴Qwen 3.7和DeepSeek V4-Pro成为国产开源模型的双子星,各自代表了不同的技术哲学。
模型核心参数对比
| 指标 | Qwen 3.7-72B | Qwen 3.7-110B | DeepSeek V4-Pro | DeepSeek V4-Lite |
|---|---|---|---|---|
| 参数量 | 72B | 110B | 236B(MoE) | 16B(MoE) |
| 活跃参数 | 72B | 110B | 35B | 4B |
| 上下文窗口 | 128K | 128K | 256K | 128K |
| MMLU | 86.2% | 88.1% | 89.5% | 79.3% |
| HumanEval | 88.4% | 90.2% | 91.7% | 82.1% |
| 推理成本(每1K tokens) | 0.003元 | 0.005元 | 0.004元 | 0.0005元 |
Qwen 3.7:生态为王
阿里巴巴的Qwen系列在2026年继续巩固其”开源生态霸主”地位。Qwen 3.7的核心优势不在于单项指标的绝对领先,而在于无与伦比的生态系统:
- Hugging Face上基于Qwen的微调模型超过12万个,是第二名Llama系列的3倍
- 原生支持Qwen的框架和工具链最完整:vLLM、TensorRT-LLM、llama.cpp均已官方适配
- 多语言能力强悍,支持超过30种语言的流畅对话
DeepSeek V4-Pro:性价比杀手
DeepSeek V4-Pro采用超大MoE架构(236B总参数,35B活跃参数),在保持接近110B密集模型性能的同时,推理成本降低约60%。
技术创新亮点:
- 动态专家路由:根据输入类型自动选择最合适的专家组合,路由决策延迟仅0.3ms
- 多Token预测(MTP):单次前向传播预测4个未来token,推理速度提升2.5倍
- FP8训练与推理:全链路FP8精度支持,显存占用降低50%
选型决策树
是否需要多语言支持(非中英)?
是 -> Qwen 3.7
否 -> 继续判断
是否有严格显存限制(<24GB)?
是 -> DeepSeek V4-Lite 或 Qwen 3.7-14B
否 -> 继续判断
是否追求极致代码能力?
是 -> DeepSeek V4-Pro
否 -> 继续判断
是否需要最长上下文(>128K)?
是 -> DeepSeek V4-Pro (256K)
否 -> Qwen 3.7-72B (性价比最优)
实际部署成本测算
以日处理100万请求、平均每次2K tokens的场景为例:
| 模型 | 所需A100-80G数量 | 月硬件成本(租赁) | 月API收入(按0.01元/1K) |
|---|---|---|---|
| Qwen 3.7-72B | 8台 | 约12万元 | 约20万元 |
| DeepSeek V4-Pro | 6台 | 约9万元 | 约20万元 |
| Llama 4-70B | 8台 | 约12万元 | 约20万元 |
微调与领域适配
两款模型在微调友好度上表现优异:
Qwen 3.7:官方提供Qwen-LoRA、Qwen-QLoRA完整方案,单卡A100即可微调72B模型。
DeepSeek V4-Pro:由于MoE架构的特殊性,建议使用官方提供的”专家冻结”微调策略——只训练路由网络和少量专家,微调成本降低80%。
总结
Qwen 3.7和DeepSeek V4-Pro并非简单的”谁更好”的竞争关系,而是互补共存。Qwen胜在生态和通用性,DeepSeek胜在推理效率和代码能力。对于大多数企业,Qwen 3.7-72B是风险最低的选型;对于追求极致性价比的AI原生应用,DeepSeek V4-Pro是不二之选。
原文链接:https://www.jikeyum.com/784.html,转载请注明出处。
评论0