五款中美开源模型横评:Kimi K3综合领先,DeepSeek性价比突出

2026/08/13 21:05阅读量 2

近期五款中美开源模型同台测试,覆盖逻辑推理、代码可视化、Agent工具、Blender建模和写作。Kimi K3综合表现最全面,DeepSeek以极低成本完成高难推理,美国两款小模型在简单任务有优势,复杂任务明显落后。测试显示开源模型能力分化,路线选择更丰富。

测试概况

本次横评将 Kimi K3、Qwen3.8-Max、DeepSeek V4 Pro、Meta Muse Glimmer、Nvidia Nemotron 3.5 Lightning 接入同一测试环境,通过脚本与真人盲评判分。每道题设有统一输出上限,超限视为未交卷;超限任务会放开上限单独补跑作为对照。

逻辑推理:DeepSeek成本最优

多步推理题包括24点与五位数密码锁。K3、Qwen补测后全对,DeepSeek一轮全对五题,仅花费4美分。Muse Glimmer 和 Nemotron 原测均因思考过长被截断而交白卷;放开上限后 Muse 密码锁全对,Nemotron 烧掉6万token仍答错。无解24点陷阱中,除Muse在补测时编造假解外,其余均正确识破。加时赛预算30美分下,Nemotron十轮仍未解出密码锁,Muse第四次解出,DeepSeek性价比约为Muse的四倍。

代码可视化:K3完成度最高

SVG作画、地铁线路网页、成绩单可视化三项测试中,K3满分次数最多;DeepSeek在成绩单可视化中获最高分;Qwen在放开上限后补交完成度较高的地铁页。美国两款模型在SVG和网页任务中效果较差,Nemotron功能缺失,Muse路线计算错误。

Agent工具能力:三家国产模型满分

修bug任务中,五款模型均将十二项测试修复至全绿,DeepSeek单轮成本0.3美分最低。脏账单清洗任务中,K3、Qwen、DeepSeek全部满分;Muse十五轮全部消耗在编码问题,Nemotron仅获部分分数。注:首次测试时托管商不支持Nemotron原生工具调用,改为纯文本协议;补充原生工具重测后,账单任务仍未通过。

Blender建模与写作:K3表现最优

中式庭院Blender脚本测试中,仅K3两份脚本均一次跑通渲染出图;Qwen补跑后出图,DeepSeek一份出图一份因废弃接口参数失败,Muse和Nemotron均未出图。写作测试中,K3是唯一在两道高难度改写题均获3分的模型;DeepSeek简单题满分,难题仅2分;所有模型在难题中均未超过3分,存在套路化表达。

开源模型分化趋势

本轮测试显示,大参数模型在需要长时间推理和复杂工具调用的任务上仍明显占优。K3冲能力上限,全面但偏贵、偏慢;Qwen稳定全能,但思考耗时长;DeepSeek能力不弱且价格极低,可能进一步拉低市场对强模型价格的预期。Muse Glimmer 和 Nemotron 这类小模型在简单任务上快且便宜,但复杂任务差距明显。Meta已预告旗舰模型Muse Spark 1.2权重将在未来几周放出,阿里也已将Qwen3.8大杯权重上传至Hugging Face,开源模型供给正变得更加丰富。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。