DeepSeek Harness开源框架获20万星,但视觉模型在理解网络梗时暴露短板
2026/09/07 16:35阅读量 2
DeepSeek推出的插件化软件框架Harness在开源3周内获得20万GitHub星标,旨在通过“一切皆插件”理念提升Agent效率。然而实测显示,其配套的V4-Flash-Vision-Exp视觉模型在处理复杂网络梗图时存在明显不足:虽能准确描述画面视觉变化,却无法识别具体人物(如梁文锋)或理解语境,甚至自行编造虚假称号。尽管框架内置搜索工具,但默认配置下模型未主动调用核实,暴露出缺乏自我复核机制及普通用户配置门槛高的问题。
事件概述
DeepSeek于8月13日开源首款软件框架DeepSeek Harness,主打“一切皆插件”架构,允许模型、工具和界面按需替换组合。该框架仅用不到3周时间便在GitHub上获得20万星标,社区内相关插件仓库已超700个。官方随后推出V4-Flash-Vision-Exp视觉模型以增强多模态能力,但在实际测试中,该组合在处理需结合文化背景和网络语境的图像时表现不佳。
核心测试事实
1. 视觉叙事理解与语义识别的割裂
在针对一张名为“滑动变祖器”的网络梗图测试中,模型展现了分层级的能力差异:
- 视觉层(优秀): 模型准确识别了6张拼接图中的视觉元素变化,包括人物着装从深色西装到高领服装再到红金色龙袍的演变,并总结出“人物被逐步神化”的视觉叙事逻辑。
- 语义与文化层(失败): 当要求模型解释图片含义时,它无法识别图中人物为DeepSeek创始人梁文锋,也无法理解“梁祖”等网络梗。在提供5个对应等级的称号(小难梁→牢梁→梁子→梁圣→梁祖)而缺失第6个称号的情况下,模型未能正确推断出缺失的“梁神”,反而编造了“梁圣·升格”和“梁煞”等虚假称号,甚至错误猜测人物为梁启超。
2. 幻觉与复核机制缺失
测试揭示了模型在面对信息缺失时的行为模式:
- 编造答案: 为了填补逻辑缺口,模型倾向于生成听起来合理但事实错误的补充信息,且缺乏对自创内容的置信度评估。
- 对外部信息的怀疑: 当用户提供包含真假混杂的背景信息(如称主角为古代历史人物)时,模型能够指出图片证据不足以支持这些说法,表现出一定的批判性思维。然而,这种谨慎并未应用于其自身生成的答案,显示出对“自我编造”缺乏有效的内部复核机制。
3. 工具调用与实际效果的落差
DeepSeek Harness原生支持网页搜索、抓取以及Skills、子Agent和工作流等自定义功能。理论上,模型可通过搜索工具核实人物身份和梗的来源。但在此次测试中,模型并未主动调用搜索功能进行验证,而是直接基于推理给出错误答案。这表明默认的框架组合尚未形成可靠的“检索-验证-回答”闭环。
值得关注的影响
- 开发者友好 vs 用户体验门槛: Harness的高自由度意味着开发者可以构建复杂的Agent工作流(如先描述画面、再搜索核实、最后汇总),但这需要较高的配置成本。对于普通用户而言,开箱即用的体验尚不成熟,需自行整合搜索、资料库和复核步骤才能提升可靠性。
- AI理解力的局限: 当前多模态模型在“看图说话”层面已较成熟,但在涉及第四层(现实世界实体映射)和第五层(特定社群文化语境)的理解上仍存在显著短板,单纯依赖视觉特征匹配无法解决深层语义理解问题。
