AI“你画我猜”Benchmark评测:GPT-6 Astra险胜,推理成本与成绩无正相关

2026/09/05 19:44阅读量 2

一项针对九款主流大模型的“你画我猜”式SVG作画与识别基准测试显示,GPT-6 Astra以75.5分微弱优势领先,但前三名置信区间重叠。测试发现,模型在反常识和热梗题目上表现普遍较差,且思考Token数量、花费成本与最终得分之间不存在稳定正相关关系。此外,部分模型存在“画完不认”自身作品的问题,而简单构图往往比堆砌元素更有效。

事件概述

近期,开发者设计并执行了一项名为“你画我猜”的基准测试(Benchmark),旨在评估大语言模型在视觉生成与理解方面的综合能力。该测试要求模型使用SVG代码绘制图像,随后由其他模型对渲染后的图片进行猜测。首期测试共涉及1350张画作和11961次猜测,参评模型包括GPT-6 Astra、Gemini 3.8 Flash、Claude Fable 5.1以及Kimi K3、Qwen3.8-Max等国产主流模型。

核心信息

1. 排名结果:头部模型差距极小

  • GPT-6 Astra 以75.5分获得总分第一,Gemini 3.8 Flash(74.6分)和 Claude Fable 5.1(74.3分)紧随其后。三者的95%置信区间相互重叠,表明第一梯队实力相当。
  • 国产模型表现:Kimi K3(71.7分)、Qwen3.8-Max(71.3分)和 GLM-5.3-Flash(68.9分)位列第二梯队。MiniMax-M3(61.9分)和 DeepSeek-V4-Flash-Vision-Exp(60.9分)相对靠后。
  • 参考组:Gemma 4 26B作为非排名参考组,总分仅为38.2分,显示出较大差距。

2. 能力短板:常识偏见与抽象理解困难

  • 反常识题目集体“翻车”:在常规词测试中,模型得分集中在70-87分;但在反常识组合题中,最高分仅34分。例如,“猫给人铲屎”这一画面在所有56次猜测中零命中,模型仍受限于“猫=铲屎官”的刻板印象;“老鼠追猫”也多数被误猜为传统的“猫捉老鼠”。
  • 黑话与热梗误解:面对AI术语“蒸馏”,所有模型均将其具象化为化学实验室场景而非机器学习概念;对于“特种兵旅游”,多数模型仅画出迷彩服士兵,缺乏对“快速打卡景点”这一语境的理解。
  • 自猜一致性差异:头部模型(Astra、Gemini、Claude)自猜正确率约83%,而 MiniMax(53.3%)和 DeepSeek(49.3%)连自己的画作都难以准确识别,反映出部分模型在生成过程中缺乏对自身输出的清晰语义锚定。

3. 效率分析:思考成本与金钱投入并非决定性因素

  • 思考Token无关性:GPT-6 Astra 每次作画的思考Token中位数仅为232个,用时41秒,却取得最高作画得分;相反,DeepSeek 和 Qwen 分别消耗了1.9万和1.8万个思考Token,成绩却排在后半段。
  • 性价比反转:传统认为便宜的模型未必高效。GLM 单次调用成本最低(约4分钱/张),但成绩中等;Gemini 总花费约82元即进入前三,性价比极高;而最贵的 Claude(约304元)成绩仅与 Gemini 持平。这表明在特定任务中,高定价并不直接转化为高分,OpenAI 强调的“高效完成任务反而更便宜”在此得到验证。

4. 绘画策略:简洁优于堆砌

  • 测试将画作按SVG元素数量分级,发现元素最少档(<20个元素)与被猜中率(78.8%)最高,而元素最多档的被猜中率仅高出4.4个百分点。
  • 典型案例:“掩耳盗铃”成语,Gemini 用极简线条勾勒人物表情,七家全中;DeepSeek 使用222个复杂元素构建机械结构,七家全错。这证明在视觉传达中,关键特征的精准捕捉比元素数量的堆砌更为重要。

值得关注

此次评测揭示了当前大模型在跨模态理解上的局限性:尽管在基础物体识别上表现优异,但在处理需要打破常识联想、理解社会文化隐喻或抽象概念的指令时,模型仍容易陷入模式化输出。此外,测试方法学上的创新——通过模型互评来量化“可解释性”和“表达清晰度”,为后续评估模型的实际应用价值提供了新的视角。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。