Qwen3.8 与 Qwen3.7 写游戏对比:3.8 更稳,3.7 更懂需求但 BUG 频出
2026/07/26 21:08阅读量 2
文章对比测试了通义千问 Qwen3.8-Max-Preview 和 Qwen3.7-Max 根据孩子口头需求生成小游戏的能力。Qwen3.8 生成的代码运行稳定但迭代时容易覆盖原有功能;Qwen3.7 更理解潜在需求,但帧驱动计时器 BUG 导致高刷屏上 60 秒游戏仅 8 秒结束。两者均无法实现手机在线部署,无法满足孩子分享给朋友的需求。
事件概述
核心差异
-
多轮需求修改
- 当要求“按空格发射激光”时,Qwen3.8 直接覆盖空格跳跃功能(改为 W 键跳跃),Qwen3.7 则识别冲突,仅优化激光判定并降低飞鸟速度,保留原有跳跃。
- 当要求“紫色史莱姆改成飞狗”,Qwen3.8 将史莱姆改为棕色飞狗,但孩子认为与原有飞鸟无明显区别;Qwen3.7 因首轮已自带飞狗,直接跳过修改。
- 当改为“双人抢鱼干对战”,Qwen3.8 重写为无攻击的双人赛跑;Qwen3.7 保留攻击系统并新增激光眩晕+击退机制,更贴合“对战”需求。
- 当召回“双人打飞狗”,Qwen3.8 运行稳定,60 秒计时准确;Qwen3.7 则因帧驱动计时器 BUG,在高刷新率屏幕上 60 秒游戏实际仅 8 秒,且难度随帧率暴涨,游戏体验崩溃。
-
部署能力
- 两者均无法完成可分享至手机的在线部署。Qwen3.8 经 21 步操作后提示“网络无法连接到 Vercel 服务器”;Qwen3.7 给出注册引导但仍无法生成可分享链接。
值得关注
- 能力定位:Qwen3.7 更懂用户潜在需求,逻辑贴合但容易出现影响体验的 BUG;Qwen3.8 在迭代中容易跑偏覆写原有功能,但生成的代码基线扎实、运行稳定可控。
- 结论:大模型已能通过自然语言快速生成完整可玩游戏,迭代速度匹配孩子兴趣节奏,但仍存在功能丢失、部署复杂、移动端适配差等问题。
