Opus 5与GPT-5.6实测对比:找全隐藏Bug后,差距体现在解题思维

2026/08/04 16:41阅读量 2

一项对照实测显示,在只给一句提示词、不告知代码存在漏洞的情况下,Claude Opus 5与GPT-5.6 Sol均找出了购物车代码中的6个隐藏Bug,但Opus 5额外发现浮点精度问题并追溯到根因;在禁用所有第三方库生成音频波形图的任务中,两者分别采用SVG和字符画/HTML方案。整体上,Opus 5在产品思维和解题灵活度上略胜一筹。

事件概述

一篇实测对比文章围绕 Claude Opus 5 与 GPT-5.6 Sol 展开,设置了两轮测试:一是在不告知存在漏洞的情况下,让模型分析一段包含5个文件、6个隐藏Bug的购物车代码;二是在只能使用Python标准库、禁止numpy、matplotlib、PIL、librosa等第三方库且不能联网的条件下,要求模型根据WAV文件生成可见波形图。

核心信息

  • 背景:Anthropic 已砍掉 Claude Code 系统提示词中约80%的内容,模型能力不降反升;有演示仅用三句话提示词就让 Opus 5 从零生成约5.5万行代码的3D第一人称射击游戏。
  • 找Bug测试:GPT-5.6与Opus 5均找到全部6个预设Bug,包括满减门槛、浮点精度污染、优惠券叠加、无下限保护、包邮门槛口径等问题。Opus 5额外指出运费计算中浮点精度可能造成多收运费;GPT-5.6只提示价格计算不应使用float。
  • 分析方式差异:GPT-5.6逐条修复并给出规范报告;Opus 5以产品经理思路先完整跑通代码,指出“原价与优惠价口径未区分”是所有相关Bug的总根源,并推演修复后选券算法的变化。
  • 波形图测试:GPT-5.6生成SVG方案,支持多种PCM格式、分块读取、参数校验,并自行验证振幅数值准确;Opus 5先输出ASCII字符画,在提示“不够用心”后改为带统计卡片和分段时间着色的HTML页面。
  • 实现细节:GPT-5.6使用struct.unpack_from逐帧解包,Opus 5使用struct.unpack批量解包,效率更高。

值得关注

此次实测结论认为,Opus 5在发现根因、产品化表达和解题灵活性上优于GPT-5.6,尤其在“简短指令+模型自主拆解任务”场景下表现突出。这类评测也指向“提示词工程”本身可能在弱化:模型开始自己补全任务上下文。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。