J-Space 被证伪后,思维链作者 Jason Wei 直言:小模型加工具替代不了大模型

2026/08/20 11:53阅读量 2

开源项目 J-Space Cognition Suite 宣称仅靠 DeepSeek V4 Flash 加外部 Harness 即可追平甚至超越顶级模型,但被 GitHub 用户 GoForceX 用 Terminal Bench 独立复测证伪,作者承认数据“确实夸张”却无法提供可复现日志。思维链核心发明者 Jason Wei 随即发文指出,小模型加工具在速度、深度与可靠性上均无法与大模型的内化能力相比;DSPy 框架作者 Omar Khattab 也从数学层面呼应了这一判断。

事件概述

  • 开源项目 J-Space Cognition Suite 近日在 X 平台引发关注。项目宣称无需修改模型权重,仅用 DeepSeek V4 Flash 搭配外部 Harness,就可在 Agent 任务中追平 GLM-5.3;换用 DeepSeek V4 Pro 后,甚至宣称能超越 Claude Fable 5,同时实现速度提升 2.53 倍、Token 效率提升 2.21 倍。
  • GitHub 用户 GoForceX 按项目说明使用 Terminal Bench 独立复测,结果与宣传完全相反:加入 J-Space 后基准测试分数下降、Token 消耗增加、推理速度变慢。当社区要求公开原始实验数据时,作者承认“确实夸张”,但始终未提供可复现的运行日志,反而删除了质疑 issue。

核心信息:小模型+工具的三大硬伤

思维链(Chain-of-Thought)核心发明者、OpenAI 成员 Jason Wei 在 X 上发表长文,用学羽毛球的经历类比,指出“小模型+工具”与“大模型内化能力”有本质区别。他归纳了三点差距:

  1. 速度:大模型把知识内化在参数中,端到端输出延迟最低;小模型则要经历“判断是否调用工具→构造查询→等待返回→筛选信息→整合答案”的完整链路,多步推理时耗时指数级上升。J-Space 声称的“速度提升 2.53 倍”违背基本逻辑——Harness 本身就是额外控制层,只会增加计算和 Token 消耗。
  2. 深度与归纳:大模型在预训练中消化海量数据,能综合数万条评价提炼全局印象;小模型只能依赖搜索到的局部信息,Harness 可以优化搜索路径,但无法凭空赋予模型高维抽象能力。
  3. 可靠性:长周期任务中每一步微小误差会不断累积,最终导致任务偏移。小模型元认知较弱,再叠加外部工具层层转接,出错概率更高。J-Space 复测中的“性能小幅下降”正是典型表现。

Jason Wei 强调:“模型不依赖外部工具,自然且快速地完成任务,这件事至关重要。”工具只是放大器,不是发动机。

背景:J-Space 为何引发狂欢

  • 该项目切中了行业两大焦虑:大模型成本过高、算力不够;端侧设备太弱、难以落地。
  • AI 大牛吴恩达曾展示 GPT-3.5 配合迭代式 Agent 工作流,在多项基准测试上超越当时的 GPT-4;微软 Phi-4、Mistral 等小模型也在代码、数学等垂直任务上击败过上一代千亿参数模型。
  • 今年 7 月,卡内基梅隆大学论文《Better Harnesses, Smaller Models》提出,高度优化的 Harness 框架可让小模型在特定任务上恢复大模型 90% 以上性能,成本可忽略不计。这类研究进一步强化了对“小模型+工具”路线的期待。

业内回应与理论支撑

  • Jason Wei 的认知转变:他曾对大模型规模论持怀疑态度,在 Google Brain 期间推动思维链研究。但后续研究发现,思维链在小模型上不仅不会提升性能,反而会因错误的中间推理步骤导致成绩下降;他的《Emergent Abilities of Large Language Models》论文也指出,高阶能力往往在约 100B 参数规模后才涌现,小模型无论怎样调提示词或加外挂,都难以获得高阶智商。
  • DSPy 框架之父 Omar Khattab 从数学层面呼应:大模型注意力机制将完整上下文保留在显存中,以“全知视角”处理信息;小模型+工具本质是压缩与递归,复杂信息在反复“脱水”传递中大量丢失。其团队在《Machine Studying》论文中还提出,判断专业能力应看“用多少推理计算量换多高准确率”,专家型 Agent 在低计算预算下就能有好的表现,新手型 Agent 则要消耗大量 Token 反复试错。

值得关注

  • 这场争论再次指向 AI 领域经典文章——Rich Sutton 的《苦涩的教训》:人类精巧的工程设计,最终往往被绝对算力和数据规模碾压。70 年代的专家系统、NLP 特征工程、知识图谱,都是前人试图用巧思走捷径,最终败给端到端大规模学习的例子。
  • 不过,成本现实仍让“小模型+Harness”有市场。有开发者认为商业场景里多数任务只需要“60 分智能+100 分执行”,性价比高于追求顶级智能;也有观点预测,未来会走向多个十亿级专家模型协同的中间状态,类似 MoE 架构的延伸。Omar Khattab 本人不否认 Harness 的工程价值,但明确认为它不能替代模型自身能力。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。