J-Space Skill宣称让DeepSeek V4 Pro超越Fable 5?社区复测结果相反
J-Space Cognition Suite V3.6宣称只需一个Skill即可让DeepSeek V4 Pro在多个基准上大幅提升,甚至超越Fable 5,但社区复测未复现提升,反而消耗更多Token。面对质疑,作者未公开完整评测记录,还被曝删除issue。事件暴露出V4 Pro对外部运行环境的敏感性,也提醒对“惊人提升”需保持审慎。
事件概述
J-Space Cognition Suite V3.6 是一套“模型无关”的推理时控制方案,不修改模型权重、不要求微调,而是以 Skill 形式接入 Agent 运行环境。其作者宣称,接入后 DeepSeek V4 Pro 在多个基准上大幅提升,部分成绩超过 Fable 5,速度和 Token 效率也能提高两倍以上。
方案试图解决 Agent 常见的四类失控问题:工作集过载、表征漂移、无效重试和过早完成。它通过限制工作区活跃内容,并将关键目标、已验证信息、未解决问题和下一步操作写入外部账本,让模型在长程任务中不偏离目标。
宣称与复测数据
- 报告宣称:V4 Pro 的 Terminal Bench 从 87.9 提高到 90.1,NL2Repo 从 61.5 跃升至 73.4,DeepSWE 从 62.7 提高到 72.0;在部分 Agent 与编程基准上超过 Fable 5 和 Opus 4.8。
- 社区复测(Issue#10):开发者使用 V4 Flash 进行两轮 A/B 测试,覆盖数学推理、代码生成、仓库开发和中断恢复。第二轮中两组各运行 3 次,最终任务完成度无明显差异,但 J-Space 组资源消耗更多;第三方盲评中,对照组平均得分 8.30,J-Space 组仅 7.87。
- 更实锤的复测(Issue#26):用户用 8 张 NVIDIA H20 部署 V4 Flash,并通过 DeepSeek Harness Standard 模式加载 J-Space,89 道题通过 69 道,得分 77.5%,而报告对应成绩为 87.1%。失败任务重跑至少 3 次仍未提升。
- 有开发者称自己此前发布的质疑 Issue 被作者删除,只能重新发帖备份;作者始终未公开完整评测环境、测试流程和样本输出。
背后背景
J-Space 之所以有迷惑性,在于它踩中了 DeepSeek V4 Pro 的真实痛点——对外部运行环境过于敏感。同一模型在 DeepSeek Harness 的 Standard、PTC、Minimal 模式下,同一任务得分可从 91~92 分变化到 96~99 分,外部环境可带来接近 8 分的差距。
社区也已出现针对性方案:Routing Suite 根据任务类型选择推理模式,Anchored Standard 则先以简短提示和少量工具让 V4 Pro 进入稳定轨迹,再开放完整工具能力。
值得关注
能被复现的提升才叫提升。本次事件提醒,面对“一个插件让模型能力大幅跃升”的结论,应重点核查评测环境、运行日志和完整过程的公开程度,而非被孤立数字说服。
