YC最新研判:Harness(运行框架)正取代模型成为AI竞争核心变量
2026/09/20 19:09阅读量 4
ARC-AGI-3测试数据显示,同一模型GPT-6 Astra在不同Harness下得分从62.7%跃升至98.6%,且成本降低34%,证明模型能力已趋同,胜负手转向外部运行框架。YC据此判断,AI竞争重心正从“模型强弱”转向“如何组织模型”,Harness通过优化提示词、上下文管理及权限控制,能显著弥补小模型差距并解决企业级Agent的运维难题。
事件概述
2026年9月,ARC Prize公布的ARC-AGI-3测试结果引发行业震动。数据显示,在保持模型(GPT-6 Astra)和推理强度不变的情况下,仅更换外部运行框架(Harness),任务得分从62.7%提升至98.6%,同时计算成本下降约34%。基于此,Y Combinator (YC) 近期举办专题研讨,指出AI行业的竞争焦点已从底层模型能力的比拼,转移至对模型外部运行框架与组织方式的优化上。
核心信息
1. Harness定义与价值重构
- 概念界定:Harness指大模型执行真实任务时的外部运行框架,涵盖系统提示词设计、上下文管理、工具调用、记忆存储及子Agent分工等。如果说模型决定“大脑有多聪明”,Harness则决定“大脑干活时手里有什么资源”。
- 边际效应:随着基础模型能力趋于饱和,Harness成为拉开性能差距的关键变量。同一模型在不同Harness下的表现差异可达36个百分点,证明模型能力正逐渐变为“给定条件”,而如何高效组织模型成为新的核心竞争力。
2. 技术演进:Harness与模型边界打通
- 自动化优化:优化对象正从人工调优转向系统化迭代。例如DSPy系统可自动搜索最优提示词;Darwin Gödel Machine (DGM) 甚至能直接修改Harness代码,将SWE-bench成绩从20%提升至50%。
- 持续学习闭环:Continual Harness机制允许Agent回顾历史任务记录,动态调整提示词、技能库或子Agent配置,使经验沉淀进入下一轮运行,进一步模糊了模型训练与运行时优化的界限。
3. 架构创新:以Prime Agent为例
- 信息分层设计:Prime Intellect开发的Prime Agent采用“少流程、多资源”策略,将信息分为三层:当前上下文、持续运行的REPL环境(保存代码与进度)、外部长期存储(技能与记忆)。
- 长周期任务优势:在连续七天《异星工厂》模拟中,该架构支持Agent调用633个子Agent,产生超2300万Token。即便发生严重失误导致进度倒退,系统仍能基于保留的状态继续推进,而非从头开始,体现了Harness在维持状态连续性上的核心价值。
4. 降本增效:小模型的Harness补偿机制
- 本地化替代方案:斯坦福研究者Jon Saad-Falcon提出的OpenJarvis系统,通过五层架构优化,在Qwen3.5-9B参数不变的情况下,追回56%-77%的性能损失。
- 性能对比:优化后的本地方案在八项测试中平均准确率达80.3%,与云端前沿模型Claude Opus 4.6(83.5%)仅差3.2个百分点,其中四项测试实现反超。同时,边际API成本仅为云端的八百分之一,端到端延迟缩短至四分之一,证明了Harness在缩小本地小模型与云端大模型差距方面的巨大潜力。
5. 企业级挑战:运维与权限治理
- 规模化痛点:当Agent数量增加时,出现“主角综合征”(局部视角导致全局错误)、轻易放弃任务及权限失控等问题。
- YC内部实践:YC开发的QM Harness集中管理Agent状态,将虚拟机作为按需调用的资源。针对权限问题,采取数据库只读、写入需人工确认等措施。但研究指出,随着员工对Agent信任度提高,人工审核可能流于形式,真正的权限治理仍是企业部署Agent的最大障碍。
值得关注
- 行业风向转变:过去两年行业注意力集中于模型本身,未来差距将更多产生于“地基之上”。Harness不仅是工程优化手段,更是决定Agent能否稳定、长期运行的关键基础设施。
- 个人AI本地化趋势:通过Harness优化弥补模型能力差距,使得个人AI从云端走向本地设备成为可行路径,有望大幅降低隐私泄露风险和使用成本。
- 企业落地瓶颈:尽管技术层面已取得突破,但企业级Agent的规模化应用仍受制于复杂的运维管理和严格的权限控制体系,这将是下一阶段技术攻关的重点。
