DigClaw预测框架拿下FutureX三席,AI预测能力正独立于基座模型成形

2026/08/25 10:16阅读量 2

DigClaw的预测框架Rhizome v1在FutureX实时预测榜单上基于三个不同基础模型分别取得第1、第3、第7名,成为唯一做到这一点的参赛方。该框架将搜索、因果推理与概率推断解耦,并将预测轨迹沉淀为可校准的数据资产。DigClaw已将该系统用于Newborn Ventures的投资决策,试图把趋势预测“Beta”模型化。

7月,DigClaw的预测框架Rhizome v1在FutureX实时预测榜单上同时拿下第1、第3、第7名。三个席位分别基于Kimi-K3、DeepSeek-V4-Pro等不同基础模型独立运行,同一套框架让三个基座全部进入Top 7,是唯一做到这一点的参赛方。评测包含59道覆盖政治、经济、科技领域的真实事件预测题,提交时标准答案尚未产生,事后结算;数据集托管在HuggingFace,评估框架开源在GitHub,结果可复现、可验证。

DigClaw的核心判断是:预测能力可以沉淀在基座模型之外。基座模型仍提供语言理解、推理和工具使用等通用能力,但如何组织检索、处理时间、表达概率、维护证据和控制长程运行,可以形成独立于模型权重的系统能力。随着基座进步,系统获得能力红利;预测轨迹、结算反馈、校准经验和持续演化的工作流则持续沉淀在系统内部。

在DigClaw看来,大语言模型天然不擅长预测:模型学习的是相关性而非因果性,存在因果方向盲区、干预推理失效和概率校准缺失三类问题。现有方案也各有局限:人类群体智慧需要流动性,冷门问题价格不可信;LLM模式匹配没有因果结构;端到端训练存在结果导向偏差。因此Rhizome将搜索、因果推理、概率推断作为三个正交能力,由专门系统分别解决后结构化组合。

Rhizome的三个设计决策

搜索与推理多模型解耦:搜索agent只负责发现所有关联信号,优化目标是信息相关性而非答案正确性;推理层只在已有证据上做结构化推理。训练采用强化学习框架SearchRL,开源模型以搜索相关性为reward做RL微调,闭源模型则通过外部搜索约束框架(harness)使用。不同基座在预测任务中呈现稳定差异:有的适合长时间检索与复杂推理,有的擅长定量建模,有的在成本和响应速度上占优;机构可根据任务价值与运行规模选择基座。

轨迹记录与概率校准:每次预测保存带版本信息的完整轨迹,包括题目条件、预测时可获得的证据、Agent编排与工具调用过程、最终答案与概率、模型和系统版本。事件结算后,将轨迹与现实结果对照,定位错误发生在检索、时间判断、推理、答案表达还是概率校准。对同一道题进行多次独立预测时,不在结果上简单平均,而是在对数几率空间聚合,再用已结算题目的Brier Score调整极端化强度,最后通过Platt缩放校正系统性的过度自信或保守。校准标准是:系统给出60%的事件,长期应约有六成发生。

因果链感知的持续更新:对未结算问题保存信念状态,每条证据记录事件发生时间、内容发布时间和系统读取时间。重复信息跳过更新,冲突证据保留判断被修正的过程;单次概率变化超过0.15时必须指向触发变化的具体新证据。为避免同一因果链上的多个信号被重复计算,Rhizome正在开发因果链感知的贝叶斯更新框架,包含因果知识库、同链信号去重、全局后验帽和传导时滞感知四个层次。该框架已在内部预测系统上完成原型实现和初步验证,并指导进行了多笔投资实践。实验显示,与直接贝叶斯聚合相比,同链信号去重和全局后验帽将过度自信率(预测概率高于85%但最终判断错误的比例)从约25%降至12%。

投资应用

DigClaw发起设立了Newborn Ventures,定位为AI原生的早期风险投资与孵化机构,以“AI挖掘Beta趋势”为驱动。其逻辑是:投资回报等于Beta(事件与趋势驱动)加Alpha(资产特异性),Alpha研究已相对成熟,而宏观事件和趋势预测的Beta目前缺乏有效AI方案。DigClaw的预测系统已在FutureX等公开评测平台获得外部验证,并将同一套能力应用于投资决策、产业趋势研判和战略风险评估等场景。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。