Anthropic发布Fable 5.1:强化Agent长程任务能力,IPO前夕秀肌肉
Anthropic在IPO前夕突然发布Fable 5.1及Mythos 5.1模型,重点优化长时间、多步骤的Agent任务性能,并大幅降低缓存读取成本。其中Mythos 5.1面向经过验证的科研与安全机构开放,展示了蛋白质设计、金星地图重建等前沿AI for Science成果。与此同时,Anthropic推出反蒸馏机制及企业级安全方案EFS,以应对核心能力保护与企业合规需求。
事件概述
Anthropic于2026年9月2日凌晨发布新一代旗舰模型Fable 5.1及其科研专用版本Mythos 5.1。此次发布被视为Anthropic在正式提交IPO招股书前的最后一次重大技术展示。两款模型在底层架构上保持一致,主要区别在于安全限制范围及目标用户群体。
核心信息
1. 性能提升:聚焦长程Agent任务
Fable 5.1并未在所有基准测试中全面超越前代,其核心优势集中在需要连续调用工具、处理复杂逻辑的长周期任务上:
- Benchmark数据:
- Terminal-Bench-Science 0.1得分从24.7%提升至52.6%(翻倍)。
- AutomationBench得分从17.1%提升至31.4%。
- Terminal-Bench 4.0得分从42.0%提升至55.8%。
- 传统推理与编码:提升幅度相对温和,如Humanity's Last Exam从57.8%升至60.9%,CursorBench从70.5%升至73.4%。
- 企业实测案例:
- Ramp:模型在无干预情况下连续运行38小时,自主发现机器学习实验中的标签伪影问题,修正后并行启动新实验并给出修复方案。
- Canva:在生成质量盲测中优于Fable 5,并能直接生成包含关卡、音乐及节奏对应的完整游戏原型。
2. 定价策略:降低长期运行成本
尽管基础输入/输出价格保持不变($10/$50 per million tokens),但Anthropic大幅降低了缓存读取价格,以鼓励复杂工作负载的使用:
- 缓存读取降价:从$1/million tokens降至$0.25/million tokens,降幅达75%。
- 成本影响:对于上下文重、工具调用多的复杂Coding和Agent任务,整体成本预计下降约45%;典型工作负载整体成本下降约25%。
- 争议点:此前Anthropic调整Claude Code周额度政策引发用户不满,名义上提高25%实则较临时额度下降17%,导致社区对透明度要求更高。
3. Mythos 5.1:科研与安全领域的突破
Mythos 5.1与Fable 5.1模型权重相同,但移除了部分针对网络安全和生命科学的高风险安全限制,仅向经过验证的机构开放。其在AI for Science领域展示了显著潜力:
- 蛋白质设计:利用开源工具设计binder,在12个靶点上命中率接近50%(行业平均为10%-15%),部分亲和力比现有最佳方案高10倍。
- 行星科学:利用NASA旧雷达数据训练神经网络,重新生成金星高分辨率高程地图,地形细节分辨率从10-20公里提升至2-3公里,准确度提高约25%。
- 计算优化:为7个开源生物模型编写定制GPU Kernel,推理速度最高提升2.5倍,GPU成本降低30%-60%。
4. 安全与基础设施升级
为配合模型进入高价值科研和企业场景,Anthropic同步推出了两项关键安全措施:
- 反蒸馏机制:Fable 5.1禁止API用户修改历史上下文以保留Thinking记录,封堵外部模型通过收集推理轨迹进行知识蒸馏的路径。
- Enterprise Frontier Safeguards (EFS):允许金融、医疗等企业将监控数据存储在自有云基础设施中,而非Anthropic服务器,解决敏感数据合规存储问题,已与超100家企业客户共同开发。
值得关注
此次发布正值Anthropic IPO关键节点。据The Information报道,Anthropic已秘密提交IPO文件,预计将于9月7日美国劳动节后公开招股书,并在9月中旬举行投资者日,最快于9月底至10月初上市。此次技术更新旨在向市场展示其在Agent自动化及垂直领域科研应用上的商业化落地能力。
