Saturn研究:主流AI财务问答错误率高达57%,付费及推理模型表现略优

2026/09/21 21:39阅读量 3

Saturn的一项最新研究显示,ChatGPT、Claude、Copilot、Grok和Gemini等主流AI模型在回答财务相关问题时,平均有57%会给出错误答案。研究测试了18种AI模型共逾10,000个问题,发现错误主要源于计算失误、遗漏税收政策变更或凭空捏造规则(幻觉)。尽管付费模型和新模型表现优于免费及旧模型,但即使是表现最佳的推理模式Claude Opus 5,其错误率仍高达39%。

事件概述

Saturn发布了一项关于人工智能在财务领域准确性的研究报告。该研究针对ChatGPT、Claude、Copilot、Grok和Gemini等主流AI模型进行了大规模测试,揭示了当前AI在处理复杂财务问题时的显著缺陷。

核心信息

  • 测试规模与方法:研究使用了超过100个财务相关问题,对18种不同的AI模型(包括免费和付费版本)进行了测试。每个问题最多重复提问五次,累计提出逾10,000个问题。
  • 整体错误率:主流AI模型在回答财务问题时,平均有57%的概率给出错误答案。
  • 错误类型:AI的回答中常见的错误包括数学计算错误、遗漏即将实施的税收政策变更,以及“幻觉”现象(即凭空捏造不存在的规则或条款)。
  • 严重性:依赖AI提供的税务建议可能导致严重的经济损失。

值得关注

  • 模型差异:研究发现,付费模型的表现普遍优于免费模型;较新的模型版本表现也优于较旧的版本。
  • 最佳表现者局限:在所有测试模型中,表现最好的是具备推理能力的Claude Opus 5,但其错误率依然高达39%。这表明即使是目前最先进的AI技术,在需要高度精确和专业知识的财务领域仍存在较大风险。

参考来源

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。