Saturn研究:主流AI财务问答错误率高达57%,付费及推理模型表现略优
2026/09/21 21:39阅读量 3
Saturn的一项最新研究显示,ChatGPT、Claude、Copilot、Grok和Gemini等主流AI模型在回答财务相关问题时,平均有57%会给出错误答案。研究测试了18种AI模型共逾10,000个问题,发现错误主要源于计算失误、遗漏税收政策变更或凭空捏造规则(幻觉)。尽管付费模型和新模型表现优于免费及旧模型,但即使是表现最佳的推理模式Claude Opus 5,其错误率仍高达39%。
事件概述
Saturn发布了一项关于人工智能在财务领域准确性的研究报告。该研究针对ChatGPT、Claude、Copilot、Grok和Gemini等主流AI模型进行了大规模测试,揭示了当前AI在处理复杂财务问题时的显著缺陷。
核心信息
- 测试规模与方法:研究使用了超过100个财务相关问题,对18种不同的AI模型(包括免费和付费版本)进行了测试。每个问题最多重复提问五次,累计提出逾10,000个问题。
- 整体错误率:主流AI模型在回答财务问题时,平均有57%的概率给出错误答案。
- 错误类型:AI的回答中常见的错误包括数学计算错误、遗漏即将实施的税收政策变更,以及“幻觉”现象(即凭空捏造不存在的规则或条款)。
- 严重性:依赖AI提供的税务建议可能导致严重的经济损失。
值得关注
- 模型差异:研究发现,付费模型的表现普遍优于免费模型;较新的模型版本表现也优于较旧的版本。
- 最佳表现者局限:在所有测试模型中,表现最好的是具备推理能力的Claude Opus 5,但其错误率依然高达39%。这表明即使是目前最先进的AI技术,在需要高度精确和专业知识的财务领域仍存在较大风险。
