AI聊天机器人在10000次回答测试中大部分资金问题回答错误

Saturn对18个AI模型的测试发现,大多数资金回答错误,更难的问题失败率上升。尽管存在风险,使用量仍在增长。

2026-09-20 14:56约 3 分钟阅读

英国金融科技公司Saturn报告称,主流AI模型在个人财务问题上有57%的回答错误,在更难的、多步骤问题上失败率高达88%。

这些发现正值消费者越来越多地使用聊天机器人寻求金融指导之际。

更困难的问题几乎让每个模型都失败

该研究向来自ChatGPT、Gemini、Claude和Copilot等提供商的18个免费和付费模型提出了121个问题,每个问题最多重复五次,共获得超过10000个回答。

测试认为如果一个回答存在事实错误、遗漏重要信息、缺少所需警告或其它不完整的情况,则判定为失败。

免费模型表现最差,63%的回答失败,而付费模型为49%,在最棘手的问题上失败率达到93%。

Claude Opus 5是表现最好的模型,但它仍有39%的失败率,错误包括计算错误、遗漏税收变化以及编造规则。

一个关于养老金税收的回答可能让储户面临英国税务海关总署17500英镑的账单。

“数百万人正信任AI模型寻求财务建议,但得到的却是错误答案,这可能导致他们损失金钱,”Saturn首席执行官Amal Jolly表示。

对AI聊天机器人的信任仍在持续上升

在不同地区和年龄组中,使用量在增长,安永(EY)一项针对18000人的全球调查发现,49%的人曾向AI寻求储蓄和投资建议。

8月份,英国金融监管机构表示,五分之四缺乏经验的投资者曾使用AI帮助进行投资,56%的受访者信任这些工具的程度超过电视或广播(信任度为47%)。

同一研究还发现,44%的人错误地认为AI生成的财务信息是受到监管的。

PensionBee对1000名美国成年人进行的一项调查发现,近六成的人会按照聊天机器人的资金指导采取行动而不进行复核,大约四分之一的人表示聊天机器人曾给他们提供错误的财务信息。

Jolly表示,AI财务建议仍不受监管,导致消费者无法获得像从人类顾问那里得到的赔偿权利,他呼吁FCA迅速采取行动。

分享至

免责声明:本文内容来源于第三方媒体,仅供参考,不构成任何投资建议。加密货币及其他金融产品存在较大价格波动风险,请谨慎决策。

相关文章