AI聊天機器人在10000次回答測試中大部分金錢問題回答錯誤

Saturn對18個AI模型的測試發現,大多數金錢回答錯誤,更難的問題失敗率上升。儘管存在風險,使用量仍在增長。

2026-09-20 14:56約 3 分鐘閱讀

英國金融科技公司Saturn報告稱,主流AI模型在個人財務問題上有57%的回答錯誤,在更難的、多步驟問題上失敗率高達88%。

這些發現正值消費者越來越常使用聊天機器人尋求金融指導之際。

更困難的問題幾乎讓每個模型都失敗

該研究向來自ChatGPT、Gemini、Claude和Copilot等提供商的18個免費和付費模型提出了121個問題,每個問題最多重複五次,共獲得超過10000個回答。

測試認為如果一個回答存在事實錯誤、遺漏重要資訊、缺少所需警告或其它不完整的情況,則判定為失敗。

免費模型表現最差,63%的回答失敗,而付費模型為49%,在最棘手的問題上失敗率達到93%。

Claude Opus 5是表現最好的模型,但它仍有39%的失敗率,錯誤包括計算錯誤、遺漏稅收變化以及編造規則。

一個關於養老金稅收的回答可能讓儲戶面臨英國稅務海關總署17500英鎊的帳單。

“數百萬人正信任AI模型尋求財務建議,但得到的卻是錯誤答案,這可能導致他們損失金錢,”Saturn首席執行長Amal Jolly表示。

對AI聊天機器人的信任仍在持續上升

在不同地區和年齡組中,使用量在增長,安永(EY)一項針對18000人的全球調查發現,49%的人曾向AI尋求儲蓄和投資建議。

8月份,英國金融監管機構表示,五分之四缺乏經驗的投資者曾使用AI幫助進行投資,56%的受訪者信任這些工具的程度超過電視或廣播(信任度為47%)。

同一研究還發現,44%的人錯誤地認為AI生成的財務資訊是受到監管的。

PensionBee對1000名美國成年人進行的一項調查發現,近六成的人會按照聊天機器人的資金指導採取行動而不進行覆核,大約四分之一的人表示聊天機器人曾給他們錯誤的財務資訊。

Jolly表示,AI財務建議仍不受監管,導致消費者無法獲得像從人類顧問那裡得到的賠償權利,他呼籲FCA迅速採取行動。

分享至

免責聲明:本文內容來源於第三方媒體,僅供參考,不構成任何投資建議。加密貨幣及其他金融產品存在較大價格波動風險,請謹慎決策。

相關文章