編按:本文綜合整理自 Financial Times 頭版報導、Saturn 研究公司原始研究、英國 PensionBee《2026 AI and Your Money Report》,並加入 Siami 編輯部觀點與分析。
研究背景與測試範圍
英國金融科技公司 Saturn 在 2026 年 9 月發布一份針對 AI 聊天機器人的大規模金融準確率研究。測試對象涵蓋 18 個 AI 模型,包括市面上最主流的 ChatGPT、Claude、Copilot、Grok 與 Gemini;題目庫高達 1 萬題,分成個人理財、稅務、退休規劃、投資組合、信用卡規則等多個類別,每題由金融專家預先標註正確答案。
研究團隊同時針對難度分層:簡單題(基本概念,例如「什麼是 Roth IRA」)與複雜題(需要綜合判斷當年度稅法與跨年度規則變化的問題,例如英國 ISA 配額調整後的稅務影響)。
核心數據:57% 答錯率
整體而言,18 個 AI 模型平均答錯率為 57%,也就是說,每兩題中至少有一題的答案不正確。這還沒區分難度,是「簡單 + 複雜」的混合結果。
但這個數字還不是最糟的。研究進一步把題目拆成「簡單題」與「複雜題」:
- 簡單題:錯誤率落在 42% – 50% 之間,已接近擲銅板機率
- 複雜題:錯誤率飆到 88% – 99%,幾乎是全錯
換句話說,當使用者詢問的是「我能不能這樣報稅?」「這筆海外匯款要不要申報?」這類需要精確法條的問題時,AI 大概率會給錯答案。
更有甚者,Saturn 報告直接點出:
「在最糟的情境下,依賴 AI 的稅務建議可能導致嚴重的財務損失。」── Saturn CEO Amal Jolly
報告原文也提到,部分聊天機器人會忽略即將生效的稅法變更,甚至憑空捏造不存在的規則。這種「幻覺」並不是罕見案例,而是高頻發生的系統性失誤。
消費者端:57% 不查證就照做
金融模型的準確率已經夠慘了,但使用者端的行為讓情況雪上加霜。PensionBee 在 9 月 17 日同步發布的《2026 AI and Your Money Report》調查 1,000 名美國成人,結果發現:
- 57% 使用 AI 聊天機器人問理財問題的受訪者,會直接照做,不會再交叉查證
- 23% 表示曾因聊天機器人的建議而做出難以挽回的決定(例如開始一筆投資、變更退休計畫、申請特定貸款)
- 兩成三的 Gen Z 受訪者表示願意讓 AI 代替自己做出財務決策
這兩個獨立研究的數字剛好都是 57%,但意思完全不同:
| 研究 | 57% 代表什麼 |
|---|---|
| Saturn(AI 模型測試) | 18 個模型平均答錯率 |
| PensionBee(使用者調查) | 美國消費者不查證就照做的比例 |
兩份研究的數字互相強化了一個訊號:模型答不準,使用者又不驗證,最後吃虧的就是一般民眾的荷包。
為什麼這件事重要
這不是學術問題,而是會直接影響一般人財務決策的實務風險。
以美國為例,每年 1 月到 4 月報稅季,使用 ChatGPT、Gemini、Claude 查稅務問題的人數會暴增。2025 年的內部數據(從外部研究估算)顯示,每四位美國納稅人就有近一位使用 AI 協助準備申報書。如果這些人有近半拿到的是錯誤答案,且其中 57% 不會再問第二個來源,那每四位納稅人裡就會有一位在 IRS 報稅系統留下錯誤資料。
英國的情境也類似。從 2026 年 4 月起,英國 ISA(個人儲蓄帳戶)的配額與稅務規則都有調整,而 Saturn 報告特別點出「部分 AI 模型會忽略這種即將生效的法規變更」。換言之,今年英國使用者拿到的「AI 理財建議」,可能是基於去年已經失效的規則。
更嚴重的是,這類錯誤很難被察覺。AI 聊天機器人的回應口吻非常自信,語氣像專家,使用者很難從語氣分辨對錯。這跟 Google 搜尋結果列出一堆連結、需要自己交叉比對的體驗完全不同——AI 給的是「單一權威答案」,沒有對照組。
數據解讀與質疑
質疑點一:Saturn 是 AI 金融工具公司,跟 OpenAI、Anthropic 是競爭關係。這份研究的動機是否純粹?
回頭看 Saturn 的商業模式:他們做的是「給財富管理顧問用的 AI 後台工具」,目標客群是專業金融從業者。從這角度看,他們發布「消費級 AI 模型答錯率高」的研究,對自家 B2B 產品線是有效的市場區隔策略——「你看消費級模型不行吧?專業人士還是需要 Saturn」。這個利益衝突值得讀者留意。
質疑點二:57% 答錯率看似驚人,但「金融問題」的定義是什麼?
如果題庫包含「2026 年英國 ISA 配額具體數字」「美國 Roth IRA 2025 年改革條款細節」這類極度細節的問題,那 57% 答錯其實不算意外——因為這些問題連 Google 搜尋都不一定找得到最新答案,把 AI 模型拿來跟「即時更新的法規資料庫」比較,本身就有點不公平。
但反過來說,這正是普羅大眾使用 AI 的真實情境:他們就是會拿這種細節問題去問 AI。研究團隊測的,正是消費者真正會問的題目,不是學術題庫。
質疑點三:使用者「不查證就照做」的 57% 是不是太高?
PensionBee 調查的母體是「自陳使用 AI 處理財務」的美國成人,可能存在自我選擇偏差——願意填寫這份問卷的人,本身就對 AI 比較信任。實際數字可能比 57% 低一些,但方向不會錯。
主流模型細節
根據多家媒體轉述的 Saturn 報告內容,18 個受測模型橫跨消費級與企業級版本,包含 ChatGPT(GPT-5 系列)、Claude(Opus 4 與 Sonnet 4)、Google Gemini(2.5 Pro)、Microsoft Copilot(Grok 整合版)、xAI Grok 3、Meta Llama 金融微調版等。
報告並未公布完整的逐模型排行榜,只在摘要中點名部分主流模型在最難題目上錯誤率達 99%,但沒有說是哪幾家。這個資訊缺口讓批評者難以獨立驗證。
值得注意的是,報告也沒有區分「幻覺」與「知識截止」。一個模型給出錯誤答案,可能是因為它訓練資料停留在 2024 年、不知道 2026 年的新規則(這是知識截止),也可能是它編造了一個看起來合理但根本沒這回事的規則(這才是幻覺)。把這兩種錯誤混為一談,會讓「AI 不準」的指控失焦。
HN 社群反應
在 Hacker News 上,這篇文章獲得 106 個推與 46 則留言(截稿前),討論熱度集中在「測試方法是否公允」「為何使用者願意直接照做」「有沒有更好的工作流」三條線。
「重點是這裡測的是模型本身的能力,不是聊天工具的整體能力。完整的聊天產品會把模型回答跟搜尋、計算器、外部 API 結合起來。」── FearNotDaniel
「我寧可用 AI 助理幫我寫 Python 腳本算財務,再自己 double check 結果,也不要直接叫聊天機器人給我答案。」── sixtyj
多數高票留言的共識是:模型本身可以拿來當工具輔助,但不能當作單一權威答案來源。也有人建議把 AI 生成的答案當作「快速 ctrl-F」——你知道答案在某份 PDF 裡,把整份丟給模型問,比自己翻快。這是當前較務實的工作流。
主管機關的態度
英國 FCA(金融行為監理局)今年 8 月已對外表示,消費者使用 AI 工具取得的財務建議,不受金融服務賠償機制(FSCS)保障。也就是說,如果消費者因 AI 給的錯誤答案而虧損,無法向監理機關求償。
美國 SEC 雖然尚未針對消費級 AI 金融建議發布專法,但 2026 年 7 月已將「AI 洗牌」列為新一輪投資人警示主題,提醒民眾注意「AI 選股」「AI 報稅」類服務的可信度落差。
從監理角度,AI 模型目前定位為「工具」而非「顧問」,這也意味著責任歸屬仍落在使用者身上。短期內不會有專法把 AI 聊天機器人納入金融顧問的監理範疇。
該怎麼用 AI 處理財務問題
綜合 Saturn 報告、PensionBee 調查與 HN 社群討論,比較務實的工作流是:
- 把 AI 當搜尋引擎,不當決策者:用它找資料、列選項、解釋概念,但不要直接拿它的結論去做決定
- 重要數字自己驗算:稅率、配額、利率、計算結果,最少要用一個獨立來源(政府官網、財報、計算機)交叉驗證
- 可逆決策 vs 不可逆決策分開處理:選 ETF、調整預算這種可逆的決定可以用 AI 加速;但報稅、買房貸款、退休提領這種不可逆的決定,最後一道手一定要人工把關
- 用 AI 寫 Python 自己算:與其叫 AI 給你數字,不如叫 AI 寫程式去計算結果,程式碼至少可以反覆執行驗證
Financial Times 這篇頭版報導的真正訊號,不是「AI 不能用」,而是「AI 在金融領域的定位需要被重新校準」——它是工具,不是顧問。在 Saturn 報告公布的 88% 難題錯誤率下,把 AI 當唯一答案來源的人,正在用自己荷包幫模型廠商做 beta 測試。
編按:本文綜合整理自 Financial Times 原文、Saturn 報告、PensionBee 2026 AI and Your Money Report,並加入 Siami 編輯部觀點與分析。
網友熱門留言 (5)