← 返回 Siami 首頁

工程師把右肩 MRI 丟給 Claude Opus 4.8 看第二意見:結果跟放射科醫師完全相反

▲ 360 💬 473
工程師把右肩 MRI 丟給 Claude Opus 4.8 看第二意見:結果跟放射科醫師完全相反

編按:本文綜合整理自 Antoine 部落格原文、Hacker News 討論串(48708941)、Anthropic 官方公告:Claude for Healthcare、medRxiv 學術評測論文,並加入 Siami 編輯部觀點與分析。

軟體工程師 Antoine de Torcy 在右肩疼痛就診後,被診斷出「肩胛下肌腱(subscapularis tendon)頂端附著處有 Grade III(>50%寬度)部分撕裂」,並立即被建議展開密集療程。從診所出來後,他憑直覺覺得處置過於積極,回家後把 DICOM 原始影像(266 MB、近百張無副檔名的圖檔)丟給 Claude Code 裡跑的 Opus 4.8(xhigh)模型看。AI 跑了大約一小時,回覆的結論是:肌腱完好無破損(intact),根本沒有部分撕裂。

兩個診斷,一個說要開刀復健、一個說根本沒事,差距大到 Antoine 自己都形容「令人不安」。他把兩份報告再丟回去給 Opus 開第二輪「仲裁」,這次 Opus 用多個獨立子代理(sub-agents)平行分析、互不污染 context,最後裁定「讀者 A(人類放射科醫師)的診斷證據不足,傾向支持 Opus 自己的版本:輕微插入性肌腱變性,沒有看到任何局部或全層撕裂」。

這是迄今為止在 HN 上引發最熱烈討論的「AI 應用於醫療影像」個案(截稿時 360 分、473 則留言)。爭議焦點不在 Opus 究竟對不對,而是:當一位非專業人士拿 AI 看完自己的影像、結論跟醫師完全相反時,他到底該相信誰?


Opus 4.8 怎麼讀這份 MRI?

Antoine 把整個流程完整公開,最大亮點是「把 Claude Code 當成一個能裝套件、能跑 Python、能在 DICOM 上自幹影像處理的工作環境」。他給 Opus 的唯一 prompt 是「右肩疼痛 2–3 週」——比當初人類醫師得到的臨床資訊還要少。

Opus 拿到影像後,第一步是主動安裝所需的 Python 套件(含 pydicom、SimpleITK、scikit-image 等醫療影像工具),接著規劃一套完整的工作流:

  • 把 DICOM 多幀影像序列重建成 3D 體素(voxel)模型
  • 對肩胛下肌腱的頂端附著處做多平面重建(MPR)
  • 跑邊緣偵測與訊號強度分析,標記疑似撕裂的高訊號區
  • 拿同一份影像跟公開的肩關節 MRI 正常解剖資料集比對

最終 Opus 在 PDF 報告(7.72 MB)裡直接寫出結論:「該肌腱無撕裂跡象」。Antoine 看到這份結論時形容自己當下非常不安——他預期 AI 最多會說「撕裂程度較輕」,沒想到會是完全相反的判定。


第二輪仲裁:當兩個結論擺在一起

為了避免「AI 已經看過人類報告、被污染」這個盲點,Antoine 設計了一個聰明的方法:

  1. 建立獨立 context:第二輪完全不給 Opus 看第一份報告,只給兩份來源——人類放射科的原始影像判讀,加上他跟 ChatGPT 5.5 Pro 先前討論過的「肩膀活動測試清單」
  2. 開多個子代理平行跑:每個子代理只能看到原始 DICOM 與上述討論,不互相污染
  3. 讓 Opus 自己當仲裁者:最後再請 Opus 比較讀者 A(醫師)與讀者 B(自己)的結論並做出裁定

跑完大約一小時後,Opus 在第二份報告(4.72 MB)裡這樣寫:「證據傾向讀者 A(中至高度信心)。輕微插入性肌腱變性,未在頂端附著處發現明確的局部或全層撕裂。」

值得注意的是,Opus 並沒有為了取悅使用者而盲目採信人類醫師——它明確指出:「兩份報告中有些爭議我無法解決,但關於撕裂存不存在這件事,我可以做出相當明確的裁決。」

這種「知道自己能解決什麼、不能解決什麼」的校準能力,是這次實驗最具技術含量的一環。但同時也是 HN 討論最尖銳的問題——這種校準能力本身,也是模型訓練出來的、不是真的「知道」。


🚨 為什麼這件事重要

這則個案之所以在 HN 引爆討論(連非 AI 領域的放射科醫師、放射師也跑來留言),是因為它一次踩到了 AI 進入醫療現場的三條紅線:

  • AI 變得「會拒絕」:當 Opus 在第二輪明確說「撕裂根本不存在」,這對一個沒有受過醫學訓練的患者來說,是極具說服力的結論——尤其當它還附帶完整的影像分析與量化數字。比起「我建議再找第二位醫師看」這種傳統建議,AI 直接給「答案」的誘惑極強。
  • Claude Code 把 AI 變成「會自己裝工具的研究員」:Antoine 完全沒有自己寫任何影像處理程式碼,他只給了 Opus 一份 DICOM 與一句 prompt。Claude Code 內建的「自行安裝套件、跑子任務、寫腳本、產 PDF」能力,讓 LLM 從「對話框裡的助手」變成「能接管的代理人」——這是 2024 年初還做不到的事。
  • 信任的兩難(paradox of trust):Antoine 在文章最後寫到,「把自己交給一個你信任的專家,那種感覺是無可取代的」,但這次經驗徹底打破這種信任結構。他既不能完全相信醫師(因為診斷可能太激進),也不能完全相信 AI(因為 AI 也有 hallucinate 的可能),於是他被困在一個「什麼都別相信」的灰區。

Anthropic 在 2026 年初已正式推出 Claude for Healthcare,主打 HIPAA 合規、不可用於模型訓練、針對臨床與行政流程優化。Antoine 的實驗某種意義上是這條產品線的「個人版實證」——證明 Opus 確實有能力消化真實醫療影像,但同時也示範了「個人 + LLM」模式的所有風險。


🚨 數據解讀與質疑

把這次實驗放回更大尺度的 AI 醫療診斷效能資料,會看到幾個值得警覺的數字:

  • medRxiv 在 2026 年 2 月發表的 LLM 診斷糾錯評測中,測試「LLM 是否能在醫師誤診時提出異議」。結果:Gemini 2.5 Pro 糾錯率 55.0%、Claude Sonnet 3.5 為 48.5%、Sonnet 4 為 47.0%——最高的也只有一半出頭。換句話說,「AI 當第二意見」的命中率比擲銅板好一點,但不是壓倒性勝出。
  • 沒有「domain knowledge 的驗證等於沒驗證」:HN 用戶 dirkt 與 palata 的對話是這次討論最精準的質疑——當病患自己沒有能力判斷 AI 講的對不對時,叫 AI「驗證 AI」根本是讓「最會說服的 LLM」贏,而不是「最正確的 LLM」贏。XorNot 進一步指出 LLM 預設就是訓練來「說服人」的,那句「你說得完全沒錯…」是 A/B test 留下來的設計,不是 bug。
  • marcus_holmes 提到的金融業慘案:他自己公司把 LLM 當信用評估員時,發現同一份報告套在條件完全不同的公司上,會回一份「口氣、格式、可信度都一樣,但內容完全是憑空捏造」的版本——這就是 AI 對「說服力」的優化凌駕「準確度」的最佳實證。
  • Antoine 本人最誠實的一句話:「I could also have misunderstood the doctors. So basically, none of this should be taken as medical advice :)」——連他自己都承認三方(醫師、Opus、自己)都有可能是錯的,但他沒有醫學背景,根本沒有裁判依據。

這也是為什麼醫療法規(無論台灣的《醫師法》還是美國 FDA 的 SaMD 規範)至今仍堅持 AI 診斷必須有「持照醫師在背後把關」這條紅線。Antoine 的實驗顯示,個人 + LLM 的去中間化模式雖然技術上可行,但在「驗證」、「責任歸屬」、「錯誤後果承受」三個層面都還沒有任何可對應的制度設計。


業界與社群怎麼看

這篇貼文在 HN 引出 473 則討論(截至 6/29 上午),多個關注點被反覆提出:

  • 「LLM 之間互相審稿」可不可行? Esophagus4 與 scheme271 的辯論很關鍵——Esophagus4 認為「既然 code review 一個 agent 寫、一個 agent 審可以提升品質,醫療影像應該也可以」;scheme271 反駁說「code 可以跑 unit tests、可以編譯,但醫療診斷沒有 ground truth,多 LLM 互審只是『最會說服』的贏」。這個分歧目前沒有共識。
  • 「為什麼不直接找第二位放射科醫師?」 RussianCow 的留言最尖銳:「如果都要第二意見了,直接找另一個真人放射科醫師就好,何必繞一圈 LLM?」。但 Antoine 的回應點出現實困境:在不少國家(包括歐洲)拿到第二位放射科醫師意見可能要等 3–6 週,AI 幾小時就能跑完,速度差是 LLM 進入醫療決策鏈最強的拉力。
  • 「為什麼大家不再驗證答案?」 dirkt 提到,現在連工程師用 LLM 都常常不追溯來源就直接相信;放到醫療場景更危險,因為「連醫師自己都不一定能在自己專業外驗證 LLM 的結論」。

這幾條討論都指向同一個尚未解答的問題:當一個普通人能在 1 小時內用 AI 工具取得一份「看起來比醫師還詳細」的影像分析報告,醫病關係的權力結構會怎麼變?


結語:Siami 觀點

這則個案最大的價值不是「Opus 4.8 到底對不對」(沒人能確定,因為沒有第三位放射科醫師仲裁),而是它完整示範了「個人 + LLM + 程式化工具鏈」這個新型醫療決策模式的可行性與風險。

對一般讀者來說,這篇文章可以歸納出三條務實建議:

  • AI 醫療影像分析目前最適合的角色是「個人教育」而非「診斷對抗」:拿 Opus 讀自己 MRI 的目的應該是「幫助自己問醫師更精準的問題」,不是「推翻醫師的診斷」。
  • Claude Code 的「代理人 + 程式執行」能力是把雙刃劍:它讓沒有程式能力的患者也能跑完整影像分析,但也讓 LLM 的 hallucination 風險更難被察覺(因為錯誤結論會藏在看起來很專業的 PDF 裡)。
  • 不要把「AI 結論 + AI 驗證」當成可信流程:沒有 domain expert 的把關,AI 之間的互審只會選出「最會說服」的那個,而非「最對」的那個。

Antoine 在文章最後一段寫道:「我的希望是,再幾代模型之後,我們能像信任 AI 校稿 email 一樣,信任 AI 幫我們讀 MRI。」這句話點出了整個產業的終極目標——但距離那一天,至少還差一整套法規、責任歸屬、驗證機制、以及把 LLM hallucination 從「特徵」變成「可量化指標」的技術突破。


資料來源

網友熱門留言 (6)

#1 AceJohnny2 0
原文那句話真是核心:「把自己交給一個你信任的專家,那種安心是無可取代的,但 AI 卻能用讓人不舒服的方式徹底摧毀這種感覺。我們都知道不能完全相信 AI,但同時也不太信任這位醫生」。這正是這整件事最難解的張力。
#2 Aurornis 0
手上隨時都有好幾個 LLM 訂閱,還跑一票本地模型。遇到專業外的問題,所有能用的 LLM 都會問一輪,也會開新 session、用不同問法問同一件事。每家答案差多少,總是很震撼。
#3 marcus_holmes 0
公司之前也試過用 LLM 做信用評估工具,報告寫得煞有介事,細節多到看起來超專業。但跑了一輪測試,把同一份報告套在完全不同條件的公司上,結果它會用同樣的口氣、同樣的格式,回一份看起來一樣可信、但完全是憑空捏造的內容。
#4 yen223 0
這裡有人不知道「第二意見」這回事,就是因為人類讀同一份影像也會意見不一致嗎?這不只是 LLM 的問題。
#5 XorNot 0
更糟的是 LLM 預設就是訓練來「說服人」的。那句「你說得完全沒錯…」其來有自——這些模型在 A/B test 中,反應的「感覺」就是被打分打得最高的那個。研究早就告訴我們,人類會被 vibe 影響,比實質品質還更買單。
#6 dirkt 0
現在到底還有沒有人在「驗證」AI 的答案?問 LLM 都會去追溯原始出處,看實際內容撐不撐得起來。但實話說,十次有九次那些來源根本沒講 LLM 講的那件事。