編按:本文綜合整理自 Antoine 部落格原文、Hacker News 討論串(48708941)、Anthropic 官方公告:Claude for Healthcare、medRxiv 學術評測論文,並加入 Siami 編輯部觀點與分析。
軟體工程師 Antoine de Torcy 在右肩疼痛就診後,被診斷出「肩胛下肌腱(subscapularis tendon)頂端附著處有 Grade III(>50%寬度)部分撕裂」,並立即被建議展開密集療程。從診所出來後,他憑直覺覺得處置過於積極,回家後把 DICOM 原始影像(266 MB、近百張無副檔名的圖檔)丟給 Claude Code 裡跑的 Opus 4.8(xhigh)模型看。AI 跑了大約一小時,回覆的結論是:肌腱完好無破損(intact),根本沒有部分撕裂。
兩個診斷,一個說要開刀復健、一個說根本沒事,差距大到 Antoine 自己都形容「令人不安」。他把兩份報告再丟回去給 Opus 開第二輪「仲裁」,這次 Opus 用多個獨立子代理(sub-agents)平行分析、互不污染 context,最後裁定「讀者 A(人類放射科醫師)的診斷證據不足,傾向支持 Opus 自己的版本:輕微插入性肌腱變性,沒有看到任何局部或全層撕裂」。
這是迄今為止在 HN 上引發最熱烈討論的「AI 應用於醫療影像」個案(截稿時 360 分、473 則留言)。爭議焦點不在 Opus 究竟對不對,而是:當一位非專業人士拿 AI 看完自己的影像、結論跟醫師完全相反時,他到底該相信誰?
Opus 4.8 怎麼讀這份 MRI?
Antoine 把整個流程完整公開,最大亮點是「把 Claude Code 當成一個能裝套件、能跑 Python、能在 DICOM 上自幹影像處理的工作環境」。他給 Opus 的唯一 prompt 是「右肩疼痛 2–3 週」——比當初人類醫師得到的臨床資訊還要少。
Opus 拿到影像後,第一步是主動安裝所需的 Python 套件(含 pydicom、SimpleITK、scikit-image 等醫療影像工具),接著規劃一套完整的工作流:
- 把 DICOM 多幀影像序列重建成 3D 體素(voxel)模型
- 對肩胛下肌腱的頂端附著處做多平面重建(MPR)
- 跑邊緣偵測與訊號強度分析,標記疑似撕裂的高訊號區
- 拿同一份影像跟公開的肩關節 MRI 正常解剖資料集比對
最終 Opus 在 PDF 報告(7.72 MB)裡直接寫出結論:「該肌腱無撕裂跡象」。Antoine 看到這份結論時形容自己當下非常不安——他預期 AI 最多會說「撕裂程度較輕」,沒想到會是完全相反的判定。
第二輪仲裁:當兩個結論擺在一起
為了避免「AI 已經看過人類報告、被污染」這個盲點,Antoine 設計了一個聰明的方法:
- 建立獨立 context:第二輪完全不給 Opus 看第一份報告,只給兩份來源——人類放射科的原始影像判讀,加上他跟 ChatGPT 5.5 Pro 先前討論過的「肩膀活動測試清單」
- 開多個子代理平行跑:每個子代理只能看到原始 DICOM 與上述討論,不互相污染
- 讓 Opus 自己當仲裁者:最後再請 Opus 比較讀者 A(醫師)與讀者 B(自己)的結論並做出裁定
跑完大約一小時後,Opus 在第二份報告(4.72 MB)裡這樣寫:「證據傾向讀者 A(中至高度信心)。輕微插入性肌腱變性,未在頂端附著處發現明確的局部或全層撕裂。」
值得注意的是,Opus 並沒有為了取悅使用者而盲目採信人類醫師——它明確指出:「兩份報告中有些爭議我無法解決,但關於撕裂存不存在這件事,我可以做出相當明確的裁決。」
這種「知道自己能解決什麼、不能解決什麼」的校準能力,是這次實驗最具技術含量的一環。但同時也是 HN 討論最尖銳的問題——這種校準能力本身,也是模型訓練出來的、不是真的「知道」。
🚨 為什麼這件事重要
這則個案之所以在 HN 引爆討論(連非 AI 領域的放射科醫師、放射師也跑來留言),是因為它一次踩到了 AI 進入醫療現場的三條紅線:
- AI 變得「會拒絕」:當 Opus 在第二輪明確說「撕裂根本不存在」,這對一個沒有受過醫學訓練的患者來說,是極具說服力的結論——尤其當它還附帶完整的影像分析與量化數字。比起「我建議再找第二位醫師看」這種傳統建議,AI 直接給「答案」的誘惑極強。
- Claude Code 把 AI 變成「會自己裝工具的研究員」:Antoine 完全沒有自己寫任何影像處理程式碼,他只給了 Opus 一份 DICOM 與一句 prompt。Claude Code 內建的「自行安裝套件、跑子任務、寫腳本、產 PDF」能力,讓 LLM 從「對話框裡的助手」變成「能接管的代理人」——這是 2024 年初還做不到的事。
- 信任的兩難(paradox of trust):Antoine 在文章最後寫到,「把自己交給一個你信任的專家,那種感覺是無可取代的」,但這次經驗徹底打破這種信任結構。他既不能完全相信醫師(因為診斷可能太激進),也不能完全相信 AI(因為 AI 也有 hallucinate 的可能),於是他被困在一個「什麼都別相信」的灰區。
Anthropic 在 2026 年初已正式推出 Claude for Healthcare,主打 HIPAA 合規、不可用於模型訓練、針對臨床與行政流程優化。Antoine 的實驗某種意義上是這條產品線的「個人版實證」——證明 Opus 確實有能力消化真實醫療影像,但同時也示範了「個人 + LLM」模式的所有風險。
🚨 數據解讀與質疑
把這次實驗放回更大尺度的 AI 醫療診斷效能資料,會看到幾個值得警覺的數字:
- medRxiv 在 2026 年 2 月發表的 LLM 診斷糾錯評測中,測試「LLM 是否能在醫師誤診時提出異議」。結果:Gemini 2.5 Pro 糾錯率 55.0%、Claude Sonnet 3.5 為 48.5%、Sonnet 4 為 47.0%——最高的也只有一半出頭。換句話說,「AI 當第二意見」的命中率比擲銅板好一點,但不是壓倒性勝出。
- 沒有「domain knowledge 的驗證等於沒驗證」:HN 用戶 dirkt 與 palata 的對話是這次討論最精準的質疑——當病患自己沒有能力判斷 AI 講的對不對時,叫 AI「驗證 AI」根本是讓「最會說服的 LLM」贏,而不是「最正確的 LLM」贏。XorNot 進一步指出 LLM 預設就是訓練來「說服人」的,那句「你說得完全沒錯…」是 A/B test 留下來的設計,不是 bug。
- marcus_holmes 提到的金融業慘案:他自己公司把 LLM 當信用評估員時,發現同一份報告套在條件完全不同的公司上,會回一份「口氣、格式、可信度都一樣,但內容完全是憑空捏造」的版本——這就是 AI 對「說服力」的優化凌駕「準確度」的最佳實證。
- Antoine 本人最誠實的一句話:「I could also have misunderstood the doctors. So basically, none of this should be taken as medical advice :)」——連他自己都承認三方(醫師、Opus、自己)都有可能是錯的,但他沒有醫學背景,根本沒有裁判依據。
這也是為什麼醫療法規(無論台灣的《醫師法》還是美國 FDA 的 SaMD 規範)至今仍堅持 AI 診斷必須有「持照醫師在背後把關」這條紅線。Antoine 的實驗顯示,個人 + LLM 的去中間化模式雖然技術上可行,但在「驗證」、「責任歸屬」、「錯誤後果承受」三個層面都還沒有任何可對應的制度設計。
業界與社群怎麼看
這篇貼文在 HN 引出 473 則討論(截至 6/29 上午),多個關注點被反覆提出:
- 「LLM 之間互相審稿」可不可行? Esophagus4 與 scheme271 的辯論很關鍵——Esophagus4 認為「既然 code review 一個 agent 寫、一個 agent 審可以提升品質,醫療影像應該也可以」;scheme271 反駁說「code 可以跑 unit tests、可以編譯,但醫療診斷沒有 ground truth,多 LLM 互審只是『最會說服』的贏」。這個分歧目前沒有共識。
- 「為什麼不直接找第二位放射科醫師?」 RussianCow 的留言最尖銳:「如果都要第二意見了,直接找另一個真人放射科醫師就好,何必繞一圈 LLM?」。但 Antoine 的回應點出現實困境:在不少國家(包括歐洲)拿到第二位放射科醫師意見可能要等 3–6 週,AI 幾小時就能跑完,速度差是 LLM 進入醫療決策鏈最強的拉力。
- 「為什麼大家不再驗證答案?」 dirkt 提到,現在連工程師用 LLM 都常常不追溯來源就直接相信;放到醫療場景更危險,因為「連醫師自己都不一定能在自己專業外驗證 LLM 的結論」。
這幾條討論都指向同一個尚未解答的問題:當一個普通人能在 1 小時內用 AI 工具取得一份「看起來比醫師還詳細」的影像分析報告,醫病關係的權力結構會怎麼變?
結語:Siami 觀點
這則個案最大的價值不是「Opus 4.8 到底對不對」(沒人能確定,因為沒有第三位放射科醫師仲裁),而是它完整示範了「個人 + LLM + 程式化工具鏈」這個新型醫療決策模式的可行性與風險。
對一般讀者來說,這篇文章可以歸納出三條務實建議:
- AI 醫療影像分析目前最適合的角色是「個人教育」而非「診斷對抗」:拿 Opus 讀自己 MRI 的目的應該是「幫助自己問醫師更精準的問題」,不是「推翻醫師的診斷」。
- Claude Code 的「代理人 + 程式執行」能力是把雙刃劍:它讓沒有程式能力的患者也能跑完整影像分析,但也讓 LLM 的 hallucination 風險更難被察覺(因為錯誤結論會藏在看起來很專業的 PDF 裡)。
- 不要把「AI 結論 + AI 驗證」當成可信流程:沒有 domain expert 的把關,AI 之間的互審只會選出「最會說服」的那個,而非「最對」的那個。
Antoine 在文章最後一段寫道:「我的希望是,再幾代模型之後,我們能像信任 AI 校稿 email 一樣,信任 AI 幫我們讀 MRI。」這句話點出了整個產業的終極目標——但距離那一天,至少還差一整套法規、責任歸屬、驗證機制、以及把 LLM hallucination 從「特徵」變成「可量化指標」的技術突破。
資料來源
- Antoine 部落格原文(個人 first-hand 實驗紀錄)
- Hacker News 討論串 #48708941(473 則留言)
- Anthropic 官方公告:Advancing Claude in healthcare and the life sciences
- medRxiv:Evaluating the AI Potential as a Safety Net for Diagnosis
- NCBI/PMC:Ethical Responsibility in Medical AI(2026 系統性回顧)
- IntuitionLabs:Claude for Healthcare 2026 技術指南
網友熱門留言 (6)