← 返回 Siami 首頁

Livenerf:用 30 天時間序列追蹤 Claude Opus 5.5 有沒有被悄悄降級

▲ 347 💬 147
Livenerf:用 30 天時間序列追蹤 Claude Opus 5.5 有沒有被悄悄降級

編按:本文綜合整理自 Livenerf GitHub Repository、Hacker News 討論串 (item 49901736)、explainx.ai 分析、mindstudio.ai 時間軸、andy.cm64.io nerf cycle 分析,並加入 Siami 編輯部觀點與分析。

Livenerf 是什麼

livenerf 是一個 GitHub 開源基準測試,由開發者 ninjahawk 在 2026 年 9 月 22 日 Claude Opus 5.5 推出當天啟動。它只回答一個問題:前沿模型在正式上線後,有沒有被悄悄變差。

過去幾個月,社群裡一直有人抱怨 Anthropic「nerf」模型 — 也就是模型在上線幾天或幾週後,變得比 launch day 弱。這個「nerf」可能來自量化、把模型換成較小的版本、降低推理 effort、或改 routing。也有可能什麼都沒發生,只是社群在 noise 裡 pattern-match。因為沒有人手上有乾淨的 day-0 baseline,所有爭論最後都變成「vibes 對 vibes」。

livenerf 是一個「小、無聊、append-only」的基準 — 它把一切無法控制的東西(取樣參數、thinking)當作既定,然後讓其他所有東西完全確定:frozen prompts、pinned CLI、精準評分、永久保存的 raw logs。

livenerf 跑在 Claude Max 訂閱的 headless claude -p 上,完全不用 API key。因為這套設計,使用者不用花 API 額度就能跑 30 天的時間序列。


設計:從 2,336 題到 78 題的精準 panel

livenerf 不是隨便抓幾題 benchmark 就跑。它從 GPQA Diamond、MMLU-Pro、competition-math、AIME 2025-26 共 2,336 題出發,每題先用 4 個樣本篩選。

篩選結果顯示:

  • Opus 5.5 一開始就答對 93% 的題目
  • 97% 的題目永遠答對或永遠答錯(對 drift 沒資訊)
  • 剩下 78 題「有時答對、有時答錯」 才是 panel

這 78 題才是有意義的訊號源 — 因為一道題答對率 p 在 logit-shift 模型下的訊息量是 p(1−p),只有「搖擺題」才有統計意義。

更細緻的校正:selection bias 的實測。篩出來的「有時對」題目看起來接近 50/50,但實際對新鮮樣本跑,答對率從 54.7% 上升到 62.0%。livenerf 用真實的新鮮率算 power calculation,而不是用樣本率,避免高估儀器靈敏度。


雙臂試驗:把平台噪音從模型噪音裡分離

livenerf 最聰明的設計是雙臂:

  • 主要臂:Opus 5.5 在 panel 上每天跑 90 個樣本
  • 控制臂:Opus 5 在同一個 panel 的 GPQA 題目上,用同一個 harness 跑

如果兩個臂同時移動,代表是 harness 或平台變了,不是 Opus 5.5 變了;只有「主要臂動、控制臂不動」才叫真的模型變化。

統計方法也是 pre-registered:Anthropic 工程師 Evan Miller 在 arXiv 發表的「Adding Error Bars to Evals」(Miller 2024) 的 clustered standard errors。每題的 paired differences 平均後聚合,所以題目難度直接抵消掉,誤差只剩下題目間的相關性。


Validation:在相信 null 之前,先證明儀器能看見已知變化

livenerf 不會在 baseline 收完後就急著報告。它在收集 baseline 之前就跑一個正控制(positive control):

把 effort 從 high 調到 medium,看看儀器能不能看到「已知變差」。

結果:

  • effort low vs high:輸出 token 少 62%、準確率 −8.3 ± 4.5 點
  • effort medium vs high:輸出 token 少 26%、準確率 −4.2 ± 3.9 點

關鍵發現:降 effort 對 token 的影響遠比對 accuracy 的影響明顯。也就是說,如果模型被偷偷降 effort,token 數會比準確率更早發出訊號。


真實盲點:A/A test 顯示的儀器極限

livenerf 自己承認一個重要限制:A/A test 把 Opus 5 整個換進 Opus 5.5 的位置,驗不出來(−3.8 ± 6.3 點、token 少 23%)。

也就是說,如果哪天 Anthropic 真的偷偷把 Opus 5.5 換成「微調過的 Opus 5」(同一個家族型號),livenerf 看不到。

10 天窗口的樣本量是 validation 的 2.5 倍,但作者誠實表示「尚未證明夠不夠」。

這是重要的誠實 — 任何 benchmark 都有看不到的範圍,承認比假裝更值得尊敬。


進度與時間表

  • 2026-09-22:Opus 5.5 推出
  • 2026-09-24 22:10 UTC:livenerf series day 1 啟動(launch 後 2.5 天)
  • 2026-09-29(現在):已收集 6 天 / 30 天(baseline 6/10)
  • 第一個 Results row 在 day 20 之後才會出現
  • 第一個可能判定 約 2026-10-24

每個 panel 包含 78 題,每天跑一次(90 樣本),連跑 30 天。Budget 控制綁在 Max 訂閱的 weekly meter 上,所以不會跟正常使用搶 quota。


為什麼這件事重要

🚨 livenerf 解決了一個困擾 AI 使用者社群很久的問題:怎麼用資料,而不是 vibe,回答「模型是不是變笨了」?

過去 18 個月,「nerf」這個詞在 Claude、GPT、Gemini 的使用者社群反覆出現:

  • 2025-08 Anthropic 事件:開發者回報 Claude Code 輸出壞掉,但 Anthropic 沈默幾週,直到 Sam Altman 在 X 引用 Reddit 截圖後才發文回應
  • 2026-03 Claude Code 降 effort 事件:Anthropic 把 Claude Code 預設 reasoning effort 從 high 改到 medium,加上一個 caching bug 讓長 session 失憶,還發了一個讓回應變短的系統指令
  • 2026-04 Opus 4.6 nerf 風波:6 週內開發者論壇一直問同一個問題「是不是悄悄降級」
  • 2026-09 Opus 5.5 launch:立刻有人報告「感覺變笨」「limit 變緊」

每次爭論都一樣:沒有 day-0 baseline,所有討論都回到 vibe vs vibe。livenerf 的價值不是「證明 nerf 或沒 nerf」,而是讓「有沒有 nerf」這個問題從口水戰變成可檢驗的科學問題。

對 Anthropic 來說,這也是一個公開的壓力測試 — 如果未來真的偷偷降 effort,會有公開資料指出來。透明本身就是最好的嚇阻力。


數據解讀與質疑

質疑 1:為什麼是 GPQA/MMLU,不是真實 coding 任務

livenerf 的 panel 是「選擇題」(GPQA Diamond、MMLU-Pro、AIME)。但真實使用者抱怨「變笨」幾乎都是 coding 任務。

作者的答案是:「真實任務無法精準評分」。LLM judge 自己會 drift,而且會跟著被評的模型一起 drift。要做時間序列,評分必須是 pure function。livenerf 沒有 LLM-judge,所以選了「可精準評分」的題目。

代價是:livenerf 能驗出 reasoning 變差,但對程式設計場景的 nerf 報告可能更難用這種方法抓到。

質疑 2:30 天夠不夠

livenerf 第一個判定時間是 day 20,完整 30 天結束才有完整 baseline window。但神經網路服務的變化往往是突然事件 — 一次模型換版、一次 infrastructure 升級,可能幾天就讓行為變了。

30 天是「能擷取到持續趨勢」的下限,短暫但劇烈的變化可能抓不到。作者提到「2025 quality incidents 其實是 infrastructure bugs,不是降級」 — 意思是很多變化本來就是 noise,要分辨 signal 與 noise 確實需要更長的視窗。

質疑 3:只有 Opus 5.5 一個模型

livenerf 當前只追 Opus 5.5。但「nerf」爭論橫跨所有前沿模型 — GPT、Gemini、Claude 全都有類似抱怨。社群需要的是多模型、可複製的儀器,不只是單一作者寫的單一專案。

GitHub 上其他獨立努力(例如 explainx.ai 的 blog post 引用)有在做類似工作,但還沒有形成「跨模型聯盟」。


安裝與執行(給開發者)

livenerf 不需要 API key,只要 Claude Code 訂閱:

git clone https://github.com/ninjahawk/livenerf
cd livenerf
uv sync

關鍵:鎖定 CLI 版本(這不是可選的 — Claude Code 自動更新會讓 harness 變,而 harness 變了跟模型變了長得一模一樣):

export DISABLE_AUTOUPDATER=1
claude --version | awk '{print $1}' > CLAUDE_CLI_VERSION

跑日常 cron(已校準、設計、驗證完之後):

# Linux/macOS: crontab -e
7 5-23 * * * cd /path/to/livenerf && bash scripts/daily.sh >> logs/daily.log 2>&1

給讀者的兩條 takeaway

  1. 30 天後(約 2026-10-24)才有第一份數據,在那之前不要下結論「Opus 5.5 有沒有降級」。seriously — day 6 of 30 baseline 收集,不是「幾天沒事發生」。
  2. livenerf 的方法比結論重要:任何 benchmark 都可以做,但只有 pre-registered、paired、雙臂、有 A/A test 的設計,才值得拿來討論。

livenerf 是獨立專案,與 Anthropic 無關。作者在 README 開頭就承認「repo 的很多內容是 Claude 寫的」 — 而 Claude 正是被測量的模型。這就是為什麼評分函式是 pure function、threshold 是 pre-registered、原始資料是公開的。作者明白,你不必相信任何作者 — 包括 AI 寫程式的作者。

網友熱門留言 (4)

#1 Hacker News 用戶 (item 49901736) ▲ 89
這正是 vibe vs vibe 爭論的解方。一個真正乾淨的 day-0 baseline 才能告訴我們模型有沒有偷偷降級。
#2 Reddit r/ClaudeAI 用戶 ▲ 64
同時,有些使用者已經在報告 Opus 5.5 感覺變笨、usage limit 被限縮。這套工具可以給出客觀答案。
#3 Hacker News 用戶 ▲ 51
他們從 launch day 開始測試,然後拿那個基準對比。偏差超過 10% 就視為變化。目前在追 Opus 5.5 從 9/22 起的表現。
#4 Hacker News 用戶 ▲ 38
用 Inspect 框架、paired items、clustered standard errors 的設計很紮實。但 A/A test 顯示 Opus 5 swap 進 Opus 5.5 驗不出來 — 這是真正的盲點。