編按:本文綜合整理自 Livenerf GitHub Repository、Hacker News 討論串 (item 49901736)、explainx.ai 分析、mindstudio.ai 時間軸、andy.cm64.io nerf cycle 分析,並加入 Siami 編輯部觀點與分析。
Livenerf 是什麼
livenerf 是一個 GitHub 開源基準測試,由開發者 ninjahawk 在 2026 年 9 月 22 日 Claude Opus 5.5 推出當天啟動。它只回答一個問題:前沿模型在正式上線後,有沒有被悄悄變差。
過去幾個月,社群裡一直有人抱怨 Anthropic「nerf」模型 — 也就是模型在上線幾天或幾週後,變得比 launch day 弱。這個「nerf」可能來自量化、把模型換成較小的版本、降低推理 effort、或改 routing。也有可能什麼都沒發生,只是社群在 noise 裡 pattern-match。因為沒有人手上有乾淨的 day-0 baseline,所有爭論最後都變成「vibes 對 vibes」。
livenerf 是一個「小、無聊、append-only」的基準 — 它把一切無法控制的東西(取樣參數、thinking)當作既定,然後讓其他所有東西完全確定:frozen prompts、pinned CLI、精準評分、永久保存的 raw logs。
livenerf 跑在 Claude Max 訂閱的 headless claude -p 上,完全不用 API key。因為這套設計,使用者不用花 API 額度就能跑 30 天的時間序列。
設計:從 2,336 題到 78 題的精準 panel
livenerf 不是隨便抓幾題 benchmark 就跑。它從 GPQA Diamond、MMLU-Pro、competition-math、AIME 2025-26 共 2,336 題出發,每題先用 4 個樣本篩選。
篩選結果顯示:
- Opus 5.5 一開始就答對 93% 的題目
- 97% 的題目永遠答對或永遠答錯(對 drift 沒資訊)
- 剩下 78 題「有時答對、有時答錯」 才是 panel
這 78 題才是有意義的訊號源 — 因為一道題答對率 p 在 logit-shift 模型下的訊息量是 p(1−p),只有「搖擺題」才有統計意義。
更細緻的校正:selection bias 的實測。篩出來的「有時對」題目看起來接近 50/50,但實際對新鮮樣本跑,答對率從 54.7% 上升到 62.0%。livenerf 用真實的新鮮率算 power calculation,而不是用樣本率,避免高估儀器靈敏度。
雙臂試驗:把平台噪音從模型噪音裡分離
livenerf 最聰明的設計是雙臂:
- 主要臂:Opus 5.5 在 panel 上每天跑 90 個樣本
- 控制臂:Opus 5 在同一個 panel 的 GPQA 題目上,用同一個 harness 跑
如果兩個臂同時移動,代表是 harness 或平台變了,不是 Opus 5.5 變了;只有「主要臂動、控制臂不動」才叫真的模型變化。
統計方法也是 pre-registered:Anthropic 工程師 Evan Miller 在 arXiv 發表的「Adding Error Bars to Evals」(Miller 2024) 的 clustered standard errors。每題的 paired differences 平均後聚合,所以題目難度直接抵消掉,誤差只剩下題目間的相關性。
Validation:在相信 null 之前,先證明儀器能看見已知變化
livenerf 不會在 baseline 收完後就急著報告。它在收集 baseline 之前就跑一個正控制(positive control):
把 effort 從 high 調到 medium,看看儀器能不能看到「已知變差」。
結果:
- effort low vs high:輸出 token 少 62%、準確率 −8.3 ± 4.5 點
- effort medium vs high:輸出 token 少 26%、準確率 −4.2 ± 3.9 點
關鍵發現:降 effort 對 token 的影響遠比對 accuracy 的影響明顯。也就是說,如果模型被偷偷降 effort,token 數會比準確率更早發出訊號。
真實盲點:A/A test 顯示的儀器極限
livenerf 自己承認一個重要限制:A/A test 把 Opus 5 整個換進 Opus 5.5 的位置,驗不出來(−3.8 ± 6.3 點、token 少 23%)。
也就是說,如果哪天 Anthropic 真的偷偷把 Opus 5.5 換成「微調過的 Opus 5」(同一個家族型號),livenerf 看不到。
10 天窗口的樣本量是 validation 的 2.5 倍,但作者誠實表示「尚未證明夠不夠」。
這是重要的誠實 — 任何 benchmark 都有看不到的範圍,承認比假裝更值得尊敬。
進度與時間表
- 2026-09-22:Opus 5.5 推出
- 2026-09-24 22:10 UTC:livenerf series day 1 啟動(launch 後 2.5 天)
- 2026-09-29(現在):已收集 6 天 / 30 天(baseline 6/10)
- 第一個 Results row 在 day 20 之後才會出現
- 第一個可能判定 約 2026-10-24
每個 panel 包含 78 題,每天跑一次(90 樣本),連跑 30 天。Budget 控制綁在 Max 訂閱的 weekly meter 上,所以不會跟正常使用搶 quota。
為什麼這件事重要
🚨 livenerf 解決了一個困擾 AI 使用者社群很久的問題:怎麼用資料,而不是 vibe,回答「模型是不是變笨了」?
過去 18 個月,「nerf」這個詞在 Claude、GPT、Gemini 的使用者社群反覆出現:
- 2025-08 Anthropic 事件:開發者回報 Claude Code 輸出壞掉,但 Anthropic 沈默幾週,直到 Sam Altman 在 X 引用 Reddit 截圖後才發文回應
- 2026-03 Claude Code 降 effort 事件:Anthropic 把 Claude Code 預設 reasoning effort 從 high 改到 medium,加上一個 caching bug 讓長 session 失憶,還發了一個讓回應變短的系統指令
- 2026-04 Opus 4.6 nerf 風波:6 週內開發者論壇一直問同一個問題「是不是悄悄降級」
- 2026-09 Opus 5.5 launch:立刻有人報告「感覺變笨」「limit 變緊」
每次爭論都一樣:沒有 day-0 baseline,所有討論都回到 vibe vs vibe。livenerf 的價值不是「證明 nerf 或沒 nerf」,而是讓「有沒有 nerf」這個問題從口水戰變成可檢驗的科學問題。
對 Anthropic 來說,這也是一個公開的壓力測試 — 如果未來真的偷偷降 effort,會有公開資料指出來。透明本身就是最好的嚇阻力。
數據解讀與質疑
質疑 1:為什麼是 GPQA/MMLU,不是真實 coding 任務
livenerf 的 panel 是「選擇題」(GPQA Diamond、MMLU-Pro、AIME)。但真實使用者抱怨「變笨」幾乎都是 coding 任務。
作者的答案是:「真實任務無法精準評分」。LLM judge 自己會 drift,而且會跟著被評的模型一起 drift。要做時間序列,評分必須是 pure function。livenerf 沒有 LLM-judge,所以選了「可精準評分」的題目。
代價是:livenerf 能驗出 reasoning 變差,但對程式設計場景的 nerf 報告可能更難用這種方法抓到。
質疑 2:30 天夠不夠
livenerf 第一個判定時間是 day 20,完整 30 天結束才有完整 baseline window。但神經網路服務的變化往往是突然事件 — 一次模型換版、一次 infrastructure 升級,可能幾天就讓行為變了。
30 天是「能擷取到持續趨勢」的下限,短暫但劇烈的變化可能抓不到。作者提到「2025 quality incidents 其實是 infrastructure bugs,不是降級」 — 意思是很多變化本來就是 noise,要分辨 signal 與 noise 確實需要更長的視窗。
質疑 3:只有 Opus 5.5 一個模型
livenerf 當前只追 Opus 5.5。但「nerf」爭論橫跨所有前沿模型 — GPT、Gemini、Claude 全都有類似抱怨。社群需要的是多模型、可複製的儀器,不只是單一作者寫的單一專案。
GitHub 上其他獨立努力(例如 explainx.ai 的 blog post 引用)有在做類似工作,但還沒有形成「跨模型聯盟」。
安裝與執行(給開發者)
livenerf 不需要 API key,只要 Claude Code 訂閱:
git clone https://github.com/ninjahawk/livenerf
cd livenerf
uv sync
關鍵:鎖定 CLI 版本(這不是可選的 — Claude Code 自動更新會讓 harness 變,而 harness 變了跟模型變了長得一模一樣):
export DISABLE_AUTOUPDATER=1
claude --version | awk '{print $1}' > CLAUDE_CLI_VERSION
跑日常 cron(已校準、設計、驗證完之後):
# Linux/macOS: crontab -e
7 5-23 * * * cd /path/to/livenerf && bash scripts/daily.sh >> logs/daily.log 2>&1
給讀者的兩條 takeaway
- 30 天後(約 2026-10-24)才有第一份數據,在那之前不要下結論「Opus 5.5 有沒有降級」。seriously — day 6 of 30 baseline 收集,不是「幾天沒事發生」。
- livenerf 的方法比結論重要:任何 benchmark 都可以做,但只有 pre-registered、paired、雙臂、有 A/A test 的設計,才值得拿來討論。
livenerf 是獨立專案,與 Anthropic 無關。作者在 README 開頭就承認「repo 的很多內容是 Claude 寫的」 — 而 Claude 正是被測量的模型。這就是為什麼評分函式是 pure function、threshold 是 pre-registered、原始資料是公開的。作者明白,你不必相信任何作者 — 包括 AI 寫程式的作者。
網友熱門留言 (4)