它說快 8 倍,碼表說慢 19%
Anthropic 的資料裡有兩個沒什麼人注意的欄位:這個任務,人自己做要幾小時;有 AI 幫忙,要幾分鐘。
背景
2026 年 6 月,一組沒什麼人注意到的欄位
每一則對話,Claude 都估了「這件事人自己做要多久」
除了大家在看的使用量,Anthropic 這份資料還藏了兩個估計值:這個任務,人自己做要幾小時;有 AI 幫忙,要幾分鐘。
兩個都由模型逐則判斷,再按職業大類平均。
這是目前規模最大的一組「AI 到底省多少時間」的數字。
然後你把它,跟真的拿碼表量過的那個實驗放在一起看。
兩邊的數字
一邊是模型自己估,一邊是儀器測
一個說快 8 倍,一個說慢 19%
模型估出來的數字很漂亮,辦公行政的任務人自己做平均 4.28 小時,有 AI 只要 25 分鐘,等於快 10.3 倍,商業金融 8.9 倍,管理 8.2 倍,電腦數學 7.7 倍。
2025 年,研究機構 METR 找了 16 位資深開源開發者,在自己維護多年的真實專案上做 246 項任務,一半准用 AI、一半不准,全程計時。
結果用 AI 的那一半慢了 19%,而同一批人做完之後,仍然覺得自己快了 20%。
三種數字
同一件事,三個來源,三個方向
- 10.3 倍
- 模型估計:辦公行政任務 4.28 小時 → 25 分鐘(Anthropic,2026 年 5 月)
- 7.7 倍
- 模型估計:電腦數學任務 5.35 小時 → 41.8 分鐘
- +20%
- 體感:METR 的受試者做完之後,仍認為自己變快了這麼多
- −19%
- 碼表:METR 實際計時的結果,他們變慢了
帶走這句
估計、體感、碼表,沒有一個數字對得上。
這不是誰在說謊,是三者量的東西不一樣,模型估的是這件事本來要多久,體感量的是順不順,碼表量的是實際完成時間。
差別藏在中間那一段,審核 AI 的產出、修它的錯、來回解釋需求,這些時間分散在每一次「看起來差不多對」的輸出裡,沒有人記在帳上。
有兩個前提要交代,METR 用的是 2025 年初的模型,而 Anthropic 那組是模型自估,不是實測。
但在相信「AI 幫我省了多少時間」之前,至少要知道那個數字是誰、用什麼方法生出來的。
出處
這三組數字可以自己查
Anthropic 那組是模型逐則判斷後平均,不是碼表;METR 是碼表,但只有 16 人、且是 2025 年初的模型。兩邊都不能單獨當結論。
模型估計的時間
Anthropic Economic Index · 2026-06-26 release · human_only_time / human_with_ai_time
實際計時的實驗
METR「Measuring the Impact of Early-2025 AI on Developer Productivity」arXiv:2507.09089
預估與體感
同一份 METR 研究:事前預估 +24%、事後體感 +20%
每則都附出處,可以自己查