ai4biz.tw
← 全部專題
2026.09.07· 5 段

它說快 8 倍,碼表說慢 19%

Anthropic 的資料裡有兩個沒什麼人注意的欄位:這個任務,人自己做要幾小時;有 AI 幫忙,要幾分鐘。

背景

2026 年 6 月,一組沒什麼人注意到的欄位

每一則對話,Claude 都估了「這件事人自己做要多久」

除了大家在看的使用量,Anthropic 這份資料還藏了兩個估計值:這個任務,人自己做要幾小時;有 AI 幫忙,要幾分鐘。

兩個都由模型逐則判斷,再按職業大類平均。

這是目前規模最大的一組「AI 到底省多少時間」的數字。

然後你把它,跟真的拿碼表量過的那個實驗放在一起看。

兩邊的數字

一邊是模型自己估,一邊是儀器測

一個說快 8 倍,一個說慢 19%

模型估出來的數字很漂亮,辦公行政的任務人自己做平均 4.28 小時,有 AI 只要 25 分鐘,等於快 10.3 倍,商業金融 8.9 倍,管理 8.2 倍,電腦數學 7.7 倍。

2025 年,研究機構 METR 找了 16 位資深開源開發者,在自己維護多年的真實專案上做 246 項任務,一半准用 AI、一半不准,全程計時。

結果用 AI 的那一半慢了 19%,而同一批人做完之後,仍然覺得自己快了 20%。

三種數字

同一件事,三個來源,三個方向

10.3 倍
模型估計:辦公行政任務 4.28 小時 → 25 分鐘(Anthropic,2026 年 5 月)
7.7 倍
模型估計:電腦數學任務 5.35 小時 → 41.8 分鐘
+20%
體感:METR 的受試者做完之後,仍認為自己變快了這麼多
−19%
碼表:METR 實際計時的結果,他們變慢了

帶走這句

估計、體感、碼表,沒有一個數字對得上。

這不是誰在說謊,是三者量的東西不一樣,模型估的是這件事本來要多久,體感量的是順不順,碼表量的是實際完成時間。

差別藏在中間那一段,審核 AI 的產出、修它的錯、來回解釋需求,這些時間分散在每一次「看起來差不多對」的輸出裡,沒有人記在帳上。

有兩個前提要交代,METR 用的是 2025 年初的模型,而 Anthropic 那組是模型自估,不是實測。

但在相信「AI 幫我省了多少時間」之前,至少要知道那個數字是誰、用什麼方法生出來的。

出處

這三組數字可以自己查

Anthropic 那組是模型逐則判斷後平均,不是碼表;METR 是碼表,但只有 16 人、且是 2025 年初的模型。兩邊都不能單獨當結論。

  • 模型估計的時間

    Anthropic Economic Index · 2026-06-26 release · human_only_time / human_with_ai_time

  • 實際計時的實驗

    METR「Measuring the Impact of Early-2025 AI on Developer Productivity」arXiv:2507.09089

  • 預估與體感

    同一份 METR 研究:事前預估 +24%、事後體感 +20%

每則都附出處,可以自己查