語音轉寫,正在變成預設基建
台灣辦公室最麻煩的,不是中文轉得準不準。
背景
2026 年 9 月 18 日 · xAI 發表 Grok Voice Transcribe 2.0
語音轉寫,正在變成預設基建
xAI 稱新版準確度約為前代兩倍,而價格不變。在原廠的語音助理短語測試裡(19 種語言),詞錯誤率從 20.6% 降到 6.8%。
這是原廠自己的評估,不是獨立審計。方向倒是很清楚,轉寫本身正在變成便宜到可以預設開啟的底層能力。
API 文件在出圖日已寫明預設模型是 2.0,舊版仍可指定。多數既有整合不必改程式,就會用到新版。
價格
門檻已經低到可以全開
- $0.10 / 小時
- 批次轉寫,每小時音訊
- $0.20 / 小時
- 即時串流,每小時音訊
- 10,000 小時 ≈ $1,000
- 批次口徑粗估,串流約 $2,000
- 與舊版同價
- 僅 API 音訊處理費,不含儲存、流量、編排與人工複核
台灣視角
台灣辦公室最有感的一頁
不用先選語言,錄到一半換也跟得上
台灣會議的真實樣子是這樣,講國語,報產品名切英文,再補一句日文。多數工具要你先選定一種語言,選錯了,後面整段就開始亂。
xAI 稱新版可自動辨識語言,並在同一段錄音裡跟著切換。公告寫支援 dozens of languages,API 接受 BCP-47 語言碼,但沒有公布固定的語言清單。
這裡必須留一句但書。它不等於台語、客語、台灣國語或中英台夾雜已經驗證,目前沒有任何本地公開盲測可以支持那種說法。
功能
它給的不只是一串文字
- 2 至 8 聲道
- 多聲道各自獨立轉寫,依 API 文件(產品頁示意仍寫 2)
- 100 個關鍵詞
- 每次請求可帶,每詞上限 50 字元,適合專有名詞與料號
- 逐字時間戳與信心分數
- 可回頭定位,也能用信心值分流人工複核
- 說話者分離、Smart Turn
- Smart Turn 負責串流語音代理的回合結束偵測
佐證
「目前最強」要講清楚範圍
第一名,是哪張榜上的第一名
發表當日 xAI 引述 Artificial Analysis,稱新版在串流整體準確度排第一。該榜以 AA-AgentTalk 佔 50%、VoxPopuli 佔 25%、Earnings22 佔 25% 加權,約 8 小時音訊。榜單會更新,出圖日查到的是 28/34 個模型。
那張榜英語加權,以代理對話為主,不測口音、codec、領域詞彙,也不測八聲道客服音訊。
企業案例方面,xAI 公告稱 Atlassian 認為新版轉寫 Loom 影片比他們原本的方案準確。這是供應商公告轉述,不是第三方驗證。
結論與出處
真正的競爭,在轉寫之後
當一小時音訊只要一毛美金,聽得懂就不再是差異點,差距會往後段移動到代理、工單與審核。導入前先拿自己的錄音做盲測,你們的口音、專有名詞與真實噪音。榜單第一不等於你的第一。
價格、兩倍準確度、19 語言的 20.6% 降到 6.8%
xAI 公告〈Introducing Grok Voice Transcribe 2.0〉· 2026 年 9 月 18 日 · x.ai/news/grok-voice-transcribe-2
2 至 8 聲道、100 個關鍵詞、每詞 50 字元、預設模型為 2.0
xAI Speech-to-Text API 文件 · docs.x.ai · 2026 年 9 月 19 日核實
串流榜單方法與出圖日模型數
Artificial Analysis 串流語音轉文字榜 · AA-AgentTalk 50%、VoxPopuli 25%、Earnings22 25% · 28/34 個模型
Atlassian 的 Loom 說法、每日用量
同 xAI 公告,屬供應商轉述或自述,未經第三方驗證
價格、名次與預設模型狀態以 2026-09-19 核實為準