ai4biz.tw
← 全部專題
2026.09.19· 6 段

語音轉寫,正在變成預設基建

台灣辦公室最麻煩的,不是中文轉得準不準。

背景

2026 年 9 月 18 日 · xAI 發表 Grok Voice Transcribe 2.0

語音轉寫,正在變成預設基建

xAI 稱新版準確度約為前代兩倍,而價格不變。在原廠的語音助理短語測試裡(19 種語言),詞錯誤率從 20.6% 降到 6.8%。

這是原廠自己的評估,不是獨立審計。方向倒是很清楚,轉寫本身正在變成便宜到可以預設開啟的底層能力。

API 文件在出圖日已寫明預設模型是 2.0,舊版仍可指定。多數既有整合不必改程式,就會用到新版。

價格

門檻已經低到可以全開

$0.10 / 小時
批次轉寫,每小時音訊
$0.20 / 小時
即時串流,每小時音訊
10,000 小時 ≈ $1,000
批次口徑粗估,串流約 $2,000
與舊版同價
僅 API 音訊處理費,不含儲存、流量、編排與人工複核

台灣視角

台灣辦公室最有感的一頁

不用先選語言,錄到一半換也跟得上

台灣會議的真實樣子是這樣,講國語,報產品名切英文,再補一句日文。多數工具要你先選定一種語言,選錯了,後面整段就開始亂。

xAI 稱新版可自動辨識語言,並在同一段錄音裡跟著切換。公告寫支援 dozens of languages,API 接受 BCP-47 語言碼,但沒有公布固定的語言清單。

這裡必須留一句但書。它不等於台語、客語、台灣國語或中英台夾雜已經驗證,目前沒有任何本地公開盲測可以支持那種說法。

功能

它給的不只是一串文字

2 至 8 聲道
多聲道各自獨立轉寫,依 API 文件(產品頁示意仍寫 2)
100 個關鍵詞
每次請求可帶,每詞上限 50 字元,適合專有名詞與料號
逐字時間戳與信心分數
可回頭定位,也能用信心值分流人工複核
說話者分離、Smart Turn
Smart Turn 負責串流語音代理的回合結束偵測

佐證

「目前最強」要講清楚範圍

第一名,是哪張榜上的第一名

發表當日 xAI 引述 Artificial Analysis,稱新版在串流整體準確度排第一。該榜以 AA-AgentTalk 佔 50%、VoxPopuli 佔 25%、Earnings22 佔 25% 加權,約 8 小時音訊。榜單會更新,出圖日查到的是 28/34 個模型。

那張榜英語加權,以代理對話為主,不測口音、codec、領域詞彙,也不測八聲道客服音訊。

企業案例方面,xAI 公告稱 Atlassian 認為新版轉寫 Loom 影片比他們原本的方案準確。這是供應商公告轉述,不是第三方驗證。

結論與出處

真正的競爭,在轉寫之後

當一小時音訊只要一毛美金,聽得懂就不再是差異點,差距會往後段移動到代理、工單與審核。導入前先拿自己的錄音做盲測,你們的口音、專有名詞與真實噪音。榜單第一不等於你的第一。

  • 價格、兩倍準確度、19 語言的 20.6% 降到 6.8%

    xAI 公告〈Introducing Grok Voice Transcribe 2.0〉· 2026 年 9 月 18 日 · x.ai/news/grok-voice-transcribe-2

  • 2 至 8 聲道、100 個關鍵詞、每詞 50 字元、預設模型為 2.0

    xAI Speech-to-Text API 文件 · docs.x.ai · 2026 年 9 月 19 日核實

  • 串流榜單方法與出圖日模型數

    Artificial Analysis 串流語音轉文字榜 · AA-AgentTalk 50%、VoxPopuli 25%、Earnings22 25% · 28/34 個模型

  • Atlassian 的 Loom 說法、每日用量

    同 xAI 公告,屬供應商轉述或自述,未經第三方驗證

價格、名次與預設模型狀態以 2026-09-19 核實為準

一手來源