MAI-Transcribe-2 是什麼?0.1 美元做繁中字幕
微軟 2026 年 9 月 3 日發表的語音轉文字模型,每音訊小時 0.10 美元、支援 60 種語言、有說話者分辨與字級時間戳。本文照官方文件拆解取用方式、API 參數、JSON 轉 SRT 的完整字幕工作流,並誠實點出它的官方語言表只有簡體中文、沒有繁中與台語這件事。
微軟在 2026 年 9 月 3 日發表 MAI-Transcribe-2,一個把「聲音變成文字」的模型。它解決的是內容創作者最貴的一段時間:影片、Podcast、會議錄音要上字幕或做逐字稿,過去不是花錢外包,就是自己坐在剪輯軟體前面一句一句敲。這週值得看的原因只有一個——價格。官方定價每音訊小時 0.10 美元(2026 年 9 月官方定價,限時到年底),意思是一部兩小時的電影,逐字稿成本 0.2 美元,不到新臺幣 10 元。但便宜不等於適合你,尤其你要做的是繁體中文字幕。以下照官方文件走一遍,包含它做不到的部分。
先看結論
| 面向 | 一句話結論 |
|---|---|
| 誰適合用 | 要處理大量音訊、且願意打 API 的創作者與小團隊:Podcast 主持人、YouTuber、會議紀錄、訪談整理。不會寫程式、只想拖檔案進網頁的人,這個目前不適合你——它沒有現成的網頁介面。 |
| 價格 | 每音訊小時 0.10 美元(2026 年 9 月官方定價,官方說明為限時優惠、到 2026 年底)。優惠結束後的價格官方尚未公布。需要 Azure 訂閱帳號,非免費工具。 |
| 限制 | 目前是公開預覽(public preview),官方明確寫「無 SLA、不建議用於正式生產環境」。官方語言表裡的中文只有 `zh`(簡體中文)與 `yue`(粵語),沒有 zh-TW、沒有臺語。 輸出是 JSON,不直接給 SRT/VTT/LRC。 |
| 替代方案 | 要繁中 locale:Azure 一般語音轉文字支援 zh-TW。要便宜穩定:Deepgram、ElevenLabs Scribe v2。要零成本、資料不出門:自架開源 Whisper(軟體免費,成本是你的顯卡與電費)。 |
怎麼取用:從開資源到打出第一個逐字稿
依微軟官方文件(Microsoft Learn 的 MAI-Transcribe 頁面),取用路徑有三條:Microsoft Foundry(Azure Speech)、MAI Playground,以及 OpenRouter(模型代號 microsoft/mai-transcribe-2)。要做字幕工作流,走 Azure Speech 的 REST API 最完整,因為只有這條路能同時開字級時間戳、說話者分辨和關鍵詞偏置。
第一步,開資源。 在 Azure 入口網站建立一個 Speech 用的 Microsoft Foundry 資源,拿到金鑰(key)與區域。這裡有個臺灣使用者必踩的坑:MAI-Transcribe 目前只在六個區域可用——centralindia、eastus、northeurope、southeastasia、westus、westus2。East Asia 與 Japan East 都不在名單上,離臺灣最近的是 Southeast Asia(新加坡)。官方另有說明,資料只在你資源所在的區域儲存與處理,所以區域選哪裡等於決定你的音檔飛去哪裡。
第二步,準備音檔。 MAI-Transcribe 文件寫的限制是:小於 300 MB,格式為 WAV、MP3 或 FLAC。(同一組 API 的通用文件寫的是小於 5 小時、500 MB、且支援更多格式;以模型專屬頁的較嚴格數字為準比較安全。)影片要先抽音軌,一行 ffmpeg 就夠:ffmpeg -i input.mp4 -vn -ac 1 -ar 16000 out.wav。單聲道、16 kHz,檔案小很多,語音辨識也不吃虧。
第三步,打 API。 端點與參數照官方 curl 範例:
curl --location 'https://你的資源名稱.cognitiveservices.azure.com/speechtotext/transcriptions:transcribe?api-version=2025-10-15' \
--header 'Content-Type: multipart/form-data' \
--header 'Ocp-Apim-Subscription-Key: 你的金鑰' \
--form 'audio=@"episode01.wav"' \
--form 'definition={
"enhancedMode": {
"enabled": true,
"model": "MAI-Transcribe-2",
"modelOptions": {
"timestamps": "word",
"transcribeStyle": "clean"
}
},
"diarization": { "enabled": true, "maxSpeakers": 2 },
"phraseList": { "phrases": ["提詞", "生成式 AI", "台積電"] }
}'
四個參數各自的作用,值得逐個講清楚:
enhancedMode.enabled必須是true、model必須寫"MAI-Transcribe-2",兩個都漏掉就退回舊模型。modelOptions.timestamps預設是"none"——不設定就完全沒有時間戳,這是做字幕最容易漏的一格。"word"給每個字的起點與長度,"segment"只給段落級。modelOptions.transcribeStyle預設是"verbatim",會把「呃」「嗯」和口誤全部照抄。做字幕請設"clean",官方說明它會移除填充詞、自動整理常見口語。phraseList.phrases是關鍵詞偏置。官方明說這只是提示、不是強制輸出,但把講者名字、公司名、專有名詞塞進去,能大幅降低同音錯字。這一格對中文特別有價值。
另外 locales 可以指定單一語言強制辨識,但官方警告這是「非常強的提示」,除非你百分之百確定語言而且自動偵測失效,否則不要用;而且一次只能給一種語言。
拿到 JSON 之後:轉成 SRT 的那一步沒人幫你做
這是整條工作流最容易卡住的地方,也是很多教學不講的:這個 API 只回 JSON,不回 SRT、不回 VTT、不回 LRC。 官方文件的回應範例長這樣:最外層有 durationMilliseconds,combinedPhrases 放整段連續文字,phrases 陣列才是字幕要的東西——每一段有 offsetMilliseconds(起點毫秒)、durationMilliseconds(長度毫秒)、text,開了字級時間戳就多一個 words 陣列,開了說話者分辨就多一個 speaker 欄位。
換句話說,時間軸的原始資料它給得很完整,但「組成字幕檔」是你的工作。一段十幾行的腳本就能收工:
import json, sys
def ts(ms):
h, ms = divmod(ms, 3600000)
m, ms = divmod(ms, 60000)
s, ms = divmod(ms, 1000)
return f"{h:02d}:{m:02d}:{s:02d},{ms:03d}"
data = json.load(open(sys.argv[1], encoding="utf-8"))
blocks = []
for i, p in enumerate(data["phrases"], 1):
start = p["offsetMilliseconds"]
end = start + p["durationMilliseconds"]
who = f"[說話者 {p['speaker']}] " if "speaker" in p else ""
blocks.append(f"{i}\n{ts(start)} --> {ts(end)}\n{who}{p['text']}\n")
open("out.srt", "w", encoding="utf-8").write("\n".join(blocks))
字級時間戳的真正用途,是在這一步之後。模型切出來的 phrases 有時候一句長達十幾秒、一行塞四十個字,直接變字幕會爆版。有了 words 陣列,你可以照標點或字數重新斷行,再從對應那個字的 offsetMilliseconds 取新的起點——不用重跑一次辨識,也不用手動對時間。這就是「字級時間戳」對做字幕的人真正值錢的地方。
到這裡你手上有一份 SRT。如果你的素材是歌、是需要卡拉 OK 式逐行顯示的內容,或者你要的是直書垂直字幕(短影音很常見),格式還得再轉一手。本站的 LRC 歌詞時間軸產生器 有「格式轉換」分頁做 LRC ↔ SRT 雙向轉換,也能輸出直書版 SRT 與 VTT,這幾個分頁是本地模式、免費、不需登入。逐字稿轉出來只是半成品,時間軸格式對了才算能用。
費用怎麼算:便宜到什麼程度
0.10 美元/音訊小時的意思,換成實際場景:
- 一部兩小時電影的逐字稿:0.2 美元。
- 每週一集 60 分鐘的 Podcast,做滿一年 52 集:5.2 美元,大約一杯咖啡。
- 一個累積 500 小時的訪談素材庫全部轉完:50 美元。
拿來對比,OpenAI 的 whisper-1 是每分鐘 0.006 美元,也就是每小時 0.36 美元——同樣那 500 小時要 180 美元,差 130 美元。這也是「比前代便宜約 72%」的來源:前一代同樣是 0.36 美元。
至於其他家,依 2026 年多家科技媒體整理的比價(非官方定價頁,請自行以各家官網為準):ElevenLabs Scribe v2 批次約每小時 0.22 美元、Deepgram Nova-3 批次約每小時 0.26 美元、OpenAI gpt-4o-mini-transcribe 約每小時 0.18 美元。MAI-Transcribe-2 的 0.10 美元確實是這批裡最低的一檔。
速度也是賣點。微軟引用第三方評測機構 Artificial Analysis 的數據,稱其速度倍率約 400 倍實時——一小時音訊約 10 秒跑完,並宣稱比 GPT-Transcribe 快 10 倍、比 ElevenLabs Scribe v2 快 7 倍、比 Gemini 3.5 Transcribe 快 5 倍。
品質到底如何:三組數字要分開看
官方公布的準確度數字有三組,混在一起看會誤判:
- FLEURS 基準、60 種語言平均:詞錯誤率(WER)5.2%,微軟宣稱排名第一。
- FLEURS 前 25 種語言平均:WER 3.4%(來自官方 model card)。
- Artificial Analysis 排行榜:WER 2.0%,排名第二,落後阿里巴巴的 Fun-Realtime-ASR-preview(1.7%),領先 ElevenLabs Scribe v2(2.2%)。
三組數字差這麼多,是因為語言範圍與測試集不同。「60 語平均 5.2%」不等於「你的中文素材會有 5.2%」——語言越多、平均越被小語種拉高,而個別語言的分布官方沒有公布。這點下一段會再講。
語言數量本身確實有實質擴張。比對官方語言表,MAI-Transcribe-1.5 支援 43 種、MAI-Transcribe-2 支援 60 種,新增的包括南非荷蘭語、波斯語、菲律賓語、希伯來語、哈薩克語、粵語等 17 種。
誠實提醒
一、繁體中文的支援程度,是這篇最重要的一段。 官方語言表列出的中文只有兩個代碼:zh(標註為 Chinese, simplified,簡體中文)與 yue(粵語)。沒有 zh-TW、沒有 Chinese Traditional、沒有臺語(Taiwanese Hokkien)。 官方文件的回應範例裡,中文輸出也是簡體字。這代表兩件事:(1)你拿到的逐字稿預期是簡體,繁體化與臺灣用語校對是你自己要加的一道工序,而且不能只做無腦字元轉換——「皇后」轉成「皇後」這種錯誤就是這樣來的;(2)臺灣人名、公司名、國語夾雜臺語或英文的實際情境,官方沒有給任何數據。如果你的素材大量出現這些,強烈建議先拿 30 到 50 段真實錄音小規模試跑,再決定要不要整批投入。如果你非要一個明確標示 zh-TW 的 locale,Azure 一般的語音轉文字服務有支援,那是另一條產品線。
二、它現在是公開預覽。 官方原文明寫此功能為 public preview、不附 SLA、不建議用於生產工作負載,部分功能可能受限。拿它跑你自己的內容沒問題,拿它接客戶的正式交付流程,風險自負。順帶一提,前代 MAI-Transcribe-1 已於 2026 年 8 月 20 日淘汰——這條產品線迭代很快,別把 pipeline 寫死在單一模型代號上。
三、幾個官方尚未公布的東西。 促銷結束後的正式價格:未公布。計費的最小單位與進位方式(不足一小時如何計算):官方文件未說明。逐語言的準確度分布:未公布。說話者分辨的錯誤率指標:未公布——它只說「有 diarization」,沒說有多準。VentureBeat 的報導也點出,發布內容對即時串流的效能、資料保留期限、以及音檔是否會被用於後續訓練都沒有交代。(官方區域文件確有說明資料只在資源所在區域處理與儲存,但那和「保留多久、是否用於訓練」是不同的問題,請直接看你簽的 Azure 服務條款。)
四、前代版本號有出入。 官方 model card 把 0.36 美元標給 MAI-Transcribe-1.5,VentureBeat 則說 2026 年 4 月的 MAI-Transcribe-1 是 0.36 美元。價格數字兩邊一致,指涉的版本不一致,這裡不替它下定論。
五、授權與商用。 轉錄不會給你任何原始內容的權利。幫有版權的影片上字幕、把歌詞打成時間軸,版權仍屬原作者;商用發布前該取得的授權一樣要取得。工具只負責把聲音變成字,不解決版權。另外,把含個資或營業秘密的錄音送上雲端前,先確認你的公司政策允許。
---
把這條路走完,你手上會有:一份 JSON(含字級時間、說話者標記)、一份 SRT,以及一份還需要人工校對的繁體逐字稿。最後那一哩——把時間軸轉成你的播放器或剪輯軟體吃得下的格式、卡不準的行手動微調、需要直書的短影音字幕——可以直接接到 LRC 歌詞時間軸產生器,格式轉換與手動打軸是本地模式、免費、免登入。想看本站其他做內容會用到的工具,工具總覽在這裡。