Transcribbit 青蛙吉祥物用放大鏡檢查轉錄文本
研究
9 min read

AI 轉錄準確度:2026 年研究真正點講

作者 Kyle RProduct

2026年 AI 轉錄準確度研究整理:字詞錯誤率(WER)究竟代表乜嘢、真實基準測試範圍,以及語音轉文字喺口音、噪音同人名方面仍然失準嘅地方。

2026 年,AI 轉錄準確度喺乾淨、單一講者嘅錄音上,一般都有 95% 至 98%,聽落幾乎完美。但真實情況冇咁簡單。遇到口音、背景噪音、講者重疊同技術術語時,準確度會大幅下跌,而已發表嘅研究亦顯示,錯誤並唔係平均分佈喺各類講者身上。

標題數字同實際表現之間嘅落差好重要。如果你要決定信唔信一份自動轉錄嘅會議記錄、訪問、醫療筆記或者法律紀錄,真正該問嘅唔係「AI 轉錄準不準確」,而係「對邊個準確、喺乜嘢條件下準確,以及準確到乜嘢程度先夠用」。呢篇文章會逐一講解研究實際量度緊乜嘢、數字代表乜嘢,同呢項技術仍然不足嘅地方。


乜嘢係字詞錯誤率(WER)?

字詞錯誤率(Word Error Rate,WER)係語音轉文字準確度嘅標準量度方法。做法係將系統嘅轉錄結果同一份正確嘅參考文本比較,計算有幾多個字錯咗,再除以講出嘅總字數。當中包含三種錯誤。

  • 取代:系統將一個字換成另一個字("their" 變咗 "there")。
  • 刪減:系統漏咗一個講過嘅字。
  • 插入:系統加咗一個從來冇講過嘅字。

呢條公式將三者相加,再除以參考文本嘅總字數:

> WER = (取代 + 刪減 + 插入) ÷ 總字數

用一個實際例子會清楚啲。假設有人講 "I'll send the contract to Sarah on Friday afternoon."(我會喺星期五下午將合約寄畀 Sarah。)呢句有九個字。如果系統輸出 "I'll send the contract to Sara on Friday after noon,",就有一個取代("Sarah" 變咗 "Sara")同一個插入("afternoon" 拆成 "after noon" 多咗一個字)。九個字入面錯咗兩個,WER 大約係0.22,即係22%。市場推廣團隊比較鍾意用嘅「準確度」數字,就會報大約78%。

有幾點值得留意。WER 數值越低越好,WER 為零即係完美轉錄。理論上,如果系統插入好多多餘嘅字,WER 甚至可以超過100%。而且 WER 對待每個字都一視同仁,所以轉錯一個像 "um" 咁嘅語氣詞,同轉錯一個人名或者劑量,計法係一樣嘅。MLCommons 嘅基準測試團隊指出,即使係細微嘅格式選擇,例如寫 "Dr." 定係 "doctor",如果文本未經標準化處理,都可能被當成錯誤計算。


2026年嘅基準測試結果

現代自動語音識別(ASR)喺專為佢設計嘅音訊類型上,表現確實好好。OpenAI 嘅 Whisper Large-v3 係其中一個用得最廣泛嘅開放系統,因為佢嘅表現經過獨立量度,所以係一個好有用嘅參考點。

2025 年,MLCommons 選用咗 Whisper Large-v3 作為其 MLPerf Inference 基準測試嘅語音轉文字模型。喺結合較乾淨同較嘈雜朗讀音訊嘅 LibriSpeech「dev-all」數據集上,參考實作達到大約 97.9% 嘅字詞準確度,相當於接近 2% 嘅 WER。同一份報告指出,Whisper 將上一代基準模型嘅錯誤率降低咗超過 72%,係實實在在嘅世代進步。

呢個數字有一個重要但書。LibriSpeech 係有聲書嘅朗讀錄音:單一講者、優質麥克風、發音清晰、冇人聲重疊,幾乎係最理想嘅情況。真實嘅會議、電話同語音訊息完全唔係咁樣。

為咗了解極限喺邊,Microsoft 嘅研究人員用標準 NIST 測試集,量度過專業人手轉錄員喺對話式電話錄音上嘅表現。受過訓練嘅人手喺 Switchboard 部分(陌生人討論指定話題)錄得5.9%嘅 WER,喺 CallHome 部分(親友之間自由對話)則錄得11.3%。即係話,即使係熟練嘅人手,喺較正式嘅對話中大約每17個字都錯一個,喺輕鬆閒聊中就接近每九個字錯一個。廣泛流傳嘅「人手 WER 只得4%」呢個講法,其實源自一次冇數據支持嘅私人交流,同一篇論文亦指出,單一嘅人手準確度數字具誤導性,因為難度會因應每份錄音大幅不同。

實際嘅重點係:同一個模型,喺有聲書音訊上錄得2% WER,同喺嘈雜嘅群組通話上錄得10%至15% WER,兩者可以同時成立。


唔同條件下嘅準確度:粗略指引

下表整理咗已發表基準測試同研究嘅一般模式。呢啲數字只係參考範圍,並非保證,因為實際數字會因應模型、數據集同評分方式而有出入。

條件一般 WER 範圍白話解釋
乾淨音訊、單一講者、朗讀約2%至5%接近專業水平嘅準確度,錯誤罕見
清晰對話式語音、單一講者約5%至10%相當好用,偶爾會漏聽人名或術語
帶口音或非母語英語約10%至25%以上明顯較差,因應口音差異好大
背景噪音或麥克風質素差約10%至30%以上噪音越大,表現下跌得越快
多名講者重疊約15%至40%以上人聲重疊同搶話會導致大量錯誤
大量術語、人名、縮寫不定,通常偏高訓練數據以外嘅專業詞彙容易被漏聽

乾淨音訊嘅數字以 MLCommons 嘅 Whisper 基準測試為依據,對話範圍則同人手與機器喺電話語音上嘅對比研究一致。


AI 轉錄仍然有困難嘅地方

口音同方言

口音係研究得最多嘅弱點之一。Calbert Graham 同 Nathan Roll 喺2024年一份 JASA Express Letters 研究入面,評估咗 Whisper 喺 Speech Accent Archive 多種英語口音上嘅表現。佢哋發現模型識別美式英語最準確,英式同澳式英語表現較差,加拿大英語就大致同美式相若。整體嚟講,英語母語口音嘅轉錄準確度高過非母語口音。

呢個唔係單一模型嘅偶然現象,而係反映咗呢類系統嘅建構方式:佢哋由大量錄音語料學習,如果呢啲語料偏重某啲口音,模型喺呢啲口音上表現就會最好,喺其他口音上就會較差。問題根源在於訓練數據,而唔喺講者本身。

背景噪音同音訊質素

噪音係最大嘅拉平因素,但唔係好嘅意思。喺咖啡店、車廂、大房間開擴音,或者用質素差嘅麥克風,都會令 WER 快速上升。MLCommons 團隊特意加入較嘈雜嘅音訊分組,正正係因為乾淨音訊嘅基準測試會誇大咗實際表現。如果你自己都幾乎聽唔清楚錄音入面某個字,模型通常都做唔到。

多名講者同重疊

兩個人同時講嘢,對機器同人類嚟講都好難處理。大部分 ASR 模型都係設計嚟轉錄單一語音流,所以講者重疊嘅時候,系統就要靠估。Microsoft 嗰份研究直接證明咗呢點:數據入面轉錄得最差嘅兩位講者,係同主要講者共用一條對話線嘅次要聲音,錯誤率分別高達37.5%同64.7%,遠遠高於平均值。判斷邊句係邊個講嘅,呢個叫「講者分割」(speaker diarisation),係一項相關但仍未完善嘅任務,呢方面出錯亦會加劇轉錄錯誤。

術語、人名同縮寫

模型只有對之前實際見過嘅字,先可以有信心咁轉錄。專門詞彙,例如藥物名稱、法律術語、產品編號或者罕見人名,通常都超出訓練數據嘅分佈範圍,系統就會用一個聽落相似、但比較常見嘅字去取代。所以一份轉錄文本可能讀落好順,但偏偏喺最緊要嘅地方出錯:一個人名、一間公司、一種藥物,或者一個數字。


ASR 已被記錄嘅偏差問題

呢個範疇最多人引用嘅發現,同公平性有關。2020年,史丹福大學嘅 Allison Koenecke 同同事喺 Proceedings of the National Academy of Sciences(PNAS)發表咗"Racial disparities in automated speech recognition"。研究團隊測試咗來自 Amazon、Apple、Google、IBM 同 Microsoft 五個主流商業系統。

喺全部五個系統之中,黑人講者嘅平均字詞錯誤率為0.35,即35%,白人講者則為0.19,即19%。用白話講,即使講者喺年齡同性別上經過配對、講嘅內容完全一樣,呢啲系統聽錯咗黑人講者大約35%嘅字,白人講者就只有19%。錯誤率喺非裔美國男性身上最高,而講者越多使用非裔美式英語(African American Vernacular English),落差就越大。

研究亦檢視咗「災難性失敗」,即係轉錄錯到完全冇用嘅情況。呢種情況出現喺超過20%嘅黑人講者樣本,而白人講者樣本就少於2%。研究人員將呢個落差歸因於訓練數據對黑人美國人語音代表性不足,並認為解決方法係喺訓練中加入更具代表性嘅音訊,同埋引入獨立審核。

有兩點誠實嘅但書要講。呢啲測試喺2019年進行,而各公司之後都更新過自己嘅系統,所以呢啲具體數字反映嘅係當時嘅情況。而且呢份研究專門針對美式英語,同黑人與白人講者嘅比較。不過發現嘅趨勢,即係 ASR 錯誤並非平均分佈,喺之後嘅口音研究入面都持續成立。核心教訓依然成立:單一嘅準確度數字,會掩蓋咗系統對邊個好用、對邊個唔好用。


咁 AI 轉錄實際上有幾準確?

綜合以上證據:

  • 喺乾淨、單一講者嘅音訊上,現代系統嘅準確度大約有95%至98%,接近細心嘅人手水平。
  • 喺良好條件下嘅清晰對話語音上,錯誤會比有聲書音訊多,但大致仍然喺專業人手轉錄員嘅範圍內,WER 大約6%至12%。
  • 喺帶口音嘅語音、嘈雜音訊、講者重疊或者專門詞彙上,準確度可以大幅下跌,有時甚至跌一半以上。
  • 錯誤並非平均分佈,已被記錄嘅落差意味住某啲講者持續得到比其他人差嘅結果。

對於風險較低嘅用途,例如 Podcast 嘅初稿、可搜尋嘅存檔,或者個人語音備忘,現時嘅 AI 轉錄已經夠快、夠平、夠好用。但對於高風險嘅用途,任何同醫療、法律或者財務有關,或者涉及人名、數字或決定嘅場合,研究一致指向同一個建議:將 AI 轉錄當成一份紮實嘅初稿,而唔係最終紀錄,重要嘅部分要核實。

呢個亦係我哋一貫嘅誠實立場。Transcribbit 會將轉發過嚟嘅 WhatsApp 語音訊息,喺幾秒之內變成乾淨、易讀嘅文字,而轉錄文本勝過重播音訊嘅原因,係你可以一眼掃過去、搜尋內容,快速核對人名或者數字,而唔使將錄音揈返轉頭慢慢搵。就算轉錄文本睇落好乾淨,都值得讀清楚當中重要嘅細節,唔應該假設佢一定啱,呢個亦正正係點解語音訊息變成文字之後會容易處理得多。免費方案每個月有50次轉錄,而你嘅音訊喺處理完之後會即刻刪除。免費試用


常見問題

轉錄嘅字詞錯誤率(WER)幾多先算好?

喺乾淨音訊上,WER 低於大約5%一般被視為非常好,接近專業人手水平。喺較難處理嘅音訊上,有噪音、口音或者多名講者,即使係設計良好嘅系統,都可能落喺10%至25%或以上嘅範圍,所以「好」呢個標準好視乎錄音條件。

AI 轉錄係咪比人手轉錄準確?

喺乾淨、單一講者嘅音訊上,最好嘅 AI 系統現時已經同熟練人手不相上下,有時純粹計 WER 甚至略勝一籌。但喺混亂音訊、講者重疊、陌生人名同理解語境呢幾方面,人手仍然佔優,而呢啲正正就係 AI 傾向出錯嘅地方。

點解 AI 轉錄會將口音轉錯?

因為呢啲系統係由錄音語料學習,如果訓練數據過度集中喺某啲口音,模型喺呢啲口音上表現就會最好,喺其他口音上就會較差。多份研究都記錄到非母語口音準確度較低,同埋唔同講者群組之間存在大落差。呢個錯誤反映嘅係模型嘅訓練數據,唔喺講者本身。

AI 轉錄可唔可以信得過用喺醫療或者法律紀錄?

佢可以係一份有用嘅初稿,但研究建議唔好喺高風險場合將佢當成未經核實嘅最終紀錄。因為 WER 對待每個字都一視同仁,所以一個系統整體評分可以好好,但依然轉錯咗最重要嘅一個人名、劑量或者數字。由人手覆核重要細節,依然係安全嘅做法。

AI 轉錄一條 WhatsApp 語音訊息有幾準確?

完全視乎錄音本身。一個人喺安靜房間錄嘅清晰語音訊息,準確度會接近範圍嘅上限,但喺大風嘅街上匆忙錄低、帶重口音,或者背景有音樂嘅語音訊息,準確度就可以跌落好多。因為好多語音訊息本身就係呢種喺路上匆忙、雜亂嘅錄音,所以讀清楚轉錄內容,再核對地址、時間或者數字,先係安全嘅做法。


總結

2026年嘅 AI 轉錄,表現確實令人印象深刻,但亦確實參差不齊。同一個能夠完美處理有聲書嘅模型,喺嘈雜嘅群組通話、濃重口音,或者一個從未見過嘅人名面前,都可能大幅失準,而研究清楚顯示,呢啲失誤對某啲講者嘅打擊,遠比對其他人嚴重。

所以「AI 轉錄有幾準確」呢個問題,實用嘅答案係:準確到足以幫你慳返實實在在嘅時間,但唔準確到可以喺重要嘅事情上盲目信任。讀清楚轉錄內容,留意人名同數字,將沉悶嘅部分交畀機器去做。Transcribbit 會將你嘅 WhatsApp 語音訊息,變成超過50種語言嘅可搜尋文字,免費方案每個月有50次轉錄,事後亦唔會保留音訊,詳情請睇 transcribbit.io


References

  1. Whisper: An MLPerf Inference Benchmark for Automatic Speech Recognition (MLCommons, 2025) - mlcommons.org
  2. Comparing Human and Machine Errors in Conversational Speech Transcription (Stolcke and Droppo, Microsoft, 2017) - arxiv.org
  3. Evaluating OpenAI's Whisper ASR: Performance across diverse accents and speaker traits (Graham and Roll, JASA Express Letters, 2024) - pubs.aip.org
  4. Racial disparities in automated speech recognition (Koenecke et al., PNAS, 2020) - pnas.org