今天,海天瑞聲攜手清華大學電子工程系語音與音頻技術實驗室(SATLab),正式發布Dolphin-CN-Dialect漢語多方言語音識别模型!

獲取渠道
體驗地址
·非流式識别:https://www.modelscope.cn/studios/haitianruisheng/dolphin_fangyang/summary
·非流式識别帶熱詞:https://www.modelscope.cn/studios/haitianruisheng/dolphin_fangyan_reci/summary
模型與代碼地址
·Github:https://github.com/DataoceanAI/Dolphin
·ModelScope:https://modelscope.cn/organization/DataoceanAI
·HuggingFace:https://huggingface.co/DataoceanAI
技術報告
http://arxiv.org/abs/2605.08961
推理代碼SDK
https://pypi.org/project/dataoceanai-dolphin/
Dolphin-CN-Dialect是一款面向漢語多方言、多口音、真實場景優化的新一代語音識别模型,它并非簡單擴大模型規模,而是在Dolphin系列模型基礎上,圍繞數據配方、tokenizer、訓練穩定性、流式轉寫、熱詞增強和部署效率做了一次系統升級,破解主流ASR模型方言識别率斷崖下跌的行業難題。
主流語音識别模型在普通話場景已表現優異,但切換至方言和地區口音時識别率大幅下降,核心原因并非模型參數不足,而是訓練數據分布嚴重不均衡:普通話數據充足,方言樣本天然稀缺,簡單混合訓練隻會讓模型持續偏向普通話。Dolphin-CN-Dialect通過temperature-based sampling重塑訓練分布,讓低資源方言在訓練中被真正“看見”,而非被普通話數據淹沒。

Dolphin-CN-Dialect核心特性
· All-in-one多方言覆蓋
單模型支持21類漢語方言/地區口音,覆蓋普通話、台灣普通話、四川話、吳語、閩南語等全場景中文語音,無需切換多模型即可完成識别。
·精準高效的輕量識别
0.4B小參數模型實現性能與效率的均衡,21個方言/口音測試集平均CER達到5.74%,對應平均準确率約94.3%;實現38%的方言識别準确率提升和16.3%的整體CER相對降低,标準普通話性能僅有約0.2%的輕微波動。

Accuracy = 100 - CER,越靠外代表識别越準确。完整實驗以技術報告表格為準。
·流式轉寫+雙模式熱詞增強
支持流式+非流式一體化推理,适配實時字幕、會議轉寫、客服質檢、錄音整理等全業務場景;搭載encoder-level上下文偏置與prompt-based兩種熱詞增強方案,精準适配方言場景、噪聲場景、長尾詞場景。
·訓練機制全面優化
通過訓練機制優化緩解loss spike、修複短音頻漏字問題;數據管線I/O吞吐從50MB/s提升至約800MB/s,減少GPU空轉。
· 低資源方言專項優化
基于temperature-based sampling平衡訓練數據分布,讓稀缺方言樣本獲得充分訓練,在吳語、閩南語等高難度方言上實現顯著識别提升。
關鍵技術方法
·為中文方言重新設計數據配方
使用與Dolphin V1一緻的訓練數據底座,通過temperature-based sampling在Natural Sampling和Uniform Sampling之間做平滑,讓低資源方言被更多學習,同時保留高資源普通話數據的穩定性。
配方優化後多方言測試集平均WER從8.04降至5.62,相對下降30.1%;甯夏、湖北、陝西、河南、山西、天津、山東、安徽、湖南等方言測試集均有明顯提升。 訓練數據僅使用DataoceanAI中文數據集,覆蓋标準普通話和22類漢語方言/地區口音,結合AISHELL、約10,000小時WenetSpeech、KeSpeech、Common Voice公開數據增強泛化能力。

注:這張配方圖來自中間實驗,供大家參考;由于實驗設置與論文最終評測表格不完全一緻,數字口徑會有微小差異。
·更适合中文的tokenizer設計
詞表規模從40,000降至18,173;中文采用字符級建模,适配CTC-AED聯合架構單調對齊;英文及字母語言保留BPE subword建模,兼顧表達能力與詞表效率。 引入任務token、時間戳token、方言/地區token,額外預留80個方言token slot,為後續擴展更多地區語音預留空間。
·訓練穩定性與工程優化
将BatchNorm替換為LayerNorm,緩解變長語音和異構數據帶來的loss spike;針對流式CTC解碼短音頻漏字問題,補充短音頻和尾部随機截斷增強,删除錯誤從9.17降至3.66;數據管線優化後I/O吞吐從50MB/s提升至約800MB/s。

模型效果
我們對Dolphin-CN-Dialect在21類漢語方言/口音、标準普通話、真實場景語音、熱詞增強等維度進行了系統評估,結果顯示:
·漢語方言/口音
21類方言/口音平均CER 5.74%;相較Paraformer_zh平均CER從22.76%降至5.74%,相對降低約74.8%;相較Qwen3-ASR-0.6B從12.74%降至5.74%,相對降低約54.9%;相較FunASR-Nano-2512從12.73%降至5.74%,相對降低約54.9%;相較FireRed-AED 1.2B從6.85%降至5.74%,相對降低約16.2%。
在多個高難度方言表現上,Dolphin-CN-Dialect 的優勢更加明顯。吳語CER為 9.49%,優于Qwen3-ASR-0.6B的18.25%和FunASR-Nano-2512的17.77%;閩南語 CER 為 20.74%,優于 Qwen3-ASR-0.6B的38.64%、FunASR-Nano-2512 的 55.36% 和 FireRed-AED 1.2B 的 30.73%;上海話 CER 為 7.81%,接近 FireRed-AED 1.2B 的 7.43%。

·标準普通話與地區口音
在KeSpeech 與Common Voice台灣普通話測試集上,Dolphin-CN-Dialect-0.4B 分别取得 5.04%、5.62% 的 CER。作為僅 0.4B 參數量的輕量模型,它在同梯隊(≤0.8B)中拿下雙測試集最優表現,性能全面超越 Qwen3-0.6B、FunASR-Nano-2512 等更大參數量模型,甚至優于1.7B 的 Qwen3-1.7B,展現出極高的參數效率。同時,優異的測試結果也印證了模型對真實錄音、自然表達與地區口音的強泛化能力,完美匹配多方言優化目标。

·熱詞增強效果
在 encoder-level 熱詞實驗中,Dolphin-CN-Dialect-0.4B 在 AISHELL 上将 BWER 降至 4.82,在 Common Voice 上将 BWER 降至 9.46,均優于 Paraformer_zh。

在 Common Voice prompt-based 熱詞實驗中,WER 從 7.11 降至 6.08,BWER 從 15.22 降至 6.79,BWER 相對降低 55.4%。

·真實場景适配
适配方言、口音、噪聲、長尾詞等複雜中文語音環境,低資源方言識别無明顯短闆。
我們希望Dolphin-CN-Dialect的發布,能夠補齊漢語方言語音識别的短闆,讓語音識别不隻聽懂标準普通話,更能聽懂更真實的中國話,推動多方言語音技術在日常溝通、辦公協作、行業服務等場景的普及與落地。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

