Dolphin-CN-Dialect正式發布

2026-05-14 13:39:52 來源:鳳凰網
        【每日科技網】

  今天,海天瑞聲攜手清華大學電子工程系語音與音頻技術實驗室(SATLab),正式發布Dolphin-CN-Dialect漢語多方言語音識别模型!

  獲取渠道

  體驗地址

  ·非流式識别:https://www.modelscope.cn/studios/haitianruisheng/dolphin_fangyang/summary

  ·非流式識别帶熱詞:https://www.modelscope.cn/studios/haitianruisheng/dolphin_fangyan_reci/summary

  模型與代碼地址

  ·Github:https://github.com/DataoceanAI/Dolphin

  ·ModelScope:https://modelscope.cn/organization/DataoceanAI

  ·HuggingFace:https://huggingface.co/DataoceanAI

  技術報告

  http://arxiv.org/abs/2605.08961

  推理代碼SDK

  https://pypi.org/project/dataoceanai-dolphin/

  Dolphin-CN-Dialect是一款面向漢語多方言、多口音、真實場景優化的新一代語音識别模型,它并非簡單擴大模型規模,而是在Dolphin系列模型基礎上,圍繞數據配方、tokenizer、訓練穩定性、流式轉寫、熱詞增強和部署效率做了一次系統升級,破解主流ASR模型方言識别率斷崖下跌的行業難題。

  主流語音識别模型在普通話場景已表現優異,但切換至方言和地區口音時識别率大幅下降,核心原因并非模型參數不足,而是訓練數據分布嚴重不均衡:普通話數據充足,方言樣本天然稀缺,簡單混合訓練隻會讓模型持續偏向普通話。Dolphin-CN-Dialect通過temperature-based sampling重塑訓練分布,讓低資源方言在訓練中被真正“看見”,而非被普通話數據淹沒。

  Dolphin-CN-Dialect核心特性

  · All-in-one多方言覆蓋

  單模型支持21類漢語方言/地區口音,覆蓋普通話、台灣普通話、四川話、吳語、閩南語等全場景中文語音,無需切換多模型即可完成識别。

  ·精準高效的輕量識别

  0.4B小參數模型實現性能與效率的均衡,21個方言/口音測試集平均CER達到5.74%,對應平均準确率約94.3%;實現38%的方言識别準确率提升和16.3%的整體CER相對降低,标準普通話性能僅有約0.2%的輕微波動。

  Accuracy = 100 - CER,越靠外代表識别越準确。完整實驗以技術報告表格為準。

  ·流式轉寫+雙模式熱詞增強

  支持流式+非流式一體化推理,适配實時字幕、會議轉寫、客服質檢、錄音整理等全業務場景;搭載encoder-level上下文偏置與prompt-based兩種熱詞增強方案,精準适配方言場景、噪聲場景、長尾詞場景。

  ·訓練機制全面優化

  通過訓練機制優化緩解loss spike、修複短音頻漏字問題;數據管線I/O吞吐從50MB/s提升至約800MB/s,減少GPU空轉。

  · 低資源方言專項優化

  基于temperature-based sampling平衡訓練數據分布,讓稀缺方言樣本獲得充分訓練,在吳語、閩南語等高難度方言上實現顯著識别提升。

  關鍵技術方法

  ·為中文方言重新設計數據配方

  使用與Dolphin V1一緻的訓練數據底座,通過temperature-based sampling在Natural Sampling和Uniform Sampling之間做平滑,讓低資源方言被更多學習,同時保留高資源普通話數據的穩定性。

  配方優化後多方言測試集平均WER從8.04降至5.62,相對下降30.1%;甯夏、湖北、陝西、河南、山西、天津、山東、安徽、湖南等方言測試集均有明顯提升。 訓練數據僅使用DataoceanAI中文數據集,覆蓋标準普通話和22類漢語方言/地區口音,結合AISHELL、約10,000小時WenetSpeech、KeSpeech、Common Voice公開數據增強泛化能力。

  注:這張配方圖來自中間實驗,供大家參考;由于實驗設置與論文最終評測表格不完全一緻,數字口徑會有微小差異。

  ·更适合中文的tokenizer設計

  詞表規模從40,000降至18,173;中文采用字符級建模,适配CTC-AED聯合架構單調對齊;英文及字母語言保留BPE subword建模,兼顧表達能力與詞表效率。 引入任務token、時間戳token、方言/地區token,額外預留80個方言token slot,為後續擴展更多地區語音預留空間。

  ·訓練穩定性與工程優化

  将BatchNorm替換為LayerNorm,緩解變長語音和異構數據帶來的loss spike;針對流式CTC解碼短音頻漏字問題,補充短音頻和尾部随機截斷增強,删除錯誤從9.17降至3.66;數據管線優化後I/O吞吐從50MB/s提升至約800MB/s。

  模型效果

  我們對Dolphin-CN-Dialect在21類漢語方言/口音、标準普通話、真實場景語音、熱詞增強等維度進行了系統評估,結果顯示:

  ·漢語方言/口音

  21類方言/口音平均CER 5.74%;相較Paraformer_zh平均CER從22.76%降至5.74%,相對降低約74.8%;相較Qwen3-ASR-0.6B從12.74%降至5.74%,相對降低約54.9%;相較FunASR-Nano-2512從12.73%降至5.74%,相對降低約54.9%;相較FireRed-AED 1.2B從6.85%降至5.74%,相對降低約16.2%。

  在多個高難度方言表現上,Dolphin-CN-Dialect 的優勢更加明顯。吳語CER為 9.49%,優于Qwen3-ASR-0.6B的18.25%和FunASR-Nano-2512的17.77%;閩南語 CER 為 20.74%,優于 Qwen3-ASR-0.6B的38.64%、FunASR-Nano-2512 的 55.36% 和 FireRed-AED 1.2B 的 30.73%;上海話 CER 為 7.81%,接近 FireRed-AED 1.2B 的 7.43%。

  ·标準普通話與地區口音

  在KeSpeech 與Common Voice台灣普通話測試集上,Dolphin-CN-Dialect-0.4B 分别取得 5.04%、5.62% 的 CER。作為僅 0.4B 參數量的輕量模型,它在同梯隊(≤0.8B)中拿下雙測試集最優表現,性能全面超越 Qwen3-0.6B、FunASR-Nano-2512 等更大參數量模型,甚至優于1.7B 的 Qwen3-1.7B,展現出極高的參數效率。同時,優異的測試結果也印證了模型對真實錄音、自然表達與地區口音的強泛化能力,完美匹配多方言優化目标。

  ·熱詞增強效果

  在 encoder-level 熱詞實驗中,Dolphin-CN-Dialect-0.4B 在 AISHELL 上将 BWER 降至 4.82,在 Common Voice 上将 BWER 降至 9.46,均優于 Paraformer_zh。

  在 Common Voice prompt-based 熱詞實驗中,WER 從 7.11 降至 6.08,BWER 從 15.22 降至 6.79,BWER 相對降低 55.4%。

  ·真實場景适配

  适配方言、口音、噪聲、長尾詞等複雜中文語音環境,低資源方言識别無明顯短闆。

  我們希望Dolphin-CN-Dialect的發布,能夠補齊漢語方言語音識别的短闆,讓語音識别不隻聽懂标準普通話,更能聽懂更真實的中國話,推動多方言語音技術在日常溝通、辦公協作、行業服務等場景的普及與落地。

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
    本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

猜你喜歡

海能達發布全新專業防爆PDT對講機CH690Ex

随着我國應急管理體系持續完善,消防救援任務正在從傳統火災處置,向化工園區事故、危險品洩漏、地下空間救援、大型綜合災害等多風險、多場景方向發展。在這些複雜環境中,救援現場往往面臨爆炸性氣體、可燃性粉塵、

2周前

海能達CCW 2026載譽收官:AI與融合通信引領專用通信新未來

6月16日至18日,2026年全球關鍵通信展(CCW2026)在英國倫敦舉行。展會期間,海能達集中展示了從終端到系統、從感知到決策的全鍊路創新版圖,AI與融合通信産品及解決方案貫穿三天展期,持續獲得高

4周前

登陸歐洲 Intersolar!遠景AI電力系統支撐全球 AI 算力發展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,遠景科技集團發布面向AI數據中心的下一代電力基礎設施——融合風光儲一體化方案、固态變壓器(SST)、800V直流供電、儲能

4周前

海能達六度問鼎ICCAs,PDC650與西安機場方案摘得雙獎

6月17日,2026年國際關鍵通信獎(InternationalCriticalCommunicationsAwards,ICCAs)在英國倫敦舉行的全球關鍵通信展(CCW2026)期間正式揭曉。海能

4周前

海能達即将亮相2026年CCW全球關鍵通信展: 攜AI與融合通信解決方案登陸倫敦

6月16日至18日,2026年CCW全球關鍵通信展将在英國倫敦啟幕。作為全球領先的專用通信解決方案提供商,海能達将以全場景關鍵通信産品矩陣亮相F25展位,集中展示面向公共安全、應急救援、城市治理等領域

1個月前

海能達再獲第十一屆廣東專利獎:持續自主創新,構築專用通信知識産權高地

近日,廣東省市場監督管理局正式公示第十一屆廣東專利獎評選結果。海能達通信股份有限公司申報的“一種集群通信系統的組派接方法、通信系統及存儲介質”(專利号:ZL201811296617.7)榮獲廣東專利優

1個月前