随着AI技術的不斷進步,語音助手已經融入了我們生活的方方面面。同時在大模型落地千行百業的大潮之下,語音助手也快速卷入AI革命的浪潮中。
GPT大模型作為一種強大的語言生成模型,通過語言理解、生成能力和上下文記憶能力,不斷地自我完善和進化,讓語音助手變得更加聰明和人性化,提供更加精準的服務。音色作為語音助手與用戶交互的重要元素,其質量的好壞直接影響着用戶體驗。
近期,标貝科技借助自研的語音合成測評系統,從音頻音色的真實度、發音準确率、副語言表達三個維度,對幾款主流GPT語音助手進行了全面的測評,深入了解當前GPT語音助手的合成音色質量,給用戶提供更多的選擇依據。
标貝科技GPT語音助手測評方案
1、測評音頻&内容
(1)所有音頻均以與GPT對話的形式錄制采集,每個音色選擇了20條音頻,每條音頻時長30-40s左右;
(2)音頻的内容涉及故事、美食、演講、詩歌、說明、新聞、客服等方面,采集時會給GPT明确話題和時長要求,内容由其自由發揮,因此本次測評每條音頻的内容并不一緻,可能會對結果的一緻性産生一些影響。
2、測評标準
本次測評需要分三個維度給音頻打分、标注,包括真實度、副語言、準确率。
3、測評人員
此次測評由12位人員執行,其中男性5人,女性7人,年齡均在20-35之間,所有人員都經過培訓和測評訓練,對标準有統一清晰的認知。
4、評測結果
(1)得分彙總

(1)所有音色的真實度得分都在4分以上,說明GPT語音助手非常接近真人發音水平;其中,cove這個音色的真實度,達到4.56分;
(2)每句話副語言(如換氣、重音、停頓等)平均出現的頻率在3次以上;
(3)每句話出現的副語言頻率與音色的真實度呈正相關。即副語言頻率越多,聲音給人的感受越真實,越像真人發音。
●副語言分析
本次測評統計了每個句子中出現的副語言元素以及其總共出現的頻率,頻率排前五的副語言為換氣、重音、停頓、拖音、插入語氣詞。正是這些副語言為合成音頻增加了音色的真實度。

(1)換氣
換氣是一種語音聲學特性,指的是在發音過程中聲帶之間存在一定的空隙,允許一些空氣通過聲帶傳遞,産生柔和的、帶有輕微氣息的聲音。在語音合成中加入換氣效果,就是模仿了人類說話時的呼吸模式。
本次測評中的GPT語音助手都使用了換氣效果,在聲音中增加了一種自然、拟人化的感覺,聽起來也更加真實自然。
(2)重音和拖音
重音和拖音是為了強調語義内容的手段,通常是通過音調和時長的改變來增強語音表達的自然度和情感豐富性。
本次測評結果真實度較高的音頻中,均地使用了重音和拖音來突出關鍵信息(通常會根據上下文内容到字),如演講中強調主題或故事中加強緊張情節。
(3)停頓
在合成語音中引入适當的停頓,可以提高語音的自然度和表現力。測評音色中,我們發現,停頓的長度和位置的調整可以根據文本内容、語氣和情感進行差異化處理,使語音聽起來更自然而不生硬。如表示猶豫時,會适當增加停頓時長,表達激動内容時,會減少停頓時長。
(4)語氣詞
語氣詞指的是在語音中用來表達語氣、情感或語言交際功能的詞語或短語,常見于口語交流中,如啊、嗯、哦、唉、呃、嘛、吧、啊、笑聲等。這些詞語通常不是用于傳遞嚴格的字面意義,而是用來調整語音的情感色彩、語調、韻律或表達說話者的态度。
本次測評中,語音助手的語氣詞主要有兩個方面的表現:一是對輸入的文字進行了口語化改寫,适當增加了語氣詞的部分;二是在聲音表現方面,語氣詞能夠做到真實不生硬。
(5)其他
測評結果還發現,GPT語音助手還使用了其他副語言元素,如重複、自我修正、自動加入兒化效果等,都是為了模仿真人的發音特點來實現自然自發的語音效果。
●準确度分析
本次測評的GPT語音助手發音整體的準确率很高,錯誤出現頻率較低。但在處理一些特殊文本時,還會出現一些錯誤,錯誤主要分為兩類:
第一類與中文的語言特點相關,如TN類文本、多音字、變調等,這類問題如果讀音不準确,在一定程度上會影響句子的可懂度,還需要進一步完善;
第二類問題是語音合成中常見的一些聲學模型問題,如多字、漏字等,這類問題在本次測評中出現的頻率較少,對可懂度的影響也不大。

5、結論
●語音真實度
GPT語音助手在語音真實度方面表現出色,音色普遍接近真人發音,平均得分超過4分。這顯示了其在模拟自然語音方面的先進技術。
●副語言表達
測評發現了GPT語音助手在使用副語言元素(如換氣、重音、停頓等)方面的效果,這些元素為合成音頻增添了更多的真實感和生動性。
●發音準确性
在發音準确度方面,GPT語音助手展現了較高的标準。雖然在處理特殊文本時偶有發音錯誤,但整體準确率保持在一個較高水平,這對于理解和交流至關重要。
●改進空間
盡管當前成績顯著,但在某些方面仍有改進空間。特别是在處理多音字和語音合成模型中常見的問題方面,需要進一步優化以提高整體用戶體驗。
基于本次對GPT語音助手的多維度測評結果,标貝科技依托核心的語音大模型遷移學習和深度神經網絡技術,推出自然對話語音合成數據庫以及自然對話合成音色解決方案,程度還原真人說話時的語氣詞、吸氣聲、停頓、拖音等副語言細節,讓語音助手變得更加拟人化,提供自然、真實的人機對話服務。
标貝科技自然對話語音合成數據庫
标貝科技自然對話語音合成數據集完成對數據庫的音字标注、韻律标注、情感/口語化行為标簽标注,供算法優化直接使用。

标貝科技自然對話語音合成方案
标貝科技自然對話語音合成解決方案的核心在于通過分析大量真實語音數據,提取真人說話時的音色、語調、情感等特征,以提高其對副語言現象的建模能力。在合成語音時,将這些特征複制到機器生成的語音中,從而使得合成的語音能夠更加自然、真實地表達說話者的意圖和情感。
歡迎對以上數據集和方案感興趣的行業夥伴聯系我們~
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

