說到聲音克隆,大家都不陌生。開車時聽“志玲姐姐”為你導航,看書時“喜歡的愛豆”給你講故事,聽“AI孫燕姿”唱脍炙人口的流行歌曲,聽“馬三立”講相聲等等,這都是聲音複刻技術在生活中的具體應用。
聲音克隆,也稱聲音複刻,通過使用AI模型對大量的數據進行學習和訓練,從而得到與用戶本人在音色和發音風格上非常相似的聲音模型,快速“複刻”個性化聲音。用以彌補傳統語音合成技術在數字化人聲上的不足,生成紋理更為真實豐富的聲音。
近年來,随着智能語音産業的快速發展,語音合成技術得到了廣泛應用,而聲音複刻作為語音合成拓展出的個性化應用,也在不斷取得進展。目前,聲音複刻已經在語音導航、小說閱讀、影視配音、虛拟人音色生成、AI歌曲等領域廣泛落地應用。
标貝科技聲音複刻
事實上,得益于AI技術的發展,還原人聲已經是非常基礎的事了。但通過一般聲音複刻軟件克隆出來的聲音往往機械感重,缺乏語調、情感的變化,在交互過程很難帶入。想要實現1:1的高質量聲音克隆,更需要耗費大量時間以及高昂的定制成本。
此前,為了滿足多場景音色需求,标貝科技推出普通聲音複刻和精品聲音複刻兩種方案。 普通聲音複刻僅需5分鐘音頻數據,便可實現與真人語氣音調基本接近的合成音色。而精品複刻則是基于30-60分鐘的音頻數據,提取說話人的音色和發音特征,經過2-3天的模型訓練及效果調優,實現用戶個性化的音色定制。
近日,為了進一步降低聲音複刻使用門檻,标貝科技在保留普通聲音複刻方案的基礎上,依托核心的語音大模型遷移學習和深度神經網絡技術,對原有的精品聲音複刻方案進行升級疊代。用戶僅需提供30分鐘的音頻數據,經過3個小時訓練出高相似度的聲音模型,即可将目标說話人的聲音複刻下來,高保真還原真人發音,還富有鮮明的情感表現力和人格化魅力。
相對于原有的方案,升級後的精品聲音複刻技術增加了音色的多情感表現能力,可以支持開心、憤怒、悲哀、驚訝、恐懼、厭惡等多種情緒,适用于不同情境下的語意表達。同時訓練周期縮短90%以上,整體複刻成本降低近40%。

▲新老版聲音複刻對比
個性化音色定制 讓合成聲音更便捷普惠
伴随着語音合成技術應用不斷深入,使用場景的日益多樣化也對聲音提出了更高的要求,以标準音色合成、聲音複刻、聲音轉換等為代表的聲音定制服務開始成為發展趨勢。
實際上,AI語音定制在智能語音産業中始終具有高度的競争優勢。音色,是每個人獨有的聲音特色。AI聲音不僅是一項基本人機交互能力,更被賦予了很多品牌屬性。強大的音色定制能力能夠賦予機器人擁有媲美真人的聲音屬性,基于領域和場景的要求,打造更為鮮活的品牌形象。
經過多年的行業積累沉澱,标貝科技已逐步形成了一套成熟的技術方案,覆蓋從聲音畫像設計、數據采集标注、模型優化和最終部署上線的全流程,實現一站式TTS商業化定制服務。面向不同層面的用戶需求,标貝科技可以基于普通聲音複刻、精品聲音複刻、标準化定制等多層級技術方案,提供從底層數據、到核心技術,再到場景應用的全鍊路TTS音色定制支持,客戶無需耗費過多時間和資源,即可實現專屬IP音色。
目前,标貝科技已經為湖南電信、恒生電子、信雅達、慧捷科技、人民日報、風平智能、穿山甲等客戶提供音色定制方案,覆蓋智能客服、金融券商、新聞媒體、社交娛樂、虛拟數字人、IOT機器人等領域。
未來,AIGC時代,生成式AI成為新風潮,聲音定制服務也會迎來更為廣闊的發展空間和潛力。标貝科技将不斷優化和完善聲音定制服務,提供更加全面和智能的語音交互體驗,為用戶帶來更多驚喜和便利。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

