上周,OpenAI在春季新品發布會上公布了的GPT-4o,并展示了一系列令人矚目的新功能。作為一款全能模型(Omnimodel),GPT-4o融合了文本、語音和圖像三種模态的理解能力。可以接受任何文本、音頻和圖像的組合作為輸入,并直接生成上述這幾種媒介輸出。這意味着人機交互邁入一個全新的發展階段。

GPT-4o:多模态實時語音助手,更快更有情感
與現有模型相比,GPT-4o的核心亮點,當屬具備了實時語音交互能力。在語音模式下,GPT-4o能夠實現高質量的語音合成和語音識别。人機對話中,GPT-4o可以在232毫秒内對音頻輸入做出反應,甚至你還能随時打斷,GPT-4o根據情境生成不同風格的聲音和情感給出無縫回複,保證前後自然融洽的連續對話。
OpenAI的開發負責人MarkChen現場演示了GPT-4o的語音交互能力。當Mark說要再次嘗試深呼吸時,ChatGPT也恰好接上話題說:“慢慢呼氣。”整個過程幾乎沒有延遲,響應迅速且富有共情,如真人般對話。

相比之下,當前市場上的語音助手大多反應遲緩、不能被打斷且缺乏情商。GPT-4o俨然是一款進階人工智能語音助手。
AI大模型打造人機語音交互範式
從最初不會說話的AlphaGo,到之後“能說會道”的蘋果Siri與ChatGPT語音版,再到如今的GPT-4o。通過實時語音、視頻輸入信息的理解和高度拟人化的語音輸出,呈現更具真實感與沉浸感的交互體驗。GPT-4o在人機交互的表現,特别是語音交互中的突破,開啟了全新的AI超拟人化交互方式。
事實上,緊跟大模型發展,超拟人語音合成作為人機交互的重要表達方式,近來已經成為國内外AI巨頭争相布局的重點。
相較于傳統語音合成中“闆正”、“一絲不苟”的“播音腔”問題,超拟人語音合成能夠模拟人類的副語言,如呼吸、歎氣、語速變化等習慣,使合成效果更接近人在日常生活中的口語表達。無論是輕松的日常聊天,還是複雜的專業問答,機器都能根據對話的場景變化調整語調和情感,讓交流變得更加自然真實。
多維度TTS音色定制助推AI語音交互商業化應用
标貝科技專注智能語音交互領域多年,在多風格、多情感語音合成上持續深耕。依托核心的語音大模型遷移學習和深度神經網絡技術,标貝科技通過分析大量真實語音數據,提取真人說話時的音色、語調、情感等特征,提高對副語言現象的建模能力。最終輸出的合成聲音在韻律表現、音色層次感、情感拟人化方面均有了大幅提升,MOS評分達到4.5以上,無限接近真人表達。
與傳統語音合成技術相比,标貝科技語音合成系統基于GAN和Transformer機制的高音質語音合成,對不同角色和情感表達的判斷更加準确,高效且真實的還原波形。進一步增強了喜怒哀樂等各種類型的情感反饋能力。使得合成的聲音能夠自然、真實地表達說話者的意圖和情感。合成過程中用戶還可以随心調節停頓、語速、音量等參數,使用更靈活。
此外,結合當前智能語音産業需求現狀,标貝科技不斷對産品進行打磨升級,推出包括普通複刻、精品複刻、标準化音色定制的多維度TTS音色定制方案。方案支持特定口音、方言、語種等一站式集成定制,可以快速針對特定語言環境和使用場景優化語言模型,提供更自然、更準确的語音輸出。

目前,标貝科技多維度TTS音色定制方案已經在智能客服、社交娛樂、新聞媒體、數字人、iOT設備等領域得到應用,助力中國銀行、人民日報、湖南電信、恒生電子等多家行業頭部企業實現AI語音能力的應用與拓展。
GPT-4o的問世,無疑帶來了更智能、更便捷的交流方式,推動人機交互模式的革新,更帶動了新一波的個性化語音交互熱潮。未來,标貝科技将持續深耕智能語音交互領域,重點發力拟人化語音合成技術創新研發,解鎖更豐富的應用場景,為用戶打造更加全面和智能的語音交互體驗。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

