談到智能語音,早已不是什麼新鮮的事情,國外有蘋果Siri,微軟小娜,Google Assistant,亞馬遜的Alexa這樣的智能語音大咖。國内有靈犀助手(科大訊飛),小度(百度),小愛同學(小米)這樣的後來跟進者。
接觸智能語音的用戶,會覺得很神奇,覺得這東西怎麼可以如此智能。而對于經常使用的老用戶來說,智能語音助手的雞肋日益顯現,因為現階段的智能語音基本都是采用數據庫匹配的原則,對于雲端數據庫中沒有的知識,智能語音也隻能“呵呵”了。不難看出的是,智能語音設備的拾音技術依然收外界許多因素幹擾,進步和優化空間巨大。但,對于技術來說,我們應該永遠懷着寬容和理解的态度去對待,因為任何一門技術都是一個不斷積累和疊代的過程。
對于大部分人來說,目前接觸體驗最多的智能語音硬件應該隻有智能音箱和智能機器人。隻有通過智能硬件與雲端數據中心的默契配合,才有可能讓智能語音交互形成完整通路。語音交互的大緻流程可分為:聲音采集—>降噪—>語音喚醒—>語音轉文字—>語義理解—>回複文字和指令—>文字轉聲音—>播放聲音。以下天貓精靈智能音箱為例,将語音交互完整步驟做逐步分解。

1.用戶說“天貓精靈,今天天氣怎麼樣?”;2、“天貓精靈”被語音喚醒模塊接收到,并判斷為喚醒詞,然後通過AI芯片和硬件拾取和記錄“今天天氣怎麼樣”這段語音,并發送給雲端服務器;3、服務器把收集到的電腦信号,再次轉化成文字“今天天氣怎麼樣”,交給語義理解服務器;語義理解服務器把“今天天氣怎麼樣”這段文字,拆解成“事件=查詢天氣,時間=今天”這段控制指令回傳給設備。4、設備根據時間和本機地理位置,找天氣服務器查詢天氣,并獲得天氣的的文本數據“今天要下雨”;5、設備把“今天要下雨”這幾個字發給文字轉聲音的服務器,服務器返回“今天要下雨”這段聲音,由設備喇叭播放出來。

毋庸置疑的是,以上五個步驟都是由智能音箱的硬件和雲端的數據中心配合完成的,硬件隻要負責聲音的拾取和傳達,雲端則用豐富的數據資源去匹配用戶的需求,二者缺一不可。相對來說,聲音前處理技術則是智能硬件最最重要的部分,主要體現降噪和拾音效果兩方面,喚醒以及與機器對話的時候都需要拾音,而且拾音還有近距離和遠距離之說,如果連最基本的聲音都沒有聽清和聽懂,談何後面的數據傳達和解析呢。

聲音的前處理技術,是聲音沒有進入傳輸、沒有存儲之前的處理。聲音前處理目的,就是讓聲音的存儲、傳輸效率更高,識别率更好(例如回聲消除、降噪、聲音活動檢測等等)。聲音的後處理技術,是聲音經過存儲之後進行播放的同時處理。是對音源例如 MP3 等媒體解碼播放的聲音進音效增強處理(例如虛拟重低音、環繞立體聲、高音增強、EQ 等等)。如何将人的聲音有效傳達至機器,讓機器“聽到”、“聽清”且“聽懂”? “聽懂”之後又改如何與雲端的數據進行精準匹配,最終反饋給用戶真正想要的需求動作?這将是智能語音聲音前處理技術和聲音後處理技術應該思考和努力解決的問題。國内耕耘聲音20餘年,在聲音前處理技術方面已經處于地位的國産芯片原廠炬芯科技從2018年開始就在核心主推的雙麥克風陣列智能語音芯片,已經在各大品牌智能音箱、早教機器人、繪本機器人、物聯網中控等産品上完美落地,強大的聲音前處理技術為完美智能語音體驗保駕護航。後續将推出更高端的ATS3609D等高端語音及視頻交互解決方案,對聲音的耕耘炬芯将永無止境。

目前,國家正在加快人工智能的産業布局,發布多項利好政策促進人工智能産業發展;5G時代的來臨更是為人工智能的發展培育了一片物聯網沃土。我們可以預見,智能語音作為下一代人機交互的新入口,将率先在這片人工智能的沃土上生根發力,推動整個産業的茁壯成長。如想讓讓智能語音産品做到真正的聰明,智能硬件(包括主控芯片和各種IC)和語音助手(雲端數據中心)都需要再升級,不斷打通人和機器之間對話的技術壁壘,讓人與機器中間的溝通變成真正的“面對面”溝通。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

