在新型冠狀病毒危機期間,視頻的使用變得普及,在教育、娛樂、社交、辦公等日常社會活動中越來越重要。
與此同時,主要AI生成技術團隊公布新的研究及應用,包括Google AI、Microsoft AI、Facebook AI、Moviebook AI、TensorFlow、Open AI,以領導AI技術在抗疫中發揮關鍵作用。
Google 使用AI 創建音頻,推出NeRF 做到多視角逼真3D 效果
谷歌于上周宣布使用AI WaveNetHQ來大面積增強視頻通話的音頻質量,Google WaveNetHQ通過創建新的語音數據來填充音頻下降所造成的間隙。谷歌表示,其Duo應用程序通話中有99%會遇到不同音頻相關問題,有20%的通話損失超過3%的音頻,而10%的通話損失了近十分之一。AI是行之有效方法,AI經過訓練可以産生大部分音節音調,并且可以填補長達120毫秒的間隙。
這一功能在Duplex AI中得以應用,并大面積實際應用。引援谷歌首席執行官桑達爾·皮查伊(Sundar Pichai)在博客中表示,在情況允許的情景下,谷歌計劃使用Duplex與英國企業聯系以了解營業時間,這是Duplex繼2018年5月演示後的規模現實應用,它将完成自主收集數據、觸發、創建數據集、結果分析的全流程。
在視頻方面,谷歌和伯克利大學發布開源研究NeRF,隻需要輸入少量靜态圖片,就能做到多視角的逼真3D效果。NeRF可在複雜的遮擋下,展現場景中詳細的幾何體,在現實場景中,插入虛拟對象,實踐結果顯示3D圖像都比較逼真。
Moviebook 使用AI 生成新視頻
在本周,中國視覺技術應用企業Moviebook研究人員描述了其AI系統AGC引擎的訓練場景,運用視頻幀元素間的圖像耦合及語義邏輯關系,該引擎可生産質量更高的視頻,亦可用于其他 AI系統生成的視頻在其AGC上合成或新創建,以補充不完整的真實視頻數據集或損壞的樣本,生成一段全新視頻。據悉,此生成方法已經廣泛應用于中國影視、綜藝節目、短視頻、體育、資訊可視化等場景中。
正如影譜科技研究人員所解釋的那樣,視頻合成領域的大部分工作都利用GAN(或由兩部分組成的神經網絡)組成,這些神經網絡由生成樣本的生成器和鑒别器組成,這些鑒别器試圖區分生成的樣本和真實樣本。它們具有很高的能力,但會遭受稱為模式崩潰的現象,在這種情況下,無論輸入如何,生成器都會生成有限的樣本多樣性(甚至是相同的樣本)。
相比之下,影譜AGC的系統由代表視頻内容功能的變量,特定于幀的瞬時變量,生成器和遞歸機器學習模型組成。它将視頻分解為靜态部分,該部分捕獲所有幀共有的視頻的恒定部分,而一個瞬态部分表示視頻中所有幀之間的時間動态(即基于時間的事件驅動的周期性規律性),形成一個動作捕捉系統。該系統有效地共同學習了靜态和瞬态成分,并将其用于在推理時生成視頻。
與幾種基準模型生成的視頻相比,研究人員表示,他們的系統所生成的視頻“在視覺上更具吸引力”,并通過更清晰的幀“保持一緻性”。此外,AGC展示了一種用于幀插入關聯圖像的訣竅,或者是一種視頻處理形式,其中在現有幀之間生成中間幀,以使動畫更加流暢,或插入商業化場景。
Microsoft AI 開源跟蹤對象,實現抑制視頻通話中音噪
Microsoft AI團隊本周發布FairMOT開源模型,用于多對象跟蹤對象檢測器,即使佩戴口罩也可使用面部識别技術識别患者。除此之外,還有許多其他用途,包括安全性和老人護理。
與此同時,Microsoft Dynamics 365 AI Research研究人員協同加利福尼亞大學聖塔芭芭拉分校實驗室一項有關視頻和語言推理開源技術,其将顯著增強自動會議轉錄工具的效果和準确度,通過AI驅動的噪音抑制功能可自動消除視頻通話中的背景噪音。
Facebook 推出RegNet ,将2D 照片轉換為3D
上周,Facebook AI的研究人員推出了一種稱為RegNet的新網絡設計範例。根據實驗結果,RegNet模型在性能上勝過流行的EfficientNet模型,而在GPU上的速度可提高五倍。
Facebook表示,借助AI,即使手機沒有雙攝或者人像算法,程序也可以将2D的照片轉換為3D照片。為此,Facebook訓練了一個神經網絡來“估算每個像素與相機的距離”,從本質上講,AI可以通過分析來給出景深信息,以此将照片轉換為3D。用戶還可以用它做更複雜的功能,比如更正照片問題、添加肖像效果、美化臉部,在晚上拍攝星星效果也會比正常的相機更清晰。
OpenAI 推出神經元可視化
OpenAI本周發布了Microscope,這是一個神經元可視化庫,從九個流行或主流框架神經網絡開始。該集合包含數百萬張圖像,可以幫助AI研究人員更好地理解具有成千上萬個神經元的神經網絡的結構和行為。
使用可視化來解釋機器學習模型做出的決策,與手動設計不同,這項工作利用了半自動化過程。這對跨領域、跨産業的機器學習應用産生關鍵促進作用,如電路設計、腦神經元、病原體研究等可視化模型搭建和運行推理。去年同期,OpenAI和Google發布了激活地圖集技術,以可視化機器學習算法做出的決策。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

