全球AI創建技術再起高潮,影譜科技AI生成技術表現亮眼

2020-04-20 15:07:59 來源:鳳凰網科技
        【每日科技網】

  在新型冠狀病毒危機期間,視頻的使用變得普及,在教育、娛樂、社交、辦公等日常社會活動中越來越重要。

  與此同時,主要AI生成技術團隊公布新的研究及應用,包括Google AI、Microsoft AI、Facebook AI、Moviebook AI、TensorFlow、Open AI,以領導AI技術在抗疫中發揮關鍵作用。

  Google 使用AI 創建音頻,推出NeRF 做到多視角逼真3D 效果

  谷歌于上周宣布使用AI WaveNetHQ來大面積增強視頻通話的音頻質量,Google WaveNetHQ通過創建新的語音數據來填充音頻下降所造成的間隙。谷歌表示,其Duo應用程序通話中有99%會遇到不同音頻相關問題,有20%的通話損失超過3%的音頻,而10%的通話損失了近十分之一。AI是行之有效方法,AI經過訓練可以産生大部分音節音調,并且可以填補長達120毫秒的間隙。

  這一功能在Duplex AI中得以應用,并大面積實際應用。引援谷歌首席執行官桑達爾·皮查伊(Sundar Pichai)在博客中表示,在情況允許的情景下,谷歌計劃使用Duplex與英國企業聯系以了解營業時間,這是Duplex繼2018年5月演示後的規模現實應用,它将完成自主收集數據、觸發、創建數據集、結果分析的全流程。

  在視頻方面,谷歌和伯克利大學發布開源研究NeRF,隻需要輸入少量靜态圖片,就能做到多視角的逼真3D效果。NeRF可在複雜的遮擋下,展現場景中詳細的幾何體,在現實場景中,插入虛拟對象,實踐結果顯示3D圖像都比較逼真。

  Moviebook 使用AI 生成新視頻

  在本周,中國視覺技術應用企業Moviebook研究人員描述了其AI系統AGC引擎的訓練場景,運用視頻幀元素間的圖像耦合及語義邏輯關系,該引擎可生産質量更高的視頻,亦可用于其他 AI系統生成的視頻在其AGC上合成或新創建,以補充不完整的真實視頻數據集或損壞的樣本,生成一段全新視頻。據悉,此生成方法已經廣泛應用于中國影視、綜藝節目、短視頻、體育、資訊可視化等場景中。

  正如影譜科技研究人員所解釋的那樣,視頻合成領域的大部分工作都利用GAN(或由兩部分組成的神經網絡)組成,這些神經網絡由生成樣本的生成器和鑒别器組成,這些鑒别器試圖區分生成的樣本和真實樣本。它們具有很高的能力,但會遭受稱為模式崩潰的現象,在這種情況下,無論輸入如何,生成器都會生成有限的樣本多樣性(甚至是相同的樣本)。

  相比之下,影譜AGC的系統由代表視頻内容功能的變量,特定于幀的瞬時變量,生成器和遞歸機器學習模型組成。它将視頻分解為靜态部分,該部分捕獲所有幀共有的視頻的恒定部分,而一個瞬态部分表示視頻中所有幀之間的時間動态(即基于時間的事件驅動的周期性規律性),形成一個動作捕捉系統。該系統有效地共同學習了靜态和瞬态成分,并将其用于在推理時生成視頻。

  與幾種基準模型生成的視頻相比,研究人員表示,他們的系統所生成的視頻“在視覺上更具吸引力”,并通過更清晰的幀“保持一緻性”。此外,AGC展示了一種用于幀插入關聯圖像的訣竅,或者是一種視頻處理形式,其中在現有幀之間生成中間幀,以使動畫更加流暢,或插入商業化場景。

  Microsoft AI 開源跟蹤對象,實現抑制視頻通話中音噪

  Microsoft AI團隊本周發布FairMOT開源模型,用于多對象跟蹤對象檢測器,即使佩戴口罩也可使用面部識别技術識别患者。除此之外,還有許多其他用途,包括安全性和老人護理。

  與此同時,Microsoft Dynamics 365 AI Research研究人員協同加利福尼亞大學聖塔芭芭拉分校實驗室一項有關視頻和語言推理開源技術,其将顯著增強自動會議轉錄工具的效果和準确度,通過AI驅動的噪音抑制功能可自動消除視頻通話中的背景噪音。

  Facebook 推出RegNet ,将2D 照片轉換為3D

  上周,Facebook AI的研究人員推出了一種稱為RegNet的新網絡設計範例。根據實驗結果,RegNet模型在性能上勝過流行的EfficientNet模型,而在GPU上的速度可提高五倍。

  Facebook表示,借助AI,即使手機沒有雙攝或者人像算法,程序也可以将2D的照片轉換為3D照片。為此,Facebook訓練了一個神經網絡來“估算每個像素與相機的距離”,從本質上講,AI可以通過分析來給出景深信息,以此将照片轉換為3D。用戶還可以用它做更複雜的功能,比如更正照片問題、添加肖像效果、美化臉部,在晚上拍攝星星效果也會比正常的相機更清晰。

  OpenAI 推出神經元可視化

  OpenAI本周發布了Microscope,這是一個神經元可視化庫,從九個流行或主流框架神經網絡開始。該集合包含數百萬張圖像,可以幫助AI研究人員更好地理解具有成千上萬個神經元的神經網絡的結構和行為。

  使用可視化來解釋機器學習模型做出的決策,與手動設計不同,這項工作利用了半自動化過程。這對跨領域、跨産業的機器學習應用産生關鍵促進作用,如電路設計、腦神經元、病原體研究等可視化模型搭建和運行推理。去年同期,OpenAI和Google發布了激活地圖集技術,以可視化機器學習算法做出的決策。

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
    本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

猜你喜歡

千匠網絡實踐:如何讓大模型從“能用”走向“好用”

過去兩年,幾乎所有上規模的企業都接入了大模型。智能客服、知識問答、AI助手——這些應用已經算不上新鮮事。但在演示會議室與真實業務場景之間,一個顯著落差正在浮現:能聊天,但不理解企業業務語境;能生成内容

千匠網絡

1天前

海能達發布全新專業防爆PDT對講機CH690Ex

随着我國應急管理體系持續完善,消防救援任務正在從傳統火災處置,向化工園區事故、危險品洩漏、地下空間救援、大型綜合災害等多風險、多場景方向發展。在這些複雜環境中,救援現場往往面臨爆炸性氣體、可燃性粉塵、

2周前

海能達CCW 2026載譽收官:AI與融合通信引領專用通信新未來

6月16日至18日,2026年全球關鍵通信展(CCW2026)在英國倫敦舉行。展會期間,海能達集中展示了從終端到系統、從感知到決策的全鍊路創新版圖,AI與融合通信産品及解決方案貫穿三天展期,持續獲得高

1個月前

登陸歐洲 Intersolar!遠景AI電力系統支撐全球 AI 算力發展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,遠景科技集團發布面向AI數據中心的下一代電力基礎設施——融合風光儲一體化方案、固态變壓器(SST)、800V直流供電、儲能

1個月前

海能達六度問鼎ICCAs,PDC650與西安機場方案摘得雙獎

6月17日,2026年國際關鍵通信獎(InternationalCriticalCommunicationsAwards,ICCAs)在英國倫敦舉行的全球關鍵通信展(CCW2026)期間正式揭曉。海能

1個月前

海能達即将亮相2026年CCW全球關鍵通信展: 攜AI與融合通信解決方案登陸倫敦

6月16日至18日,2026年CCW全球關鍵通信展将在英國倫敦啟幕。作為全球領先的專用通信解決方案提供商,海能達将以全場景關鍵通信産品矩陣亮相F25展位,集中展示面向公共安全、應急救援、城市治理等領域

1個月前