超級文生視頻模型Sora正式來了!多模态訓練數據是關鍵

2024-12-17 14:41:36 來源:i黑馬
        【每日科技網】

  OpenAI聖誕季“十二連發”的第三個工作日,迎來了重頭戲——萬衆期待的OpenAI視頻生成模型Sora正式版發布!

  OpenAI官方甚至直言 :“Sora就是我給你們的假期禮物。”

超級文生視頻模型Sora正式來了!多模态訓練數據是關鍵

  今年2月,Sora問世便以其卓越的表現震撼了科技屆。而此次OpenAI發布更的Sora Turbo,在生成視頻的速度和效果上,顯然更快、更強!

01 Sora的創新表現

  整體來說,Sora展示的一系列功能,在視頻生成的質量、功能的獨創性、技術的複雜度等方面,超出了目前市場上已有的文生視頻産品。

  OpenAI在直播中介紹,Sora支持從480p到1080p的全系列分辨率,單個視頻最長可達20秒。用戶可以通過文本描述(文生視頻)、圖片(圖生視頻)以及現有視頻(視頻生視頻)來生成視頻内容。

  特别值得一提的是,Sora上線全新UI界面以及豐富的編輯工具,以便創造者對視頻進行修改、創建、擴展、循環、混合。

  例如,Storyboard(故事闆)允許用戶通過時間軸來控制視頻内容,添加分鏡頭,以及調整動作或畫面的持續時長。Re-cut(剪輯)是在故事闆上對視頻進行修剪和延展,實現更的視頻編輯。Blend(混合)則是将兩個視頻内容進行過渡和融合,創造出新的視覺效果。

02 Sora的技術原理

  OpenAI已經給我們展示了Sora的“全能進化”。這些獨特的創新功能極大地拓展了創作者的創作空間,讓視頻更接近創作者的自我表達、幫助他們完成一個理想的鏡頭故事。

  如此強大的功能背後有哪些黑科技,Sora是怎麼做到的?

  Sora的設計靈感來源于大型語言模型(LLM),通過訓練互聯網規模數據來獲得通用能力。大語言模型使用文本标記,而Sora則使用之前已被證明是用于視覺數據模型的有效表示的視覺“碎片/補丁”(patches)來達到類似效果。

  OpenAI首先通過對視頻進行時間和空間上的壓縮,将其壓縮到一個更低維的潛在空間(可将這個潛在空間看做是時空碎片的集合),然後将原視頻轉化為這些碎片/補丁(patches)。讓它們充當像轉換器中的标記符号一樣的角色,使Sora模型可以在不同分辨率、持續時間和寬高比的視頻和圖像數據集上進行訓練。

  然後,Sora利用一種基于Transformer的模型,根據給定的文本提示和已經提取的空間時間補丁,開始生成最終的視頻内容。在這個過程中,模型會“塗改”初始的噪聲視頻,逐步去除無關信息,添加必要細節,最終生成與文本指令相匹配的視頻。

  此外,訓練從文本到視頻的生成系統,還需要大量帶有對應文本字幕的視頻。為此,OpenAI借鑒了DALL-E 3中提出的re-captioning技術,将其應用到視頻上。首先訓練了一個高度描述性的字幕模型,之後用它為訓練數據集中的所有視頻生成文本字幕,以此來提高文本逼真度以及視頻的整體質量。

超級文生視頻模型Sora正式來了!多模态訓練數據是關鍵

03 文生視頻模型背後的數據

  總的來說,Sora模型憑借其強大的數據處理能力和深度學習能力,成功地将文字與視頻内容緊密地聯系在一起,為用戶帶來了前所未有的視頻生成體驗。這個模型就像是AI的“大腦”,裡面存儲了海量的視頻和圖像信息。通過不斷學習這些數據,模型得以建立對現實世界中各類場景、情境、運動規律以及人類活動特征的深度理解和精準捕捉。

  其中,高質量視頻訓練數據在提升輸入文字與生成内容匹配度方面扮演着至關重要的角色。不僅能夠提升模型的性能,還能夠為用戶提供更加真實、準确和連貫的視頻生成體驗。

  标貝科技始終專注于為企業提供高質量的精标數據服務以及豐富的多模态數據資源。針對大模型數據需求,我們精心打磨了多模态大模型數據解決方案,覆蓋從數據采集、預處理、清洗、标注到質檢等系列工程化流程,積累了高質量的多模态大模型訓練數據集,為客戶打造優質的服務體驗。

04 标貝科技多模态大模型訓練數據-視頻caption數據集

視頻caption數據樣例1:生活

#FormatImgID_2#

視頻caption數據樣例2:運動類

超級文生視頻模型Sora正式來了!多模态訓練數據是關鍵

視頻caption數據樣例3:動物類

超級文生視頻模型Sora正式來了!多模态訓練數據是關鍵

視頻caption數據樣例4:其他

超級文生視頻模型Sora正式來了!多模态訓練數據是關鍵

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
    本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

猜你喜歡

海能達發布全新專業防爆PDT對講機CH690Ex

随着我國應急管理體系持續完善,消防救援任務正在從傳統火災處置,向化工園區事故、危險品洩漏、地下空間救援、大型綜合災害等多風險、多場景方向發展。在這些複雜環境中,救援現場往往面臨爆炸性氣體、可燃性粉塵、

2周前

海能達CCW 2026載譽收官:AI與融合通信引領專用通信新未來

6月16日至18日,2026年全球關鍵通信展(CCW2026)在英國倫敦舉行。展會期間,海能達集中展示了從終端到系統、從感知到決策的全鍊路創新版圖,AI與融合通信産品及解決方案貫穿三天展期,持續獲得高

4周前

登陸歐洲 Intersolar!遠景AI電力系統支撐全球 AI 算力發展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,遠景科技集團發布面向AI數據中心的下一代電力基礎設施——融合風光儲一體化方案、固态變壓器(SST)、800V直流供電、儲能

1個月前

海能達六度問鼎ICCAs,PDC650與西安機場方案摘得雙獎

6月17日,2026年國際關鍵通信獎(InternationalCriticalCommunicationsAwards,ICCAs)在英國倫敦舉行的全球關鍵通信展(CCW2026)期間正式揭曉。海能

1個月前

海能達即将亮相2026年CCW全球關鍵通信展: 攜AI與融合通信解決方案登陸倫敦

6月16日至18日,2026年CCW全球關鍵通信展将在英國倫敦啟幕。作為全球領先的專用通信解決方案提供商,海能達将以全場景關鍵通信産品矩陣亮相F25展位,集中展示面向公共安全、應急救援、城市治理等領域

1個月前

海能達再獲第十一屆廣東專利獎:持續自主創新,構築專用通信知識産權高地

近日,廣東省市場監督管理局正式公示第十一屆廣東專利獎評選結果。海能達通信股份有限公司申報的“一種集群通信系統的組派接方法、通信系統及存儲介質”(專利号:ZL201811296617.7)榮獲廣東專利優

1個月前