
本文摘自《雲栖戰略參考》,這本刊物由阿裡雲與钛媒體聯合策劃。目的是為了把各個行業先行者的技術探索、業務實踐呈現出來,與思考同樣問題的 “數字先行者” 共同探讨、碰撞,希望這些内容能讓你有所啟發。
2024 年年初,Sora 的問世讓視頻生成賽道成為了全球 AI 界矚目的焦點。自 2023 年創立的愛詩科技一直布局海外 AI 視頻市場,對賽道内變化感受深刻 —— 此前市場仍在 “實驗創意” 階段,直到 Sora 震撼了行業内外,吸引了資本和媒體的目光,讓視頻生成從 “小衆玩具” 直接提升到戰略高地,全球科技巨頭也紛紛入局。
如何搶占先機并吸引用戶生成 AI 視頻?愛詩科技選擇加速技術疊代 —— 自公司成立以來便聚焦視頻大模型,在 Sora 發布前已推出首代模型 PixVerse,現已更新至第六代。如今,PixVerse(拍我 AI)已成為全球用戶規模最大、生成速度最快、質量最高的視頻大模型之一,短短兩年間,用戶量已突破 6000 萬。但這背後面臨的是克服技術疊代和出海拓展的雙重挑戰。對于一款布局全球的應用而言,如何有效利用分散在全球各地的數據進行有效訓練和提升?如何滿足當地合規需求的跨境數據傳輸?愛詩科技于今年和阿裡雲開始合作。
賦能多模态大模型全球布局
視覺内容正成為人們獲取信息最重要的媒介。但在短視頻平台上,大概隻有不到 10% 的用戶會創作或者發布視頻,因為大部分用戶都存在 “心理門檻”—— 怎麼拍好視頻、怎麼剪輯、怎麼配音配樂、怎麼讓自己創意發布之後不會讓朋友嘲笑...... 愛詩科技聯合創始人謝旭璋在今年 5 月份的阿裡雲 AI 出海峰會上表示,希望能用人工智能幫助全球這麼多沒有做過視頻的人,用視頻第一次來分享生活,傳遞情感,分享快樂。
不過,這一看似簡單的想法背後面臨的是技術實現的現實挑戰。與文生文的大語言模型不同的是,多模态視頻大模型需要處理多模态的數據,對 GPU 的顯存能力提出了更高的要求。與此同時,C 端用戶對生成視頻速度要求高,在高并發的場景下,如何降低多模态大模型的推理延遲,給用戶帶來更好的使用體驗?
在愛詩科技緻力于多模态大模型産品落地的過程中,主要面臨着三大挑戰:首先是海量訓練數據的遷移與歸集問題;其次是實時數據處理能力的提升;最後則是優化資源利用效率,以實現提質增效的目标。
由于愛詩科技全球化的布局,緻使數據分散在世界各地,并且需要與線下 IDC 以及其他雲廠商進行資源的調用和交互,這就牽扯到了海量數據彙總以及跨區域傳輸數據。比如,愛詩科技訓練數據分布在全球多個地域,需要統一彙總管理,這就為整體訓練與推理過程中,大數據遷移和成本提出了挑戰。
同時,在底層視頻模型上,愛詩科技采取 Diffusion+Transformer (DiT) 架構,在模型訓練和推理過程中需要處理大量視頻、文本和元數據,對數據庫的實時分析、多模态數據處理和高并發的查詢效率提出了較高要求。
此外,愛詩科技對訓練和推理平台的性能要求高,需要提升資源利用率和産品界面使用體驗。計算資源方面,因為愛詩科技全球化的布局,尤其是在北美洲、中美洲、歐洲等地區用戶群體較大,對于該地區的本地計算節點需求大。而自建成本高,且建設周期長,所以對于愛詩科技而言,亟需一家具備全球化雲計算節點布局能力的服務商,承擔其在海外的業務負載。
因為多模态大模型相對大語言類模型而言,對 GPU 的使用率及要求更高,且愛詩科技業務具有較強的雲計算彈性能力需求,這也對其雲服務商的 GPU 彈性計算能力提出了更高的要求。
此外,謝旭璋指出,愛詩科技的業務由于采用了多模态大模型,對多模态數據處理提出了更高的技術要求。這不僅體現在對 GPU 芯片的高利用率需求上,還對并行計算能力提出了更為嚴苛的标準。此外,鑒于其全球化布局及龐大的用戶基礎 (超過 6000 萬用戶規模),也需要高并發雲計算彈性确保為用戶提供穩定、高效的服務體驗。
除了對于雲計算性能上的要求之外,對于初創型企業而言,成本也是一個不能不談的話題,對于愛詩科技而言亦是如此。
具體來看,作為一個成立兩年多的團隊,愛詩科技雖然在大模型研發與應用方面有着豐富的經驗,并保持高度靈活性。僅兩年時間,公司已成功疊代六代大模型産品。在快速疊代産品的過程中,如何以更低成本、更高效地利用雲計算的能力,成為了愛詩科技和阿裡雲共同關注的核心方向。
雲上部署:讓全球化業務輕裝上陣
如何服務好短短兩年間内積累了超過 6000 萬名用戶?愛詩科技的答案是:找到一個靠譜的全球化雲服務商。在 2023 年年底,愛詩科技決定布局海外市場之初,就與阿裡雲展開了深度合作。
最初,愛詩科技選擇與阿裡雲合作,主要是因為阿裡雲在全球範圍内擁有廣泛的雲服務節點,并且具備強大的雲計算彈性能力。目前阿裡雲在全球 29 個地域運營着 89 個可用區,是亞太規模第一的雲服務商。愛詩科技決定與阿裡雲一同探索多模态視頻生成大模型如何為全球化海量用戶提供優質的體驗和服務。
首先,在跨區域數據傳輸方面,為了滿足 “訓練數據統一處理” 的業務需求,愛詩科技經由阿裡雲的多 EIP 和共享帶寬等方式方法提升公網下載速度,通過 OSS 跨區數據複制實現了全球異地容災備份以及全球數據加速分發加速。
在數據處理方面,愛詩科技最初采用的是關系型數據庫,然而愛詩科技的數據分布廣泛,遍布全國乃至全球各地,海量數據的高效彙集與處理面臨挑戰。在經過權衡之後,愛詩科技選擇開始使用阿裡雲實時數倉 Hologres,基于分布式架構的 Hologres,支持 PB 級數據分析且具備高效的數據壓縮能力,通過實時寫入與更新機制實現低延遲響應,在解決愛詩科技性能瓶頸問題的同時,還滿足了實時數據分析和高并發的需求。
在此基礎上,愛詩科技還選擇了使用阿裡雲人工智能平台 PAI 平台支持大模型的訓練。PAI 平台是一款面向企業級用戶和開發者的一站式 AI 平台,作為模型訓練與推理的一站式平台和一體化智算管理與調度系統,為開發者、模型創新者提供了底層核心技術支持。在接入 PAI 平台之後,愛詩科技可以将更多的精力放在其專注的大模型疊代研發上,搭建、調優和運維等操作完全不需要其操心,随時可以使用高擴展性、高性能、高性價比的 AI 訓練資源和環境,愛詩科技實現了靈活的、細顆粒度的資源管控,滿足了高效、動态的調度和無感切換需求,提升算力利用率,以更小的硬件成本,獲得更大的算力供給。
與此同時,阿裡雲通過采用标準化雲資源調度系統,搭建統一架構,從而能幫助愛詩科技實現全球資源調度,确保跨國業務體驗一緻性,并且可以憑借全球範圍内的雲基礎設施覆蓋,幫助愛詩科技實現業務就近部署在确保了業務的一緻性與低延時的同時,還能節省數據傳輸過程中的成本,從而降低整體業務成本。
提質、高效,全都要
在出海尋求新增量的同時,企業近年來都開始尋求提質增效的路徑,愛詩科技也不例外。
多模态大模型底層數據集的規模比大語言類模型所需數據集規模大很多,且數據标注成本相對較高。
以大模型提示詞場景為例,因為愛詩科技的大模型産品相較于傳統的文生視頻的大模型存在些許差别。傳統文生視頻大模型提示詞需要用戶自己撰寫,愛詩科技的文生視頻大模型為了讓全體用戶都能獲得比較好的使用體驗,采用了模塊化提示詞的模式,相較于傳統模式模塊化提示詞在應用過程中,對于算力波動性需求較大,還需要同時進行文本解析和高分辨率圖像渲染的操作,對 GPU 顯存,以及并行計算能力要求相對較高。為此,愛詩科技也對阿裡雲提出了新的需求 —— 實現跨模态數據交互機制,這其中還包括了緩存的高性能處理等需求。
基于此,阿裡雲通過數據加載優化和集群通信優化 ACCL 通信庫大幅提升 GPU 利用率,通過分布式訓練管理平台、雲原生交互式編程環境以及訓練加速框架,大幅提升了 AI 作業效率。
除此之外,在整體雲性能表現層面,阿裡雲提供自助式雲架構管理産品,讓愛詩科技省去了開發部署的時間。在最近的一次部署中,愛詩科技采用了 CADT (雲速搭) 的部署方式,實現了分鐘級 GPU 雲服務器部署和業務上線,顯著降低了應用雲上管理的難度和時間成本。同時,愛詩科技還可以對雲上架構方案的成本、部署、運維、回收進行全生命周期的管理。
相對于愛詩科技這樣的視頻生成初創公司而言,其團隊在大模型領域擁有深厚的專業知識和技術積澱,但在優化雲服務、确保安全可靠的同時最大限度地降低雲計算成本等方面的經驗仍略有欠缺。
面向這樣的初創企業,阿裡雲提供的也不僅是産品,更為其提供了 “管家” 式的服務,不僅會分享最佳實踐的案例,還會手把手傳授如何更好利用雲服務彈性能力、如何利用好雲安全中心确保安全等方面的經驗。
而這種做好用戶底層 “管家” 的模式,用戶可以将更多的精力專注在業務層的開發上面,一方面省去了底層基礎架構方面的框架搭建與後續運維時間;另一方面,也讓缺乏雲應用經驗的企業避免了在使用雲計算賦能業務過程中,出現浪費資源、操作不當等情況的發生。
接下來,愛詩科技将與阿裡雲深化雲資源合作,為全球 AI 視頻生成用戶提供更加穩定、高效的服務。雙方将擴大在雲計算、數據存儲及大模型應用等多個領域的合作,推動 AI 視頻生成技術的持續發展。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.


