在過去一年,AIGC 以星星之火,點燃全球燎原之勢。如今巨變仍在進行,各行各業積極擁抱技術變革,帶來諸多智能應用創新。然而開發者在實際落地 AIGC 的過程中,如何做技術選型?如何将前沿技術有效地融入現有業務流程,兼顧實用性和用戶體驗?如何加快前沿技術落地,進而推動産業升級?
6 月 15 日, 由騰訊雲 TVP 與 CSDN 聯合主辦的「 AIGC 落地的正确姿勢 —— Techo TVP 技術沙龍」活動在上海舉辦,本次沙龍彙聚 AI 領域産學研代表、技術大咖,聚焦 AIGC落地思考與應用實踐,分享、最實用的案例,一同探讨如何加快 AI 應用的創新步伐。

從科研到實踐的深度探索
數智人“嬌嬌”全解析

上海交通大學電子工程系教授&圖像所副所長、騰訊雲 TVP 宋利
未來已來,數字人已滲透到各行各業,成為新一代的生産力和創造力。從科研到實踐,數智人“嬌嬌”的誕生,既是技術的集成展示,也是對個性化、互動性未來的創新探索。
上海交通大學電子工程系教授&圖像所副所長、騰訊雲 TVP 宋利在《科研到落地:“數智人-嬌嬌”》的演講中,先是回顧近五年來數字人技術的演變曆程,梳理當前數字人技術的前沿進展,如基于語音驅動的運動穩定的數字人視頻合成,基于顯式、隐式記憶增強的語音驅動數字人合成,身份匹配對應學習的高保真人臉驅動,基于解耦潛在運動表征的高保真數字人驅動、高保真音頻驅動的歌唱數字人合成等創新研究。
不僅探索學術研究,宋教授還帶領團隊積極進行技術落地,推出數智人“嬌嬌”項目。“嬌嬌”以一位擅長直播的同學為原型,通過拍攝綠幕視頻并結合聲音數據進行訓練而成,“嬌嬌”可以進行對話聊天、口播、歌曲演唱、新聞播報、健康顧問、多語種口譯等工作。“嬌嬌”不僅體現了數字人在娛樂、教育等領域的廣泛應用潛力,還作為高校虛拟數字人主播,引發廣泛關注。
如今數字人向更廣泛的商業和社會應用場景邁進,與此同時,數字人行業存在政策風險和商業模式不确定性等挑戰。在宋教授看來,盡管 ToC 市場吸引力大,但 ToB 領域因成本效益和應用深度,展現出更大的商業潛力。數字人處于快速發展中,不僅在形象創造上不斷進步,也在向更複雜的動作、情感交互等方向探索。展望未來,結合高質量的交互能力将是未來數字人發展的重要方向。
騰訊混元大模型賦能AIGC應用落地
推進産業智能化升級

騰訊雲大模型産品專家 屈蕾
騰訊混元大模型曆經疊代日趨成熟,堅持全鍊路自主研發技術,支持衆多場景的創新應用,實現技術與應用同行,期待更多開發者與企業加入,共創大模型應用新紀元。
騰訊雲大模型産品專家 屈蕾在《騰訊混元大模型全場景 AIGC 應用實踐》的主題演講中介紹,騰訊混元大模型是騰訊全鍊路自主研發的通用大語言模型,自 2023 年 9 月上線以來,經曆多輪疊代,騰訊混元大模型不斷成長、性能不斷提升,現已擁有萬億級參數規模,從稠密模型架構向稀疏化架構演進,孵化不同的模型形态,采用混合專家模型 (MoE) 結構,提高訓練和推理效率及專業領域适應性,具備強大的中文創作能力。
騰訊混元大模型構建三層自主可控的國産大模型全棧技術架構:上層為自研高速網絡互聯來支撐模型訓練,預計 2024 年将達到單集群 10 萬卡規模,低端卡也能訓練萬億參數大模型;中層為自研 Angel 大模型訓練和推理平台,可高效調度異構卡集群,将萬億大模型的推理成本較開源模型下降 70%,并持續優化;底層是采用混合專家模型 (MoE) 結構。
騰訊混元大模型在 SuperClue 和沙利文報告等第三方測評中獲得高度評價,效果居于國内第一梯隊。目前混元大模型已接入 600+ 騰訊内部業務,其應用場景廣泛,如騰訊文檔 AI 智能助手輔助文案創作、騰訊會議 AI 小助手自動總結、智能數字人和遊戲 npc 的角色扮演能力增強用戶體驗、AI 代碼生成等,實現技術與應用同行,充分釋放生産力。
此外,騰訊混元大模型在多模态能力上也持續疊代升級。在生圖領域,騰訊混元文生圖基礎架構已全面升級至 Sora 同款的 DiT 架構,支持中英文雙語輸入及理解,具備多輪繪圖能力,測評結果國内;在生視頻領域,騰訊混元支持文生視頻、圖生視頻、圖文生視頻、視頻生視頻等多種視頻生成能力,已經支持 16s 視頻生成;在生 3D 層面,騰訊混元已布局文/圖生 3D,單圖僅需 30 秒即可生成 3D 模型。
目前,騰訊混元大模型多模态能力已通過騰訊雲以 API 形式面向企業用戶和開發者開放,在廣告、電商、傳媒、遊戲、教育等不同行業落地應用。其中,混元生文提供了萬億參數 hunyuan-pro、千億參數 hunyuan-standard、百億參數 hunyuan-lite等多種尺寸的模型服務,期待更多夥伴與開發者加入,共同探索大模型的邊界與新應用場景,攜手推進大模型技術創新發展。
解讀QQ影像中心AIGC創新與實踐
釋放AI無限潛力

QQ專家算法研究員 程培
面對日新月異的 AIGC 技術發展,QQ 構建 AIGC 技術體系,持續推出系列創新工具和應用,賦能用戶個性化内容創造,積極探索 AIGC 的廣泛應用潛力與價值。
QQ 專家算法研究員 程培在《QQ 影像中心 AIGC 的創新和應用》的分享中談到,目前 QQ 在基礎層,打造出語言以及圖文大模型、3D 生成大模型;在組件層,擁有圖片/視頻生成技術,3D 數字資産生成技術;在應用層,QQ 相機、小程序、天天 P 圖、超級 QQ 秀等均已融入 AIGC 技術。
QQ 影像中心在幾年前開始部署研究 AIGC 技術,目前取得一些進展:Diffusion 模型廣受熱議,然而在落地的過程中,面臨畫面構圖不穩定、語義質量差等效果瓶頸,優質結果生成投入成本高等性能瓶頸。早在 2022 年,程培團隊針對 Diffusion 模型進行優化,從 0 到 1 搭建“優化-選型-生産-上線”流程,持續進行風格效果訓練積累,積累風格超 20 種。最終将優化後的技術應用到 QQ 小世界 520 活動上,得到用戶的熱烈讨論與關注。QQ 作為國内最早一批上線這類創新 AIGC活動,例如熱門 “異次元的我”,用戶隻需上傳一張自己的照片,就能通過 AI 識别,一鍵生成與自己十分相像的漫畫圖片,當時的傳播率極高。
AI 寫真照最初用戶的使用門檻高,需要用戶上傳多張不同角度的照片,還要在線訓練,對機器資源消耗較大,且可能影響用戶體驗。如何在不進行後置微調的情況下,隻給一張人像照,讓 Diffusion 模型具備人臉 ID 的保持、變化、風格化等能力,使得模型的生成結果具備多樣性。對此,騰訊推出 FaceStudio,通過先進的混合人臉 ID 引導機制,在不犧牲個人身份特征的情況下,實現風格化的人物圖像合成。這項技術成功應用在 QQ 頭像定制館、七夕頭像等活動。
大多數擴散模型使用 CLIP 作為文本編碼器,這将可能限制它們理解複雜提示的能力,對此騰訊推出 ELLA,可将 LLM 與擴散模型無縫結合,将 LLM 能力注入擴散模型,提升現有文生圖模型語義匹配程度,還可輕松集成社區模型和工具,兼容社區生态。并進一步研發 EMMA 框架,解決角色一緻性生成問題,使同一人物在不同場景中保持一緻,實現連貫的視覺叙事。
在視頻生成上,實現穩定且風格強烈的視頻内容生成,展現在多人及單人場景中的良好應用效果,目前團隊将相關算法落地在 QQ 短視頻開發者開放平台。在 3D 生成上,打造超 Q 服飾紋理生成系統,落地超 Q 秀業務,給用戶帶來嶄新體驗。
開發者如何擁抱AI 2.0時代?

易編橙網絡科技 CTO、「程序員 : 職場效能必修寶典」作者 田傑
開發者積極擁抱 AI 2.0時代,通過在 AIGC 工具層與應用層創新,在細分領域創造價值,無需畏懼被技術替代,緻力成為利用 AI 提升業務與個人競争力的先行者。
易編橙網絡科技 CTO、「程序員 : 職場效能必修寶典」作者 田傑在《開發者如何擁抱AI 2.0 時代》中指出,随着 AIGC 的興起,普通開發者面臨被技術替代的焦慮,但同時存在轉型與機遇。田傑通過分析行業動态、市場數據等,幫助開發者理清思路,鼓勵開發者把握 AIGC 新機遇,通過持續學習和創新,成為 AIGC 的弄潮兒。
田傑鼓勵開發者不應局限于傳統編程語言的學習,更應關注如何結合 AI 技術提升個人競争力,利用智能體為用戶提供更高效、個性化的服務。他表示,“所有的 App 應用都值得用 AI 重新做一遍,這就是應用級開發者的機會”。盡管大型科技公司正積極布局大模型市場,但對于小型企業和個人開發者而言,專注于細分領域、創新業務模式和應用場景,利用好信息差和快速反應能力,如高考志願填報助手等,通過快速響應市場需求和提供定制化解決方案, 實現技術與市場的有效對接。
結語
随着 AI 技術飛速發展,AIGC 正從概念走向廣泛的應用實踐,為各行各業帶來前所未有的創新變革。在本次「 AIGC 落地的正确姿勢 —— Techo TVP 技術沙龍」,五位技術大咖從多角度分享前沿、多元的 AIGC 親身實踐,為開發者帶來諸多啟發。在各位嘉賓的精彩分享下,本次活動圓滿落幕。
未來,騰訊雲 TVP 将繼續攜手更多專家大咖,為開發者朋友分享更多幹貨技術和前沿洞察、落地實踐,獻上一場場精彩有料、有趣、有用的技術盛宴。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

