過去一年,全模态大模型持續突破,實現語言、視覺、音頻的統一建模與協同理解,成為人工智能走向通用智能的關鍵路徑。然而,現有評測體系多聚焦于單模态或事實性描述任務,缺乏對跨模态因果推理、反事實想象、時間動态理解等深層認知能力的評測。為加快推動全模态大模型能力評估,中國信息通信研究院(以下簡稱“中國信通院”)研究推出了“方升-全模态”大模型基準測試體系,覆蓋推理、生成及動态交互任務。近期,中國信通院組織完成了首期測試工作,最新體系和測試結果如下:
一、“方升-全模态”基準測試體系
全模态大模型評測體系構建遵循多維度、立體化原則:在數據構建層面,完善了從文本、圖像、音頻到長視頻序列、3D 點雲的全模态覆蓋,并引入了模态複雜度、場景真實性、人工偏好及視頻長度等多維度标注;在能力驗證層面,構建了推理、生成及交互任務三大核心任務,覆蓋反事實假設、時序因果、音視頻協同、3D 渲染與動态交互等關鍵認知與應用能力。具體測試框架如下:

本次評測聚焦全模态大模型的反事實推理能力,要求模型在融合文本、音頻與視頻信息的基礎上,完成假設性因果推理任務。這類推理是人類認知與決策的核心能力,對大模型而言,不僅需要識别并理解多模态内容,更要求其能夠針對與事實相悖的假設情境進行推演。反事實推理測試數據圍繞音視頻構建,兼容多模态組合,涵蓋多種視頻時長。題庫經多輪人工核驗,保障答案客觀唯一、評測嚴謹可靠。
二、測試結果
1.整體測試結果
評測模型包含閉源大模型、開源全模态大模型以及音頻-視覺大語言模型,整體測試結果如下:

測試結果顯示,一是人類基準大幅領先,人類回答平均準确率遠超被測大模型。二是開源模型與閉源模型之間仍存明顯差距,閉源大模型平均準确率高于開源全模态大模型。三是部分音頻-視覺大語言模型表現靠後,說明單純依賴音頻-視覺融合訓練難以實現高質量的反事實推理,而全模态聯合預訓練展現出優勢。
2.細粒度場景推理
場景層面聚焦藝術、體育、科學等十大領域開展評測,測試結果如下:

通過測試結果發現,各模型的場景能力呈現分化:在家居、個人護理等生活化場景中,模型表現普遍更優;而在文化政治、科學技術等專業知識領域,以及體育、音樂等需要複雜邏輯與時序理解的場景中,模型在跨領域知識融合與複雜因果推理上仍存在不足。
3.多模态輸入形式對比
測試對比模态輸入信息對模型推理的影響,測試結果如下:

通過測試結果發現,模型對不同模态輸入形式的有效性存在差異:一是音頻信息輔助能力有限,“音頻 + 文本”輸入下模型準确率普遍最低,純音頻難以提供足夠的場景與時序細節支撐;二是視覺信息對反事實推理起到關鍵作用,參評模型在“視頻 + 文本”輸入下準确率較高,說明時序視覺信息是構建因果鍊條的核心支撐;三是多模态融合尚未實現有效協同,大部分模型在“音頻 + 視頻 + 文本”全模态輸入下無法達到最佳表現,反映出當前模型的跨模态融合能力仍存短闆,未實現全模态的協同增益。
下一步重點方向
後續,中國信通院将聯合各界專家學者深入關注全模态大模型的推理、生成及動态交互能力,開展相關基準測試标準研制和全模态數據建設,推動全模态生态健康發展。“方升”基準測試将順應技術和産業發展需要,持續疊代更新。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

