近日,科大訊飛研究院與認知智能全國重點實驗室聯合團隊在Nature旗下《通訊-化學》發表論文,系統揭示了當前多模态大模型在化學推理任務中的能力邊界與技術瓶頸。這是繼核聚變等離子體建模、智能化工大模型等成果之後,科大訊飛在科學智能方向的又一重要進展。

一項“照鏡子”式的研究
與此前聚焦具體應用場景不同,此次發表的研究更像是一面“鏡子”——它的核心價值不在于解決某個具體問題,而在于系統性地檢驗當前AI在科學推理領域的真實水平。
研究團隊從二十餘年美國化學奧林匹克競賽中精選473道圖文結合題目,構建了名為USNCO-V的多模态評測基準,随後對包括GPT-5、Gemini-2.5-Pro在内的40款主流大模型進行了全面測試。
結果喜憂參半。喜的是,頂尖模型GPT-5準确率達93.2%,大幅超越人類選手44.6%的平均水平;憂的是,研究首次發現了“視覺失配效應”——部分模型在移除圖像輸入後,答題準确率反而提升,說明當前多模态AI在處理科學圖像時,視覺與語言模塊尚未形成有效協同。
此外,分子結構識别與實驗裝置理解仍是各類模型的共同短闆。這些發現為行業指明了下一階段的攻關方向。
大模型國家隊的科學智能版圖
将此次研究置于科大訊飛整體戰略中觀察,其布局脈絡更加清晰。
作為人工智能國家隊核心成員,科大訊飛依托認知智能全國重點實驗室,近年來在AI for Science領域多線并進:
在科研基礎設施層面,與中國科學院共建的“星火科研助手”已覆蓋全國1300餘所高校,服務17萬餘名科研人員,累計功能調用近400萬次;
在垂直領域應用層面,聯合中科院大連化物所打造的智能化工大模型已疊代至3.0版本,并在《催化學報》發表700億參數的ChenELLM大模型;與中國科學技術大學合作的PaMMA-Net模型則突破了核聚變等離子體磁測量演化建模瓶頸,成果發表于《Nuclear Fusion》;
在基礎能力建設層面,其自研的化學基礎科學大模型在分子理解任務上較GPT-4o提升超15%,此次發表的評測基準則為行業提供了标準化的能力檢驗工具。
值得關注的是,科大訊飛在技術路線上始終強調全棧自主可控,其星火大模型從底層算力到核心算法均采用全國産方案。在當前國際科技博弈背景下,這一堅持的戰略意義不言而喻。
科學智能賽道的競争邏輯
與通用大模型的“百模大戰”不同,AI for Science賽道的競争邏輯更強調深度耕耘與生态構建。
一方面,科學問題的複雜性決定了技術突破需要長期積累,難以通過短期資源堆砌實現彎道超車;另一方面,科研場景高度依賴專業數據與領域知識,誰能率先打通“數據-模型-場景”的閉環,誰就有望建立起持久的競争壁壘。
從這個角度看,科大訊飛的布局思路頗為清晰:以全國重點實驗室為技術底座,以星火大模型為能力引擎,以高校科研院所為核心用戶,逐步構建起覆蓋多學科的科學智能生态。
當AI從“替代重複勞動”走向“加速科學發現”,一個更具想象空間的市場正在打開。而對于早已将科學智能納入核心戰略的科大訊飛而言,這場競賽才剛剛進入中場。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

