《ScienceBoard:首個真實科研工作流多模态智能體評測框架問世》

2025-06-27 09:53:13 來源:每日科技網
        【每日科技網】
《ScienceBoard:首個真實科研工作流多模态智能體評測框架問世》

  一、科研 AI 新紀元:從 "分析者" 到 "執行者" 的跨越

  當 AI 智能體能夠自主操作生物建模軟件模拟蛋白質結構、調用天文模拟器分析星體軌迹,并将結果自動整理成 LaTeX 文檔時,科學研究正迎來前所未有的變革。香港大學聯合多所機構發布的 ScienceBoard,作為面向真實科研任務的多模态智能體評測環境,揭示當前最強 AI 模型在複雜科研工作流中的平均成功率僅 15%,為 "AI 科學家" 的發展指明了關鍵突破方向。

  二、背景與挑戰:科研智能體的現實困境

  1. 科研任務的三維複雜性

  工具多樣性:生物信息學需 Python 編程、天文研究依賴 AlmaPy 庫、地理信息分析要調用 QGIS 插件

  流程長周期:蛋白質結構預測需經曆序列輸入→模型構建→能量優化→結果驗證 4 個階段

  跨模态交互:既需理解論文文本指令,又要處理軟件界面視覺信息,還要生成命令行操作

  2. 現有評測體系的雙重缺失

  

評測類型 優勢 科研場景适配缺陷
WebArena 等 通用軟件交互能力測試 缺乏科學領域專業工具支持
ScienceQA 等 科學問題理解評估 無法模拟真實操作流程

 

  三、ScienceBoard 架構:重構科研智能體評測生态

  1. 多領域科研環境基建

  六大學科集成

  雙模态操作接口:同時支持 GUI 像素級點擊(如 PyMOL 分子旋轉操作)與 CLI 命令行(如gmx energy -f md.log)

  自動評估機制:開發 128 個領域特異性評估函數,支持數值匹配(如能量計算誤差≤0.5kcal/mol)、狀态對比(如文件生成完整性)

  2. 通用動作空間定義

  基礎操作:CLICK[x,y]、TYPE["command"]、SCROLL[Δy]

  功能

  ocall_api:調用 NASA 天文數據接口

  oanswer:生成科研結論自然語言描述

  workflow_control:DONE/RETRY/ABORT 流程控制

  四、評測集構建:169 個真實科研任務的挑戰層級

  1. 任務設計方法論

  人工 + 程序驗證:由領域專家基于軟件手冊設計任務,經 3 輪交叉驗證确保可行性

  典型任務示例

  生物化學:使用 PyMOL 生成新冠病毒刺突蛋白 RBD 區域的 3D 結構圖并導出為 PDF

  天文學:在 Stellarium 中模拟 2025 年 7 月 4 日火星沖日現象并測量視星等

  跨領域任務:用 Python 處理 QGIS 導出的植被指數數據并生成趨勢分析圖表

  2. 四級難度體系

  

難度等級 占比 核心能力要求 典型任務
Easy 54% 單步操作 / 基礎配置 安裝 Python 科學計算庫
Medium 28% 多步邏輯 / 跨模态跟蹤 用 MATLAB 繪制黑體輻射曲線
Hard 17% 長程規劃 / 多軟件協作 用 VASP 計算石墨烯能帶結構
開放問題 1% 領域創新 / 未知場景探索 設計新型催化劑篩選工作流

 

  五、實驗發現:當前智能體的能力斷層

  1. 整體性能表現

  商業模型:GPT-4o 成功率 15.2%,Claude 3.5 達 14.8%

  開源模型:InternVL3 在地理信息任務中表現突出(27.3%),但天文學任務僅 8.1%

  專業模型:OS-ATLAS 在 GUI 操作任務中成功率比通用模型高 9.4%,但長流程任務失敗率超 60%

  2. 失敗原因解構

  執行策略失誤:38% 的失敗源于點擊位置偏差(如誤觸軟件菜單按鈕)

  領域知識缺失:29% 因不理解科學概念導緻操作錯誤(如錯誤設置 DFT 計算精度)

  長程規劃不足:23% 在多步驟任務中遺漏關鍵環節(如未保存中間計算結果)

  六、未來路徑:構建 "科研 AI 團隊" 雛形

  1. 模塊化分工實驗

  規劃 - 執行解耦

  plaintext

  GPT-4o(規劃) + UGround(執行) → 成功率提升至28.7%(+13.5%)

  領域專家模型:引入 ChemBERTa 處理化學任務,相關場景成功率提升 11.2%

  2. 三大發展方向

  知識融合:開發基于科研手冊的任務相關學習機制

  系統架構:構建可編排的 "planner+executor+domain expert" 協作框架

  物理延伸:從虛拟環境走向實驗室機器人控制接口

  七、結語:AI 科學家的黎明之光

  ScienceBoard 的實驗數據揭示了一個雙重現實:當前智能體在科研任務中的表現仍遠低于人類專家,但模塊化設計與領域知識融合已展現顯著提升潛力。正如項目負責人孫秋實所言:"我們不僅提供了評測基準,更定義了 AI 科學家的能力坐标系。" 随着 ScienceBoard 開源生态的完善(項目地址:https://qiushisun.github.io/ScienceBoard-Home/),科研智能體正從概念走向真實實驗室,為科學發現注入前所未有的自動化動力。

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
    本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

猜你喜歡

SpaceX星鍊在軌超9900顆 今年28次獵鷹9發射助力逼近萬顆裡程碑

2026年3月6日綜合報道,截至目前,SpaceX旗下星鍊(Starlink)衛星在軌數量已突破9900顆,距離1萬顆的裡程碑僅一步之遙。與此同時,SpaceX在2026年已順利完成28次獵鷹9号火箭

4個月前