在具身智能競速加速升溫的當下,真實場景的客觀評測成為檢驗機器人模型能力最關鍵的一環。
近日,“具身進化論”在查詢最新發布的RoboChallenge測試結果時注意到,π0、π0.5 在成功率上遙遙領先其他開源模型。自變量機器人(X Square Robot)的大模型wall-oss-flow雖然在多次企業自我宣傳中提到,“基本上和PI、和google在同一個水平線上”,但是在多個任務上成功率偏低。根據公開的測評記錄,其在31次測試中大部分成功率為零,這一表現引發業内對其大模型真實能力的讨論。
RoboChallenge是全球首個具身智能的大規模真機評測平台,也是目前行業内最受關注的真實物理機器人評測平台,由Dexmal原力靈機聯合Hugging Face發布,被視作“機器人界的硬核基準”。其最大特點是真機真測:評測同時接入UR5、Franka、Aloha雙臂系統以及國産ARX-5四類主流機器人,統一軟件棧并配備多台RGB-D深度相機,以确保任務在高度一緻的物理條件下進行。
平台的任務覆蓋柔性物體處理、雙臂協作、多階段順序動作等真實世界的關鍵難點。其中Table30場景包含30個具有代表性的日常任務,包括疊抹布、整理果籃、插花、開關水龍頭等,難度從基礎操作遞進到長鍊條組合動作。
據了解,RoboChallenge之所以被認為更加客觀,是因為其采用了 “任務成功率+進度評分”的雙指标體系。前者統計任務是否完整成功,後者将任務拆解為多個關鍵階段并按推進程度累計分值,即便任務未完成也能反映模型做到哪一步,為能力評估提供更細粒度的信息。
在該評測體系中,多款主流開源模型已完成測試。“具身進化論”對比發現,基于Physical Intelligence(Pi)系列構建的π0和π0.5是官方重點基線,它們在成功率與進度得分上整體領先其他開源模型,特别是π0.5,顯示出更成熟的任務執行能力。

π0測試結果

π0.5測試結果
相比之下,自變量的wall-oss-flow在相同條件下的表現明顯偏弱。測評結果顯示:wall-oss-flow共測試31次,其中2次成功率為60%,1次成功率為50%,1次成功率為20%,其餘所有任務成功率均為0。

wall-oss-flow測試結果
“具身進化論”從進度分情況看到,模型雖然在部分任務中能完成初段動作,但多數情況下未能完成關鍵步驟,執行鍊條往往在中段被迫中斷。這與平台強調的“多階段連續操作能力”形成明顯差距。
公開信息顯示,自變量2023年成立,創始人兼CEO為王潛。今年9月,自變量發布其開源大模型WALL-OSS,自變量在官方宣傳稿中強調該模型“具備強大的泛化性和推理能力,在長程操作任務方面表現優于其他基礎模型”。
王潛甚至曾在接受媒體采訪時表示:“我們(自變量)的模型水平基本上和PI、和google在同一個水平線上。”
但此次RoboChallenge的評測結果顯示,自變量模型的水平、能力在真實機器人執行任務時未能體現,與PI的模型(π0和 π0.5)也存在明顯差距。
一位具身智能從業者對“具身進化論”分析,RoboChallenge的獨特價值正是在于提供透明、可複現的真機評估環境,避免主觀展示帶來的偏差。随着越來越多模型加入測評,業内對“模型真實能力差異”有了更清晰的認知。
對具身智能行業而言,此次結果再次提醒:真正的競争不在PR宣傳中,而在三方認可的評測,學術基準線,以及機器人能否穩定完成任務的那一刻。
真實世界,正在成為檢驗大模型能力的最終标準。而認識到差距,正是追趕的開始。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

